动态

分析潜在规划梯度下降失效原因,提出曲率正则化修复

Zhuokai Zhao
潜在世界模型在学到的表示空间中学习可微动力学,这应该使得规划像梯度下降一样简单。但几乎从未奏效。我的意思是,在测试时,你可以将动作序列视为可学习参数,展开冻结的世界模型,测量预测最终状态与目标的距离,并通过整个展开链反向传播以直接优化动作。然而,许多有效的系统(如Dreamer、TD-MPC2、DINO-WM)放弃这种做法,转而使用基于采样的搜索。这就是为什么我非常喜欢@yingwww_、@ylecun和@mengyer的这篇新论文,它清晰诊断了原因并给出了原则性修复。每个人放弃动作梯度下降的原因是规划目标在学到的潜在空间中高度非凸。因此大多数系统使用CEM(交叉熵方法)或MPPI(模型预测路径积分),两者均无导数。CEM采样一批动作序列,通过展开世界模型评估,保留top-k,并重新拟合采样分布。MPPI类似,但用指数负成本加权轨迹而非硬精英选择。当梯度不可靠时这些方法有效,但计算成本高——每个规划步数百个候选展开,而非单次前向-后向传播。本文探讨了是什么使得潜在规划景观对梯度如此不利,以及如何解决。诊断:基线是DINO-WM,一种JEPA风格世界模型,使用ViT预测器在冻结的DINOv2特征空间中规划,最小化预测嵌入与目标嵌入之间的终端MSE。问题在于DINOv2潜在轨迹高度弯曲(当使用MSE作为规划成本时,你隐含假设欧几里得距离近似沿可行转变的测地距离)。对于弯曲轨迹,这会严重失效,基于梯度的规划器陷入困境,嵌入空间中的直线距离错误表示了实际可达性。修复借鉴了神经科学中的感知直化假设——生物视觉系统将复杂视频转换为内部更直的表示。因此他们在世界模型训练中添加曲率正则化。给定连续编码状态z_t, z_{t+1}, z_{t+2},定义速度向量v_t = z_{t+1} - z_t,将曲率测量为连续速度之间的余弦相似度,并最小化L_curv = 1 - cos(v_t, v_{t+1})。总损失为L_pred + λ * L_curv,并对目标分支使用停止梯度以防止崩溃。理论清晰支持:他们证明降低曲率直接限制了规划优化的条件——更直的潜在轨迹保证了梯度下降在更长视界上的更快速收敛。值得注意的是,即使没有曲率损失,仅用预测目标训练编码器也会产生一定的“隐式直化”——JEPA损失自然倾向于时间演化可预测的表示。显式正则化则进一步推动这一点。在四个2D目标到达环境中的实验结果一致强劲。开环成功率提升20-50%,直化后的梯度下降在计算量一小部分下匹配或超越CEM。最令人信服的证据是距离热力图:直化后,潜在欧几里得距离与状态间最短距离紧密匹配,尽管模型仅在次优随机轨迹上训练。除了具体方法,我发现有趣的是规划算法未变,动力学模型未变。一个关于嵌入几何的正则化项使梯度下降从不可靠变为与采样方法竞争。该领域很大程度上将表示学习和规划视为独立问题——先学好特征,然后...
动态Zhuokai Zhao2026-03-15原文

相关内容