行业新闻

LeCun团队提出AdaJEPA,实现世界模型持续学习

AdaJEPA通过测试时自适应让世界模型在部署中持续校准,显著提升应对环境变化的鲁棒性。

传统世界模型训练完就冻结,遇到环境变化容易失效。LeCun团队的AdaJEPA让模型在每次执行动作后,用真实观测结果轻量更新自身编码器和预测器,持续适应新环境。实验显示规划成功率提升明显。

正文摘录

与过去在预训练结束后就冻结参数的世界模型不同,AdaJEPA 能够在与环境交互中,基于 测试时自适应 (Test-Time Adaptation, TTA),实时调整世界模型的编码器和预测器参数,从而实现持续学习。 具体而言,AdaJEPA 通过 计划、执行、观测、更新、再规划 的闭环,在每次交互中只执行 MPC 规划出的第一段动作,然后把真实观察到的下一帧状态,当成自监督信号来更新世界模型。 由此,在下一轮规划时用的就不再是刚部署时那个冻结模型,而是已经被当前环境“校准”过的模型。 实验结果也表明,无论是在分布内环境,还是面对各类分布外偏移,AdaJEPA 的规划成功率都明显优于固定世界模型。 一直以来,基于 JEPA 路线的隐空间世界模型,都有一个默认前提,就是模型训练完,就冻结参数。 模型先在离线轨迹上学习把高维图像压进 latent space,然后再在这个隐空间里预测未来。 到了测试阶段,MPC(Model Predictive Control,模型预测控制)就会调用这个冻结的世界模型,在隐空间里向前滚动“想象”未来,优化出一串动作,再把第一步动作拿到真实环境里执行。 (注:MPC 的核心思想是每次只往前预测一小段,算出一串动作,但先只执行第一步。等真实环境反馈回来,再重新预测、重新规划) 当系统面临测试时分布偏移(Test-time Distribution Shift)时,在 latent space 里看起来能到达目标的动作,落到真实环境里,可能一步都不对。 它的核心判断是:世界模型不该训练完就固定在那里。它应该像真正部署中的智能体一样,一边行动,一边用新经验校准自己。 世界模型也因此不再只是一个被动调用的“想象器”,而变成了一个会在部署过程中持续校准自己的模块。

阅读原文(qbitai.com)→

行业新闻henry2026-07-05原文

相关内容