中科大等机构提出 VLA-JEPA,用潜空间预测训练 VLA 模型
VLA-JEPA 通过潜空间世界模型预训练,让小样本 VLA 机器人学会状态转移,降低对标注数据的依赖。
VLA-JEPA 将 VLA(视觉-语言-动作)模型与 JEPA(联合嵌入预测架构)结合,不再预测像素,而是在潜空间预测未来状态变化。仅用 13 条轨迹就能完成简单装配任务,获 LeCun 转发。核心思路是让模型从人类视频和机器人演示中学到“动作如何改变世界”,而非像素变化。
正文摘录
- title:LeCun、谢赛宁转发的世界模型与 VLA 共融方案:中关村学院 ECCV2026 — VLA - JEPA - sourcecompany:机器之心 - bodymarkdown: .jpg)  依赖于有限机器人数据和大量人类数据,也能让 VLA 模型更稳健吗? 近期,来自中科大、北京中关村学院、上海交通大学,宁波东方理工大学等机构的团队提出的 VLA - JEPA 给出了一个思路:不要再让模型在像素空间里追逐“未来帧”,而是借鉴 Yann LeCun 等人提出的 JEPA 路线,在潜在表征空间中学习和预测世界状态的变化。 作为首个移植到 lerobot 框架的 VLA 和世界模型结合的工作,经官方验证 VLA - JEPA 仅使用 13 条轨迹就可以完成简单的装配任务,并获得 LeCun,谢赛宁在社交平台上的转发关注。