动态

Yann LeCun比较机器人中像素、动作等预测方法,推崇JEPA自监督预训练

Yann LeCun
现在从事机器人研究就像我2023年时想象的语言模型工作状态。大家都在尝试各种方法看哪个有效:像素预测(Cosmos)、动作预测(VLA)、奖励预测(TD-MPC)和表示预测(JEPA)。同一个问题的不同路径。在语言领域胜出的配方是互联网规模的自监督预训练,然后轻量微调。只有表示预测遵循这个模式。它从无动作视频数据中学习,因此可以在YouTube和第一人称数据上预训练,然后加上控制层。其他所有方法都需要动作标记数据,无法规模化。作为一个强化学习最大化主义者,我过去讨厌LeCun的蛋糕。结果发现他一直是对的,所以我最终成了JEPA信徒。
动态Yann LeCun2026-06-21原文

相关内容