动态

LeCun分类世界模型:JEPA、空间智能等

Zhuokai Zhao
AMI Labs 刚刚筹集了 10.3 亿美元。几周前,World Labs 筹集了 10 亿美元。两者都押注于世界模型。

但几乎没有人对这个术语有相同的理解。

在我看来,这里有五类世界模型。

---

1. 联合嵌入预测架构(JEPA)
代表:AMI Labs (@ylecun)、V-JEPA 2

核心赌注是,仅靠像素重建对于学习物理理解所需的抽象来说是一个低效的目标。LeCun 多年来一直这么说——在任何随机环境中预测未来的每一个像素都是难以处理的。JEPA 通过在学习的潜在空间中进行预测来规避这一点。

具体来说,JEPA 训练一个编码器将视频块映射到表示,然后一个预测器在该表示空间(而不是像素空间)中预测被掩码的区域。

这是一个关键的设计选择。

一个重建像素的生成模型被迫处理低层次细节(确切的纹理、光照、树叶位置),这些本质上是不可预测的。通过在抽象嵌入上操作,JEPA 可以捕捉“球会从桌子上掉下来”,而不必想象它掉下来的每一帧。

V-JEPA 2 是迄今为止最清晰的大规模证明点。它是一个 12 亿参数的模型,通过自监督掩码预测在 100 万小时以上的视频上预训练——没有标签,没有文本。第二阶段训练变得有趣:仅需来自 DROID 数据集的 62 小时机器人数据,就足以产生一个支持零样本规划的动作条件世界模型。机器人生成候选动作序列,通过世界模型向前滚动,并选择预测结果与目标图像最匹配的那个。这在训练期间从未见过的物体和环境中有效。

数据效率是真正的技术亮点。62 小时几乎微不足道。这表明,在各种视频上的自监督预训练可以引导出足够的物理先验知识,以至于下游只需要很少的领域特定数据。这是对 JEPA 设计的有力论证——如果你的表示足够好,你就不必从头开始暴力破解每个任务。

AMI Labs 是 LeCun 推动这一研究超越研究的努力。他们首先瞄准医疗保健和机器人,考虑到 JEPA 在有限数据下物理推理的优势,这很合理。但这是一个长期赌注——他们的 CEO 公开表示商业产品可能需要数年时间。

---

2. 空间智能(3D 世界模型)
代表:World Labs (@drfeifei)

JEPA 问“接下来会发生什么”,而 Fei-Fei Li 的方法问“世界在 3D 中是什么样子的,我该如何构建它?”

其论点是,真正的理解需要明确的空间结构——几何、深度、持久性以及从新视角重新观察场景的能力——而不仅仅是时间预测。

这是与 JEPA 不同的赌注:不是学习抽象的动力学,而是学习一个结构化的 3D 环境表示,你可以直接操作它。

他们的产品 Marble 从图像、文本、视频或 3D 布局生成持久的 3D 环境。“持久”是关键——与生成线性帧序列的视频生成模型不同,Marble 的输出是具有空间连贯性的实际 3D 场景。你可以环绕相机、编辑对象、导出网格。这使其更接近 3D 创作工具,而不是预测模型,这是故意的。

作为背景,这建立在神经 3D 表示工作(NeRF、3D 高斯溅射)的基础上,但朝着生成而不是重建的方向推进。不是从多视角照片中捕捉真实场景,Marble 从稀疏输入中合成合理的新场景。挑战在于维持物理合理性——一致的几何、合理的光照、合理的遮挡——在一个从未存在的生成世界中。

---

3. 学习模拟(生成视频 + 潜在空间 RL)
代表:Google De
动态Zhuokai Zhao2026-03-12原文

相关内容