Yann LeCun 的 JEPA 路线获验证,新模型 LeWM 解决崩溃问题
Yann LeCun 一直是正确的。而生成式 AI 可能是一条死胡同。
过去三年,整个行业都痴迷于构建更大的 LLM。万亿参数、数十亿计算量。
理论很简单:把模型做得足够大,它最终会理解世界如何运转。
Yann LeCun 说这是愚蠢的。
他认为生成式 AI 从根本上效率低下。
当 AI 预测下一个词或生成下一个像素时,它在表面细节上浪费了大量计算。
它记忆模式,而不是学习现实的物理规律。
他提出了一条不同的路径:JEPA(联合嵌入预测架构)。
JEPA 不强迫 AI 逐像素描绘世界,而是迫使它预测抽象概念。它在压缩的“思维空间”中预测接下来会发生什么。
但多年来,JEPA 有一个致命缺陷。
它遭受“表示崩溃”之苦。
因为 AI 被允许简化现实,它会作弊。它会过度简化一切,以至于狗、汽车和人看起来都一样。
它什么也没学到。
为了修复它,工程师不得不使用极其复杂的 hack、冻结的编码器以及巨大的计算开销。
直到今天。
研究人员刚刚发表了一篇名为“LeWorldModel”(LeWM)的论文。
他们彻底解决了崩溃问题。
他们用单个优雅的数学正则化器取代了复杂的工程 hack。
它迫使 AI 的内部“思想”符合完美的高斯分布。
AI 无法再作弊。它被迫理解现实的物理结构以进行预测。
结果完全改写了 AI 的经济学。
LeWM 不需要庞大的集中式超级计算机。
它只有 1500 万个参数。
它在单个标准 GPU 上训练,只需几小时。
然而,它的规划速度比大规模基础世界模型快 48 倍。它内在地理解物理。它瞬间检测到不可能的事件。
我们花费数十亿美元试图让庞大的服务器集群记住互联网。
现在,一个在单个显卡上本地运行的微小模型正在真正学习现实世界如何运作。
过去三年,整个行业都痴迷于构建更大的 LLM。万亿参数、数十亿计算量。
理论很简单:把模型做得足够大,它最终会理解世界如何运转。
Yann LeCun 说这是愚蠢的。
他认为生成式 AI 从根本上效率低下。
当 AI 预测下一个词或生成下一个像素时,它在表面细节上浪费了大量计算。
它记忆模式,而不是学习现实的物理规律。
他提出了一条不同的路径:JEPA(联合嵌入预测架构)。
JEPA 不强迫 AI 逐像素描绘世界,而是迫使它预测抽象概念。它在压缩的“思维空间”中预测接下来会发生什么。
但多年来,JEPA 有一个致命缺陷。
它遭受“表示崩溃”之苦。
因为 AI 被允许简化现实,它会作弊。它会过度简化一切,以至于狗、汽车和人看起来都一样。
它什么也没学到。
为了修复它,工程师不得不使用极其复杂的 hack、冻结的编码器以及巨大的计算开销。
直到今天。
研究人员刚刚发表了一篇名为“LeWorldModel”(LeWM)的论文。
他们彻底解决了崩溃问题。
他们用单个优雅的数学正则化器取代了复杂的工程 hack。
它迫使 AI 的内部“思想”符合完美的高斯分布。
AI 无法再作弊。它被迫理解现实的物理结构以进行预测。
结果完全改写了 AI 的经济学。
LeWM 不需要庞大的集中式超级计算机。
它只有 1500 万个参数。
它在单个标准 GPU 上训练,只需几小时。
然而,它的规划速度比大规模基础世界模型快 48 倍。它内在地理解物理。它瞬间检测到不可能的事件。
我们花费数十亿美元试图让庞大的服务器集群记住互联网。
现在,一个在单个显卡上本地运行的微小模型正在真正学习现实世界如何运作。