动态

Yann LeCun团队推出LeWorldModel,实现稳定端到端世界模型训练

Yann LeCun团队推出LeWorldModel,实现稳定端到端世界模型训练
Brian Roemmele
LeWorldModel:Yann LeCun对世界模型的激进简化刚刚让物理感知AI变得实用

在通向通用人工智能的竞赛中,出现了两条路径。一条是熟悉的规模一切路线:在越来越大的文本语料库上训练更大的LLM。另一条由Yann LeCun多年倡导:构建世界模型——直接从原始感官数据(像素)学习现实底层物理的紧凑系统,使AI能够像机器人或自动驾驶汽车实际那样在物理世界中规划、预测和行动。

直到现在,第二条路径一直极其困难。联合嵌入预测架构(JEPA)——LeCun用于学习预测表示而无需重建每个像素的优雅框架——在训练中不断崩溃。研究人员不得不求助于一系列黑客手段:多项损失函数(多达六个超参数)、冻结的预训练编码器、停止梯度、指数移动平均以及其他权宜之计,只是为了不让模型将所有输入映射到相同的无用输出。

LeCun的团队(Mila、NYU、Samsung SAIL和Brown University)投下了一枚重磅炸弹:

LeWorldModel(LeWM)——第一个仅使用两项损失项就能从原始像素稳定端到端训练的JEPA。不再需要纸牌屋式的工程。只需一个干净简单的方案,即可在单个GPU上几小时内完成,仅用1500万参数。

核心突破:SIGReg拯救局面

LeWorldModel的秘密武器是一种名为SIGReg(球形各向同性高斯正则化器)的新型正则化器。它在潜在嵌入上强制一个简单的高斯分布。

这单个项就能防止表示坍塌,无需任何先前的启发式方法。

训练目标现在只有两部分:

1. 下一个嵌入预测损失——模型预测下一个潜在状态应该是什么。

2. SIGReg——保持潜在空间行为良好且多样化。

仅此而已。超参数从六个降为一个。训练变得稳定、可复现且大大降低成本。

该模型直接从原始视频帧学习(无需预训练视觉编码器),并产生一个紧凑的潜在世界模型,可用于快速规划。

在真实基准上的令人印象深刻的结果

尽管尺寸很小,LeWorldModel的表现远超其规模:

- 在单个GPU上几小时内训练完成。
- 行动规划速度比基于基础模型的世界模型快48倍。
- 使用的token数量比替代方案少约200倍。
- 在各种2D和3D控制任务(如操作、导航)上匹配或击败大得多的模型。
- 其潜在空间编码了有意义的物理量(位置、速度等)——通过直接探测证明。
- 可靠地检测物理上难以置信的意外事件,显示出真正的因果理解。

关键在于,添加解码器和重建损失会损害下游控制任务的性能。纯JEPA目标已经包含了规划所需的一切——额外的视觉细节只会碍事。

项目网站:https://t.co/KhGR9LiIQZ
官方代码:https://t.co/s1lI9kevJS

这对AI未来为何重要

LeCun自2022年以来一直声称世界模型(而不是下一个token预测)才是真正智能的关键。批评者总是指出训练不稳定性。LeWorldModel用优雅的简洁性消除了这一反对意见。

这是一次哲学上的重置:AI可以像婴儿一样通过观察世界展开来学习物理,而无需超级计算机或无尽文本。

对机器人技术、自动驾驶车辆和具身智能体的影响巨大。突然之间,构建一个物理基础的规划器成为研究人员(甚至爱好者)在消费级硬件上可以做到的事情。

(1/2)
动态Brian Roemmele2026-03-25原文

相关内容