动态

宣布开源世界模型DreamDojo,用于机器人控制

宣布开源世界模型DreamDojo,用于机器人控制
Jim Fan
宣布DreamDojo:我们开源的交互式世界模型,它接收机器人电机控制信号,并以像素方式生成未来。没有引擎、没有网格、没有手工编写的动力学。这是模拟2.0。是时候让机器人接受苦涩教训了。

真实世界中的机器人学习受限于时间、磨损、安全和重置。如果我们希望物理AI达到预训练的速度,就需要一个能以尽可能少的人力工程适配预训练规模的模拟器。

我们的关键洞察:(1)人类第一人称视频是可扩展的第一人称物理来源;(2)潜在动作使其跨不同硬件“可被机器人读取”;(3)实时推理解锁了在梦想内部进行实时遥操作、策略评估和测试时规划。

我们在44K小时的人类视频上预训练:成本低、数量丰富,且无需任何机器人参与循环。人类已经探索了组合学:我们抓取、倒、折叠、组装、失败、重试——跨越杂乱场景、变化视角、光线变化和长达一小时的任务链——规模之大无机器人舰队能及。缺失的一环:这些视频没有动作标签。因此我们引入潜在动作:一种直接从视频中推断出的统一表示,捕获了“世界状态之间发生了什么变化”,而无需了解底层硬件。这使得我们可以像训练带有电机命令的视频一样训练任何第一人称视频。

结果,DreamDojo零样本泛化到任何机器人训练集中未见过的物体和环境,因为人类先看到了它们。

接下来,我们对每个机器人进行后训练,以适应其特定硬件。可以将其视为将“世界的外观和行为”与“该特定机器人如何驱动”分离。基础模型遵循通用物理规则,然后“卡入”机器人的独特机制。这有点像将新的角色和场景资产加载到Unreal Engine中,但通过梯度下降完成,并且泛化能力远超后训练数据集。

世界模拟器只有在运行速度足以闭环时才有用。我们训练了一个实时版本的DreamDojo,以10 FPS运行,稳定超过一分钟的连续推出。这开启了激动人心的可能性:

- 在梦想内部进行实时遥操作。连接VR控制器,将动作流输入DreamDojo,实时遥操作虚拟机器人。我们在Unitree G1上使用PICO头显和一块RTX 5090进行了演示。
- 策略评估。你可以在DreamDojo中基准测试策略检查点,而不是在真实世界中。模拟成功率与真实结果高度相关——足以在不烧毁一个电机的情况下对检查点进行排名。
- 基于模型的规划。采样多个动作提案→并行模拟所有提案→选择最佳未来。在水果打包任务上开箱即用地实现了+17%的真实世界成功率。

我们开源一切!权重、代码、后训练数据集、评估集以及包含大量复现细节的白皮书。DreamDojo基于NVIDIA Cosmos,它也是开源权重的。

2026年是物理AI世界模型的一年。我们希望你能与我们一同构建。快乐扩展!

线程中的链接:
动态Jim Fan2026-02-20原文

相关内容