论文

InternW0-Δ:一个连接预测动态与动作、基于 20K+ 小时开放数据的世界动作模型

InternW0-Δ:一个连接预测动态与动作、基于 20K+ 小时开放数据的世界动作模型

World Action Models(WAM)联合建模视觉动态与动作生成,面向通用机器人操作。其核心挑战在于把大规模预训练模型的先验——视觉动态、场景语义、几何与运动——整合进统一的动作生成框架。我们提出 InternW0-Δ,一个在异构语料上预训练的统一 WAM,在仿真基准与真机平台上均超越先前方法。 InternW0-Δ 在 Mixture-of-Transformers(MoT)框架中融合预训练视觉动态、场景级语义、4D 几何与运动先验以及动作生成:预训练视频专家与动作专家在冻结 VLM 的语义引导下交互,预训练 4D 基础模型则通过仅训练期的蒸馏注入几何与运动先验。我们进一步提出 Causal Imprint,从仅训练期的未来监督中学习与未来相关的场景变化,推理时无需 rollout 未来视频,即可直接向动作专家提供预测性表征。 为支持大规模联合训练,我们构建了涵盖机器人演示、UMI 数据、第一视角人类演示与 Ego2Robot 数据的异构语料,并在统一的状态-动作表示下整理对齐,处理后训练数据超过 20K 小时,据我们所知是同类中最大的开源语料。我们在该语料上预训练 InternW0-Δ,并在仿真基准与真机平台上取得强劲性能。我们将开源训练代码、模型权重、基础设施、数据处理流水线及处理后数据(许可允许范围内)。项目主页:https://internrobotics.github.io/InternW0-Delta/

论文精读

TL;DR InternW0-Δ 通过 Mixture-of-Transformers 将预训练视觉动态、语义与 4D 几何先验融入统一世界-动作模型,利用超 20K 小时异构数据训练,在仿真与真机机器人操作中优于现有方法。

问题

机器人操作领域正从单一任务策略学习转向可扩展的通用机器人基座模型,其中 World Action Models (WAM) 尝试同时建模视觉动力学与动作生成,以支持多任务、跨本体的操作能力。

现有方法局限:现有 Vision-Language-Action (VLA) 模型多数将预训练视觉编码器与动作头简单拼接,缺少显式的未来状态预测机制,在需要长程一致性和动态推理的接触丰富任务中表现不稳定。少数引入世界模型的方案往往需要推理时 rollout 未来视频,增加延迟且难以在真实机器人上稳定部署。此外,不同来源的机器人数据在控制频率、相机配置、本体结构和状态空间上高度异构,现有开源工作缺乏统一的 state-action 表示和联合训练框架,难以有效利用大规模人类演示、UMI 数据与多机器人数据集;预训练视觉先验(如 4D 几何、运动、场景语义)也未能系统性注入到动作生成过程。

为什么这个问题难且重要:挑战在于同时满足三个条件:(1) 大规模异构数据的对齐与过滤;(2) 联合训练视觉动力学与动作生成而不牺牲实时推理;(3) 在动作专家中保留预测性表示,避免未来视频 rollout 的推理开销。业界对通用机器人基座模型需求强烈,类似于 LLM 在语言任务中的基础地位,WAM 被视为打通感知-预测-规划-控制闭环的关键路径。

行业类比:这与自动驾驶领域从模块化感知/预测/规划走向端到端世界模型加规划器的技术路线相似,都是通过预训练的未来状态表征来直接增强执行动作的生成质量。

核心洞察

  • **Causal Imprint** 机制将未来场景变化压缩为当前可用的预测表征,使动作生成无需推理时未来视频 rollout。相比 Pi-zero 等依赖自回归视频预测的方法,该设计在训练时利用 future supervision 蒸馏出与动作相关的几何/语义变化,直接输入 action expert,避免了多步 rollout 带来的误差累积和计算瓶颈,同时保留了动力学先验对动作生成的指导。
  • **Mixture-of-Transformers (MoT)** 框架通过分离 video expert 与 action expert,并在 frozen VLM 语义引导下交互,解决了多模态先验融合中的灾难性遗忘问题。不同于将视觉、语言、动作特征简单拼接后联合微调,InternW0-Δ 冻结预训练专家,仅优化少量路由和适配层,使得大规模异构数据上的训练更稳定,且能灵活注入 4D 几何先验,为通用机器人操作提供了可扩展的模型设计范式。

方法

方法脉络

输入:多视角图像、本体感觉、任务指令、可选历史帧。经统一状态-动作表示将异构数据映射到共同空间。

关键模块

  1. 多模态上下文编码:视觉用多视角编码器,本体感觉与动作量化为 token,任务指令通过冻结 VLM 提取语义。
  2. Mixture-of-Transformers (MoT):核心交互。预训练视频专家与动作专家交替注意力,在语义引导下融合动态与操作。
  3. Causal Imprint:训练时利用未来视频监督学习场景变化表征,直接注入动作专家;推理时无未来 rollout,避免时序依赖。
  4. 4D 感知蒸馏:从预训练 4D 基础模型蒸馏几何与运动先验,仅训练时参与,不增加推理开销。
  5. 稀疏记忆上下文:缓存长时观察特征,支持长程任务。

训练与输出

目标函数包含流匹配损失(动作生成)、Causal Imprint 预测损失、4D 蒸馏对齐损失,联合优化。推理时视觉特征 prefill 缓存,动作只用去噪步骤输出执行。

与同类差异:区别于端到端 VLA 直接回归动作,InternW0-Δ 显式引入未来动态监督与 4D 几何先验,通过训练时蒸馏获得预测能力,推理时不依赖视频生成,效率与精度平衡。

实验

实验设计

InternW0-Δ 在四个仿真基准上评估:LIBERO-Plus、RoboTwin 2.0、EBench、RoboDojo,覆盖物体操控、双臂协作和移动操作等任务。同时,在真实机器人平台进行预训练收益、跨物理条件泛化及跨 embodiment 适应实验。模型先在大规模 20K+ 小时异构语料 上预训练,再针对各基准进行后训练微调。

关键发现

  • 在全部四个仿真基准上,InternW0-Δ 均超越先前方法,尤其在依赖几何与运动先验的任务上优势明显。
  • Causal Imprint 与 4D 先验蒸馏 对性能有正向贡献:前者提供未来相关场景变化表示,后者注入几何/运动先验。
  • 真实机器人实验显示预训练模型在样本效率和成功率上优于从头训练基线,并且能泛化到不同的物理条件和 embodiment。

与基线对比解读

相较纯 VLA(Vision-Language-Action)模型,InternW0-Δ 引入视觉动态与 4D 先验,使其在需要预测环境变化的任务中表现更优。与 RDT-1B 等大模型相比,Mixture-of-Transformers 和稀疏记忆机制在保持高效推理的同时,更好地融合多模态先验。实验结果表明:联合建模视觉动态与动作生成,并注入结构化几何/运动先验,是提升通用机器人操控能力的有效路径。

行业影响

落地场景

InternW0-Δ 作为预训练世界动作模型,可直接赋能机器人操作相关产品线:物流仓储中的分拣与搬运机器人、制造业的柔性装配与质检、服务机器人的复杂环境交互,以及自动驾驶中的车辆操控。其统一视觉动态与动作生成的能力,适合需要从感知到执行端到端学习的场景。开源 20K+ 小时数据与训练代码,使中小团队也能快速构建定制化机器人技能。

商业价值

  • 降本:预训练模型显著减少企业收集机器人演示数据的成本,利用异构数据(人类示范、机器人数据)提升数据效率,减少从头训练的时间和算力。
  • 增收:更强的泛化能力使机器人能处理未见过的物体、场景和扰动,扩展可执行任务范围,打开新市场。
  • 体验提升:动作生成更接近人类操作,提升机器人作业的流畅性与安全性,减少人工干预。

与现有产品/工作流的接口

模型采用 MoE/Transformer 架构,可无缝集成到主流机器人栈:

  • 通过 ONNX/TensorRT 导出,部署在边缘设备或云端,支持实时推理(论文提到 action-only denoising 与异步执行)。
  • 数据流水线可复用:其统一状态-动作表示和过滤规则可与现有数据采集平台(如 ROS bag、自定义采集器)对接。
  • 微调接口:作为基础模型,通过少量任务数据 post-training 适配新 embodiment,类似 LLM 的 LoRA 微调。
  • 与视觉语言模型(VLM)结合,提供自然语言指令理解,适合人机协作场景。

具体落地 use case

  1. 电商仓储机器人:利用 InternW0-Δ 预训练模型,快速部署用于商品抓取、打包的机械臂,处理多样 SKU 和动态货架。通过微调适配不同夹爪和视觉传感器,缩短从实验室到仓库的周期。
  2. 自动驾驶车辆操控:虽然论文聚焦机器人操作,但其 4D 几何与运动先验、Causal Imprint 机制可迁移到车辆控制中的轨迹预测与决策,如泊车、避障等,作为端到端驾驶模型的预训练组件。

局限

  • - **数据依赖与噪声风险**: 模型性能高度依赖 20K+ 小时多源语料的质量与对齐。尽管论文列出了信号过滤、静态裁剪、动作幅值保护等处理规则,但异构数据在标注一致性、跨 embodiment 运动映射、语言指令与视频匹配度方面仍可能存在残余噪声,这些噪声会通过联合训练放大,影响动作生成的稳健性。此外,部分数据源许可限制导致开放范围有限,完整复现数据管线存在困难,削弱了开源承诺的实际可操作性。
  • - **Causal Imprint 与 4D 蒸馏的信息损失**: Causal Imprint 仅在训练阶段使用未来视觉监督,推理时不进行未来视频 rollout,因此模型无法在线进行显式未来状态推演,对于需长时预测或复杂接触推理的任务可能表现不足。同时,4D 几何与运动先验仅通过训练蒸馏注入,推理时不再调用 4D 基础模型,虽然降低了延迟,但也意味着动态几何信息被压缩到静态权重中,面对训练分布外的运动模式时可能缺乏自适应能力。
  • - **架构复杂度与实验对比局限**: Mixture-of-Transformers 融合视频专家、动作专家、VLM 语义引导与 4D 蒸馏,显著增加训练和调试复杂度,分布式训练基础设施门槛很高,普通团队难以复现或微调。实验覆盖的仿真基准虽多,但真实机器人任务数量和场景多样性披露不足,且未与同期强基线(如 GR00T N1.5、π0.5)进行全面对比,后训练超参与 RTC 细节也未充分公开,限制了结论的普适性和可复现性。
论文Xingyu Miao2026-09-25原文

相关内容