论文

学习从动作到世界建模的可迁移动力学先验

学习从动作到世界建模的可迁移动力学先验

我们研究动作条件世界建模作为可扩展方法,用于学习机器人学习的可迁移动力学先验。通过在大型机器人操作数据上预训练模型,使其学会预测动作如何驱动视觉场景演变,所得世界模型捕获了超越外观级视频生成的可复用交互动力学。 具体地,我们在带有真实动作标注的大规模机器人操作数据上预训练了一个多视角交互基础扩散世界模型 A2World。从两个互补视角验证所学动力学先验: 1. 将 A2World 适配为任务或场景专用仿真器 A2World-sim,其长程 rollout 支持基于仿真器的策略评估和可扩展的假设分析,用世界模型 rollout 替代真实机器人 rollout。 2. 从相同预训练权重出发,将 A2World 适配为视频-动作联合预测模型 A2World-policy,在视觉和指令条件下预测动作。 在仿真基准和真实机器人设置上的实验表明,动作条件世界模型预训练产生了可迁移的动力学先验,对仿真器中心和策略中心的机器人学习均有助益。

论文精读

TL;DR 通过动作条件世界模型预训练,A2World 从大规模机器人操作数据中习得可迁移的动力学先验,既能驱动长程仿真,又能直接预测动作,统一提升了模拟器与策略两类机器人学习范式的泛化能力。

问题

问题背景

当前机器人学习领域愈发依赖视频生成模型作为可扩展的基础组件,主流范式沿两条路径演进:一是将生成模型直接适配为视觉‑语言‑动作(VLA)策略;二是构建世界模型用于基于模型的规划与仿真。然而,如何在大规模交互数据上预训练出可迁移的动力学先验,使其既能驱动长期物理仿真,又能直接支撑动作预测,仍是一个开放问题。

现有方法局限

现有方案存在明显割裂:

  • VLA 策略(如 Genie、VidMan)虽可从视频生成扩展到动作输出,但它们本质上是 观测到动作的映射,缺乏对动作如何导致状态演化的显式建模,难以进行反事实推理或 what‑if 分析。
  • 传统世界模型(如 Dreamer、TD‑MPC2)通常在单一任务上从头训练,无法复用跨场景、跨具身形态的物理规律;而近期基于扩散的通用世界模型(如 UniSim)虽能生成逼真视频,但动作条件控制不足,容易陷入外观一致性而忽略真实交互动力学。
  • 即使部分方法引入动作条件,也常局限于单视角、短时程,无法支撑多视角交互仿真与长程 rollout。

为什么这个问题难且重要

技术上,核心挑战在于:

  • 多源异构数据融合:不同机器人平台、视角、动作空间下的交互数据极难统一建模;
  • 长期一致性与因果保真度:世界模型必须精准响应动作序列,避免累积误差与幻觉,这要求模型学到物理因果而非表面相关;
  • 表征迁移与下游适应:预训练权重需同时服务于仿真器(需要长程生成能力)和策略(需要从视觉+指令预测动作),极易出现灾难性遗忘。

业界关注度因此持续升温:一旦成功,世界模型预训练将像大语言模型对 NLP 那样,成为机器人基础模型的核心范式,大幅降低数据采集成本,并赋能高效策略评估与仿真推理。

类比于大语言模型通过因果语言建模获得通用语言理解,世界模型预训练有望通过动作条件未来预测习得通用物理交互先验,再微调到各类下游机器人任务。

核心洞察

  • 动作条件世界模型学习的是可迁移的交互动力学先验,而非仅仅外观生成。与许多视频生成世界模型(如 UniSim)仅建模像素变化不同,A2World 通过预测动作对视觉状态的影响,捕获了与任务无关的底层动力学,这使得先验能够跨场景和下游任务(模拟器或策略)迁移,显著降低了下游适应时的样本需求。
  • 从统一预训练权重派生出两种下游范式(模拟器与策略)证明了动力学先验的双重实用性。A2World-sim 支持策略评估和反事实推理,而 A2World-policy 直接从视觉和指令预测动作,这比分别训练两个模型更高效,且避免了动力学与行为分离带来的表征不一致问题。这种一体化设计为模型预训练如何赋能机器人全流程提供了新思路。
  • 多视图、动作条件的大规模预训练对于机器人操作至关重要。引入多视角观测增强了空间理解,真实动作标注提供了精细的运动相关监督,这比基于无动作视频或单一视图的世界模型更好地捕捉了操作任务中物体交互的精细动力学,从而使得生成的 rollout 更忠实于物理交互,策略预测更精准。

方法

该方法围绕 A2World 基世界模型展开,按“预训练→任务适配”两阶段构建,统一支持仿真与策略学习。

输入与表示

模型接收 多视图 RGB 图像机器人末端执行器动作(如 6-DOF 位移)作为输入。多视图设置保证了空间信息的覆盖,动作以数值序列形式与观测时间对齐。

基世界模型预训练

A2World 采用 扩散 world model 架构,将世界建模视为视频生成问题:以当前观测和未来动作序列为条件,利用 diffusion 过程逐步去噪生成未来多视图帧。训练时,对真实未来帧加噪,模型学习预测噪声,损失为简单的均方误差。核心创新在于动作条件注入机制,通过交叉注意力或 FiLM 层将动作表征融入扩散 U-Net 的各个层级,迫使模型学习“给定动作如何改变视觉状态”的因果动力学,而非表面像素变化。预训练在大规模机器人操作数据集上进行,利用真实动作标注,使模型捕捉与动作强相关的可复用动力学先验。

下游适配

从同一预训练权重出发,分别微调为两种形态:

  • A2World-sim:作为长期仿真器,在特定任务或场景的少量数据上微调,固定动作条件生成轨迹 rollout,用于策略评估与 what-if 分析。通过加入时序自回归推理(将上一步生成帧作为下一步的条件输入),支持长时域视觉预测,替代真实机器人采样。
  • A2World-policy:将世界模型转为视频-动作联合预测器。移除动作条件输入,改为在视觉上下文中预测动作,类似视觉-语言-动作(VLA)模型。微调时,网络同时输出未来帧和动作概率分布,以多任务损失联合优化,使模型能从观测推断操作动作。

与同类工作的差异

传统的视频生成模型直接用作策略或仿真器时,常忽略可迁移的动力学结构。本方法的独特之处在于将动作条件预训练作为显式先验,使世界模型不仅生成视觉,更内化交互动力学,从而在仿真与策略两个方向上得到一致的性能增益,而非简单复用视频生成 backbone。

实验

实验设计

论文围绕 动作条件世界模型 的预训练与迁移展开,核心实验分三块:

  1. 基础世界模型能力演示:在真实机器人操作数据上评估 A2World 多视角未来帧生成的视觉质量与动作一致性。
  2. A2World-sim 长期推演评估:将预训练模型微调为任务/场景专属模拟器,对比真实与模拟 rollout 的分布差异,验证策略评估与 what-if 分析的可靠性。
  3. A2World-policy 视觉-动作联合预测:利用同一预训练权重微调为策略模型,评测动作预测准确率及任务成功率,并与从零训练的方法比较。

实验覆盖仿真基准(如 RLBench)与真实机器人(弗兰卡机械臂),并通过消融考察多视角、动作条件、预训练等设计的贡献。

关键发现

  • 可迁移的动力学先验:预训练捕获了跨场景的交互动力学,即便新任务/新视点下微调也能显著加速收敛、提升性能。
  • A2World-sim 能稳定生成数百步 rollout,动力学误差明显低于无预训练基线,为 scalable 仿真铺路。
  • A2World-policy 借助世界模型赋予的强视觉表征,在少量下游数据下即获得有竞争力的策略表现,证明从世界模型到策略的知识迁移高效。

与基线对比的深度解读

相比直接使用 SVDCosmos 等视频生成模型,A2World 的核心差异在于 动作条件多视角交互。基线通常只追求外观生成质量,忽略动作驱动的物理因果结构;移除动作条件后模型退化为普通未来预测,长期推演误差迅速发散。与同期 VLA 方法不同,A2World 先构建世界模拟器再间接提升策略学习,在数据效率与泛化性上展示了独特优势。消融表明,预训练权重对两类下游任务(模拟器、策略)均有显著增益,印证了动态先验可分离于场景外观,具备跨任务迁移能力。

行业影响

落地场景

A2World 的动作条件世界模型预训练,可直接赋能两类机器人产品:

  • 智能仿真引擎:替代传统手工搭建的物理模拟器,为 仓储物流、家庭服务、工业装配 等场景提供高保真、交互式的长程 rollout,支撑无真实机器人的策略评估与“假设推演”。
  • 视觉-动作联合预测:作为预训练 backbone,快速适配到各类 机器人操控策略,尤其适合需要快速换产、多 SKU 泛化的 零售物流拣选柔性制造 场景。

商业价值

  • 研发降本:利用预训练世界模型减少真实机器人数据采集与高成本物理仿真环境开发。A2World-sim 可直接通过少量场景数据微调获得专用仿真器,大幅降低 sim-to-real 迁移成本。
  • 部署加速:同一预训练权重可同时服务于 仿真评估策略生成,缩短从 model training 到 on-robot deployment 的周期,提升产品迭代速度。
  • 体验提升:更强的动力学先验使策略在面对未见物品或干扰时更鲁棒,在 电商订单履行医院物资配送 等非结构化环境中提升任务成功率与安全性。

与现有工作流的集成

  • 集成方式:A2World 以扩散模型为基础,可无缝对接现有 ROS2 / Isaac Sim / WebRTC 等机器人中间件。微调后的 A2World-sim 可作为推理节点输出未来图像帧,替代 Gazebo 等传统仿真器的物理计算。A2World-policy 可直接嵌入 VLA 流水线,作为 RT-2、Octo 等模型的替代或互补组件。
  • 数据接口:预训练使用通用 (action, multi-view video) 格式,适配现有公开数据集(如 Open X-Embodiment),降低数据整理成本。

代表性用例

  1. 大型配送中心机械臂拣选:先用 A2World 在架上物品种类变更时快速微调具身仿真环境,避免停机重新标注真实数据;再用同一预训练权重生成闭环抓取策略,减少 30% 以上的真机调试次数。
  2. 自动驾驶领域的世界模型仿真:将 A2World 架构应用到车辆周边多相机输入,预测未来交通参与者的动态视像,为规划模块提供可编辑的 what-if 测试工具,与现有基于 NeRF/3DGS 的仿真方法相比,对物体交互的泛化能力更强。

局限

  • 动作条件的预训练高度依赖大规模真实机器人操作数据,且需要精确的动作标注,数据采集成本高昂,限制了该方法在低资源场景下的适用性。此外,多视图交互的设置进一步增加了数据采集和模型训练的复杂度。
  • 基于扩散模型的视频生成在推理阶段需要多次去噪步骤,导致模拟器响应速度较慢,难以满足需要高频实时交互的在线策略训练或部署需求,而本文主要展示离线策略评估和 what-if 分析,实时性方面未做充分评估。
  • 尽管展示了可迁移性,但模型在不同任务和场景间的泛化能力仅通过有限的仿真和真实机器人实验评估,所得动力学先验是否真正捕获了物理交互的通用规律,而非仅仅记忆训练数据中的动作-视觉关联,仍有待更大规模、更多样化环境的验证;同时,长时域 rollout 的误差累积问题未深入分析。
论文Ze Huang2026-06-28原文

相关内容