OpenWAM:面向系统性 World-Action Model 预训练的开源、模块化探索
World-Action Models(WAM)从视频生成先验中继承世界知识,再通过具身经验将其转化为可执行的控制信号。然而现有系统多为单体式:生成骨干、视觉表征、架构、信息流、推理过程与训练数据彼此紧密耦合,难以辨明哪些设计选择真正重要、以及原因何在。 我们提出 OpenWAM,一个开放研究栈,把 world-action 预训练转化为可控的实验计划。其中 OpenWAM-Infra 将 WAM 设计空间分解为可组合模块,并统一训练、推理、部署与评估;在此基础上,OpenWAM-Study 通过受控实验回答三个问题,并提炼出三条原则: 1. 继承什么:上游知识需经由足够强的生成骨干与紧凑、信息丰富的 latent space 传递; 2. 如何交互:world-action 协同依赖专属动作容量、显式的 world-to-action 信息流与同步联合去噪; 3. 如何规模化:具身预训练主要提升域外泛化,在 egocentric 与机器人数据上做单阶段共同训练可整合世界覆盖与动作 grounding。 综合这些原则,我们构建 OpenWAM-α,基于约 6,400 小时 egocentric 人类与机器人数据预训练。在八个仿真基准与真实机器人实验中(涵盖单臂、双臂操作到灵巧手),OpenWAM-α 均表现优异,从仿真到物理世界保持顶尖水准。我们开源完整技术栈,包括基础设施、评估协议、预训练模型与数据配方。
论文精读
TL;DR OpenWAM 将世界-动作模型预训练拆解为可组合模块,通过受控实验提炼三条设计原则,并推出基于 6,400 小时人类与机器人数据预训练的 OpenWAM-α,在仿真与真实机器人基准中稳定领先。
问题
问题背景:具身智能领域当前聚焦于 World-Action Models (WAMs),即从视频生成先验中继承世界知识并转化为可执行控制信号,以构建通用机器人策略。
现有方法局限:现有 WAM 系统多为单体架构,生成骨干、视觉表示、架构、信息流、推理流程与训练数据紧密耦合,难以隔离变量,导致设计选择缺乏系统性消融。例如,无法判断是生成骨干的能力还是潜在空间的表示决定了迁移效果;联合训练策略的贡献也被混杂因素掩盖。这限制了模型的可复现性与可扩展性。
为什么这个问题难/重要:WAM 涉及多组件协同,搜索空间巨大;从视频先验到动作控制的迁移需要精细对齐,同时优化生成质量与控制精度;缺乏开源基准和统一评估阻碍了社区进展。业界对通用机器人策略需求迫切,但透明可复现的研究栈稀缺,因此解耦设计空间并提炼可泛化原则至关重要。
行业类比:类似 LLM 预训练中对词表、位置编码、注意力机制进行受控消融以找到可扩展配方,OpenWAM 将 WAM 预训练变为受控实验程序,为具身模型提供模块化研究基础设施。
核心洞察
- OpenWAM 的方法论贡献是将世界-动作预训练的设计空间因子化为可组合模块,使生成主干、潜在空间、信息流、推理过程和数据配方均可独立消融。与以往 monolithic 系统不同,OpenWAM-Infra 统一了训练、推理、部署与评估,让每个变量的影响可量化归因,从而蒸馏出三条实证原则。这为工程团队提供了可复用的研究基座,避免重复搭建耦合管道,加速假设验证。
- 世界-动作协同的核心机制是同步联合去噪与显式的 world-to-action 信息流,而非独立模块串行或两阶段训练。许多现有 VLA 将世界预测与动作生成分离训练,导致未来状态信息无法有效约束动作分布;OpenWAM 在单一去噪过程中联合优化,强制动作 head 与预测的世界表征共享同一时序上下文,提升控制一致性。工程上这提示:设计统一去噪目标比独立模块拼接更能获得鲁棒策略。
- OpenWAM 的 embodied pretraining 数据配方采用 one-stage co-training,将 egocentric 人类视频与机器人数据在同一训练阶段混合,而非先人类后机器人的 curriculum。这一选择的关键依据是:单独用人类视频缺乏动作接地,单独用机器人数据则世界覆盖不足;单阶段联合训练使模型在表征早期就平衡泛化性与可执行性,显著改善 out-of-domain 性能。对数据工程来说,数据配比和阶段安排与模型架构同等重要。
方法
输入与总体架构
OpenWAM 将世界-动作预训练分解为可组合模块。输入为视频帧与机器人动作指令,经生成骨干(从视频生成先验继承)编码为紧凑、信息丰富的潜在空间表示,再通过动作头解码为控制信号。
关键模块与信息流
- 生成骨干:采用预训练视频生成模型作为世界知识来源,提供对物理动态和场景理解的先验。
- 潜在空间:紧凑且信息丰富,作为世界表示与动作策略之间的桥梁。
- 世界到动作信息流:显式连接世界表示与动作预测,确保世界知识可被动作策略利用。
- 联合去噪:世界生成与动作预测同步进行去噪,促进协同学习。
- 动作容量:分配专用参数容量处理动作学习,避免与生成任务竞争。
训练与推理
OpenWAM-Infra 提供统一训练、推理、部署、评估管线。预训练采用单阶段联合训练,混合自我中心人类视频与机器人数据,整合世界覆盖与动作接地。推理时根据观测和指令生成动作。
与同类方法的差异
与现有将生成骨干、视觉表示、架构、信息流、推理过程和训练数据紧密耦合的单一系统不同,OpenWAM 通过模块化设计将各组件解耦,并以受控实验揭示关键设计原则,而非依赖隐式工程选择。
实验
实验设计
OpenWAM-Study 在 OpenWAM-Infra 模块化底座上开展三项受控实验:继承什么、世界与动作学习如何交互、协同如何扩展。预训练数据约 6400 小时 egocentric human + robot 混合语料,覆盖单臂、双臂、灵巧手等 embodiment。评估覆盖 8 个仿真基准与真实机器人任务。
关键发现
- 上游知识迁移 依赖足够强的生成主干与紧凑高信息量潜在空间。
- 世界-动作协同 需要专用动作容量、显式世界到动作的信息流、以及同步联合去噪。
- 具身预训练 主要提升分布外泛化;单阶段 co-training 同时整合世界覆盖与动作接地。
基线对比解读
对比现有 monolithic 系统(耦合生成主干、表征、架构、推理流程),OpenWAM-α 通过受控解耦揭示了关键设计选择的影响。在仿真到真机的跨 embodiment 场景中保持 top-tier 表现,说明模块化框架并未牺牲性能,反而能定位有效成分。工程启示:后续 WAM 研究应先分离模块进行消融,避免黑箱调优;同时数据配方中 egocentric 与 robot 数据的联合训练对泛化至关重要。
行业影响
落地场景
OpenWAM 提供统一的世界-动作预训练框架,可直接应用于机器人操作、自动驾驶仿真、具身智能产品。典型场景:
- 电商仓储:拣选/打包机器人利用人类自我中心视频预训练,快速学习抓取新奇物体,减少新 SKU 的现场示教时间。
- 服务机器人:通过世界模型预测动作后果,提升人机协作安全性,可集成到酒店、医疗辅助等交互场景。
- 自动驾驶:将视频生成先验与车辆控制信号协同,改进仿真环境中的 long-tail 场景泛化。
商业价值
- 降本:预训练模型显著降低真实机器人数据采集成本(论文指出主要改善域外泛化),企业无需为每个新任务重新收集大量标注数据。
- 增效:模块化设计允许复用生成骨干和潜在空间,缩短研发周期;开源全栈(GitHub)降低准入门槛。
- 体验提升:在八个仿真基准和多种真实机器人形态(双臂、灵巧手)上稳定领先,证明从仿真到现实的迁移能力,可加速产品落地。
与现有产品/工作流的接口
OpenWAM-Infra 将设计空间分解为可组合模块(生成骨干、视觉表示、架构、信息流、推理流程)。企业可:
- 替换骨干为内部视频生成模型(如 Sora 类架构),或接自定义潜在空间编码器。
- 通过统一训练/推理/部署接口,集成到现有机器人学习栈(ROS 2、Isaac Lab、PyTorch)。
- 使用发布的评估协议和数据配方,快速建立基准测试,对比自有方案的差距。
典型集成路径:数据侧将 egocentric 视频与机器人数据混合训练;推理侧采用同步联合去噪,在边缘设备上通过 TensorRT 部署。
局限
- OpenWAM 通过分解设计空间并做控制实验提炼原则,但探索空间本身受限于所选模块集合(如固定几种 video-generative prior、latent tokenizer 和 fusion 方式)。论文未系统覆盖更广泛的骨干架构(如 DiT 之外)、更高维的 latent 表示或语言指令嵌入,因此提炼的三条原则可能存在偏差或过拟合于其特定 infra 实现。同时,所有结论基于单目 RGB 视频和单一观测模态,对于深度、触觉、音频等多模态输入下的 WAM 设计缺乏验证,迁移到这些场景时需重新审视。
- 预训练数据约 6,400 小时,虽然涵盖 egocentric human 和 robot 数据,但相比大规模视频基础模型常见的数据量级仍偏小,可能限制了世界知识的广度和细粒度动作理解。真实机器人实验虽然覆盖单臂、双臂和灵巧手,但每个平台的任务数量、重复次数和场景多样性未详细报告,且主要验证短期操作,未测试长时程任务规划、动态环境适应和持续学习。sim-to-real 迁移虽然在文中标为强项,但缺乏对真实世界分布偏移(光照、视角、物体实例)的量化分析,结论的稳健性有待更多第三方复现。
- OpenWAM 的模块化设计强调可组合和可分析,但额外抽象层和显式信息流可能引入推理延迟或容量瓶颈;在严格实时控制或高动态任务中,其相对 monolithic 模型的响应性和端到端优化空间可能不足。同时,与最新的大规模 embodied foundation models(如 RT-2、Octo、π0 等)对比不够充分,尤其缺少在相同数据规模和算力预算下的公平基准,因此难以判断 OpenWAM-α 的性能优势是来自设计原则,还是来自数据配方和训练策略的差异。