UniWAM: 统一的世界-动作模型
Vision-language-action (VLA) 模型受益于预训练视觉语言模型的理解与推理能力,但仅靠动作监督难以充分扎根于世界动态;而 world-action 模型 虽从视频生成模型继承了时空先验,在分布偏移下的语义理解与推理仍然受限。 本文提出 UniWAM,一个统一架构,将物理推理器、世界生成器与动作预测器整合在一起,联合学习对物理世界的语义理解、视觉生成与动作预测。为保证训练数据质量,作者为人类第一视角数据与机器人数据设计了严格的数据清洗与标注流程。 为让视觉语言组件适配具身任务并保留其语言能力,作者用自然语言表示底层动作,并提出一套预训练配方,把来自 VQA 数据、人类第一视角数据与机器人演示的互补监督分配给相应的模型组件。在后训练阶段,未来视觉噪声增强降低了对精确未来预测的依赖,而以历史为条件的 flow matching 利用编码后的动作历史初始化动作生成,二者共同在保持性能的同时显著减少去噪步数。 UniWAM 在分布内性能、鲁棒性、泛化性、指令跟随与长程任务执行等多项评测中达到 SOTA。此外,作者发现统一的人-机器人协同训练呈现对数线性 scaling law,验证了大规模人机混合数据预训练的有效性。
论文精读
TL;DR UniWAM 统一世界-动作模型,融合物理推理、世界生成与动作预测,通过语言化动作、混合人类/机器人预训练及后训练增强,在多项评测达到 SOTA 并揭示联合训练的对数线性缩放定律。
问题
问题背景
具身智能领域正从单一动作预测转向构建能理解物理世界、预测未来并执行动作的统一模型。视觉-语言-动作(VLA)模型与基于视频生成的世界-动作模型是两条主要技术路线。
现有方法局限
- VLA 依赖预训练 VLM 的语义理解和推理,但动作监督信号稀疏且低维,难以充分约束模型对物理动态、因果关系的建模,导致世界 grounding 不足。
- World-action model 继承视频生成模型的时空间先验,擅长生成未来帧,但在分布偏移下语义理解与指令跟随能力下降,且与语言推理脱节。 两者割裂导致模型无法同时具备语义推理、视觉预测与动作执行能力。
为什么这个问题难/重要
核心挑战在于:如何统一多模态输入与输出,平衡语义理解与物理生成,并设计高效训练策略(如数据清洗、监督信号分配、推理加速)。此外,人类数据与机器人数据的异构性带来联合训练的 scaling 难题。工业界高度关注大规模预训练模型在长程任务、鲁棒性和泛化性上的表现,统一架构有望降低部署成本。
行业类比
类似自动驾驶领域从模块化感知-规划-控制走向端到端统一模型的过程,Embodied AI 也需要一个整合世界理解与动作生成的“基座模型”。
核心洞察
- UniWAM 通过统一架构整合物理推理器、世界生成器和动作预测器,用互补监督信号缓解 VLA 与世界模型各自的局限性。与现有 VLA 仅依赖动作监督导致世界动态 grounding 不足、世界模型缺乏语义推理不同,UniWAM 将 VQA 数据、人类自我中心视频和机器人演示分别用于物理语言监督、视觉生成和动作预测,使模型同时具备物理理解、视觉预测和动作控制能力。这种多组件联合训练避免了分离式模型的信息传递瓶颈,显著提升分布外泛化与长程任务执行性能。
- 将低层动作编码为自然语言,结合 history-conditioned flow matching 和 future visual noise augmentation,实现高效且鲁棒的动作生成。该设计让预训练 VLM 的语言理解能力直接迁移到动作空间,无需重新学习动作解码器;同时通过在训练时向未来帧注入噪声,减少对精确视觉预测的依赖,使模型在部分观测或动态环境中更强健。history-conditioned flow matching 以历史动作特征初始化去噪过程,将推理步数显著降低(例如从数十步到个位数),同时保持性能,对实时机器人控制极具工程价值。
- UniWAM 在人类和机器人混合数据上预训练,揭示了 log-linear scaling law,证明规模化共训练的有效性。与仅用机器人演示或仅用人类视频预训练相比,UniWAM 发现混合数据下的性能随数据量呈对数线性增长,且人类数据对机器人任务有正向迁移。这为数据策略提供定量依据:工程上可优先扩充低成本人类自我中心数据来提升机器人模型性能,而非盲目收集昂贵机器人演示,为具身智能的大规模预训练提供明确指导。
方法
输入与整体架构
UniWAM 接收三类数据:机器人演示(低层动作轨迹)、人类自我中心视频(第一视角交互)、视觉问答(VQA)数据。统一架构包含三个核心模块:物理推理器(基于预训练视觉语言模型)、世界生成器(视频生成 backbone)、动作预测器。三者共享多模态表征,同时输出语义理解、未来视觉帧和动作序列。
预训练策略
- 将低层动作表示为自然语言模板(如
move arm forward),使动作空间对齐语言空间,保留 VL 模型的语义能力。 - 训练时互补监督分配:VQA 数据只优化物理推理器,维护常识推理;人类自我中心数据优化世界生成器与推理器,注入物理先验;机器人演示优化动作预测器和世界生成器,提供精确控制信号。
- 目标联合优化语义对齐、视频重建和动作预测损失,避免灾难性遗忘。
后训练优化
- 未来视觉噪声增强:在预测未来帧时注入噪声,减少模型对精确未来状态的依赖,提升分布外鲁棒性。
- 历史条件流匹配:将编码后的动作历史作为流匹配的初始条件,加速动作去噪生成,在维持性能前提下大幅减少推理步数。
与同类方法差异
与单纯 VLA(仅动作监督)或世界模型(仅视频预测)不同,UniWAM 首次将物理推理、世界生成、动作预测三个目标统一到一个架构中,并通过人类-机器人协同预训练实现语义-动态-控制的一致性。
实验
实验设计
UniWAM 在模拟环境与真实机器人上进行了系统性评估,覆盖分布内性能、鲁棒性、泛化、指令跟随和长程任务执行。基准测试包括 RoboTwin 2.0 等标准平台,并通过消融实验验证各组件贡献。此外,专门设计了人类自我中心数据与机器人数据联合训练的 scaling law 分析。
关键发现
- UniWAM 在各项评估中均达到 SOTA 水平,验证了统一架构的有效性。
- Future visual noise augmentation 与 history-conditioned flow matching 两项设计显著减少去噪步骤(inference 步数),同时保持动作生成质量。
- 在人类-机器人协同预训练中观察到 log-linear scaling law:随着混合数据规模增大,性能呈对数线性提升,揭示大规模混合预训练的潜力。
与基线对比解读
相较仅依赖动作监督的 VLA 模型,UniWAM 通过世界生成模块获得更扎实的物理动态接地,缓解了动作-only 监督的局限;相较以视频生成为核心的 WAM 模型,UniWAM 保留了视觉语言模型的语义理解与推理能力,在分布偏移下表现更稳健。统一架构并非简单叠加,而是通过互补监督分配(VQA / 人类自我中心 / 机器人演示)让各组件各司其职,从而在复杂具身任务上取得全面优势。
行业影响
落地场景
UniWAM 统一世界-动作模型可支撑具身智能数据飞轮、机器人操作云服务、多模态交互助手。在电商仓储分拣、内容平台视频生成、自动驾驶仿真等场景,其联合预测未来视觉与动作的能力可降低对海量真实机器人遥操作数据的依赖。
商业价值
- 降本:利用 VQA+人类 egocentric+机器人 混合预训练和未来帧噪声增强,在保持性能下大幅减少推理去噪步数,直接降低 GPU 推理成本。
- 增收/体验:其物理推理与指令跟随能力可应用于电商仓库拣选机器人、AR/VR 内容生成助手,提升任务成功率与交互自然度。
- 作者揭示的 log-linear 人机共训 scaling law 说明扩大混合数据规模可稳定提升模型能力,为产品化数据策略提供依据。
与现有工作流接口
- 对现有 VLA/世界模型栈:UniWAM 可作为 drop-in 替换/增强,其动作用自然语言表示,兼容现有 LLM 微调工具链。
- 推理优化:history-conditioned flow matching 可将推理步数从多步降到极少数,适合在边缘/云端服务化部署。
- 数据管线:需引入高质量人类 egocentric 数据清洗与标注模块,可接入 MLOps 数据版本管理与标注平台。
具体场景
- 电商履约中心:用 UniWAM 驱动多关节拣选机械臂,结合未来视觉预测,处理透明/反光物体时鲁棒性更高,减少人为干预。
- 企业服务/视频平台:在虚拟拍摄或数字人内容生产中,用其世界生成能力实现“给定指令->未来帧+动作”的自动化,缩短视频制作周期。
局限
- UniWAM 同时训练世界生成与动作预测模块,模型参数量和计算开销显著高于单一的 VLA 或 world-action model。虽然 history-conditioned flow matching 减少了去噪步数,但推理时仍需多个模块协同,真实机器人要求的高频控制(通常 ≥10Hz)下实时性可能不足。论文未报告推理延迟、模型大小或实际部署成本,工程落地面临挑战。
- 统一人类自我中心和机器人数据需要复杂的清洗与标注流程,且当前数据来源和任务范围有限。低层动作表示为自然语言可能损失空间精度,在精细操作或动态环境中效果未知。评估集中在模拟和有限真实场景,对未见物体、新环境或异构机器人平台的泛化性仍需更多实验验证。
- 虽然统一架构旨在兼顾世界理解和动作预测,但论文未展示纯视觉生成质量或单任务语言理解基准上的表现,在这些子任务上可能不如专用模型。此外,human-robot co-training 的 log-linear scaling law 基于当前数据规模范围拟合,外推到更大规模或不同数据配比时是否稳健尚不明确。