论文

ZimaBlue: 通过可扩展的视频预训练演化通用世界动作模型

ZimaBlue: 通过可扩展的视频预训练演化通用世界动作模型

机器人操控面临根本性的扩展难题:鲁棒泛化需要广泛的物理经验,然而带有动作标注的机器人轨迹采集成本高昂且多样性天然受限。第一人称视频提供了更可扩展的具身经验来源,捕捉了多样环境中的物体交互、接触动力学、工具使用和长时程行为。核心挑战在于如何将这种丰富但无动作标注的经验转化为有效的机器人控制。 我们提出 ZimaBlue,一个从大规模视频中学习可泛化 世界动作模型(WAMs) 的可扩展框架。ZimaBlue 采用三阶段训练课程:首先在大规模人类与机器人第一人称视频上进行因果具身视频预训练;随后通过视频-动作中期训练与统一动作表示,将学习到的视觉动态锚定到异构机器人轨迹上;最后针对目标机器人进行专门化以部署。 为使生成式 WAM 适用于实时控制,ZimaBlue 进一步采用异步慢-快双系统架构:高容量的慢世界模型提供可泛化的时空表示,轻量快分支在 NVIDIA RTX 4090 上实现 30 Hz 动作预测。在真实机器人零样本评估中,将训练数据从仅目标机器人数据扩展到超过 120,000 小时的具身视频,成功率从 36.1% 提升至 77.8%。ZimaBlue 在多个基准上均表现强劲,在未见任务上优势尤为显著。

论文精读

TL;DR ZimaBlue 利用 12 万小时 egocentric 视频预训练学习可泛化 World Action Model,通过三阶段课程和 Slow-Fast 异步架构,将零样本真实机器人操作成功率从 36.1% 提升至 77.8%。

问题

问题背景

机器人操作领域当前正探索如何利用规模化数据训练通用策略,从单一任务扩展到开放环境泛化。

现有方法局限

  • 动作标记机器人轨迹采集成本极高,多样性受限;而大规模第一人称视频虽覆盖丰富交互(接触动力学、工具使用、长程任务),却缺乏动作标签,无法直接监督策略学习。
  • 现有视频预训练方法多停留在学习视觉表征或行为先验,仍需大量下游机器人数据微调,泛化到新任务、新机器人时性能显著下降。
  • 世界模型虽能预测未来状态,但转换为实时动作推理存在延迟高、计算成本大问题,且面对异构动作空间(不同机器人自由度、末端执行器)难以统一表示。

为什么这个问题难/重要

  • 从海量无动作视频中提取可操作知识需要同时解决:因果时序建模、跨域动力学迁移、统一动作表示、高频实时控制。技术难点在于视频像素与机器人动作之间存在巨大语义鸿沟,且真实物理交互的接触、摩擦等特性难以从纯视觉中精确恢复。
  • 业界对通用机器人基础模型投入持续加大,但缺乏规模化数据与高效训练协议是普遍瓶颈;该问题一旦突破,可大幅降低机器人数据成本,加速从感知到控制的闭环。

行业类比

类似从互联网文本预训练到指令微调的大语言模型范式,但机器人操作需要处理连续视觉运动与物理约束,类比于从无监督视频中涌现出可执行的动作策略。

核心洞察

  • 无动作视频预训练可显著提升零样本泛化:ZimaBlue 利用 120,000 小时自我中心视频学习通用世界动力学,再通过统一动作表示将异构机器人轨迹接地。与仅依赖机器人演示的 VLA 模型不同,它从海量人类视频中提取接触动力学、工具使用等先验,在无动作标签情况下实现 36.1%→77.8% 的成功率跃升,证明视频数据可作为扩展机器人控制的关键杠杆。
  • 异步 Slow-Fast 双系统架构让大型生成式世界模型可实时部署:Slow 分支高容量提取泛化时空表示,Fast 分支轻量并以 30 Hz 预测动作,两者异步协同。相比单一大模型的高延迟或轻量模型的表示不足,该设计解耦了表示学习与控制频率,通过 RTC 保持时序一致性,为具身模型走向真实机器人提供了一条工程可行路径。

方法

方法概述

ZimaBlue 的核心是三阶段课程 + 异步 Slow-Fast 双系统,从大规模无动作自我中心视频中学习可泛化的世界动作模型 (WAM)。

输入:海量人类与机器人自我中心视频(无动作标签)及异构机器人轨迹(有动作标签)。

关键模块与流程

  1. 统一动作表示:将不同机器人本体的动作映射到统一的语义空间,包含语义槽布局(任务相关物体的位置)、块相对动作几何(末端执行器相对于物体的运动)和有效性掩码(指示当前动作是否有效)。
  2. 三阶段训练:
    • Stage I:在超过 12 万小时的自我中心视频上进行因果具身视频预训练,使用扩散模型学习时空动态先验。
    • Stage II:在异构机器人轨迹上进行视频-动作中间训练,将视觉动态与统一动作表示对齐。
    • Stage III:针对目标机器人进行后训练,包括慢分支领域专用化和快分支训练。
  3. Slow-Fast 双系统:
    • Slow 世界模型:高容量 DiT 主干,生成可泛化的时空表征和慢速动作引导。
    • Fast 分支:轻量 DiT,接收 Slow 的中间表征进行闭环细化,在 RTX 4090 上实现 30 Hz 实时动作预测。
    • 异步推理:Slow 分支低频更新(例如每 N 步),Fast 分支高频执行,通过时间一致性约束 (RTC) 保持动作平滑。
    • 步骤蒸馏:将 Slow 分支的知识蒸馏到 Fast 分支,进一步减少推理延迟。

输出:针对目标机器人本体的实时动作序列。

与同类方法的差异

不同于直接训练视觉-语言-动作 (VLA) 模型或独立的视频预测世界模型,ZimaBlue 通过从纯视频预训练到动作接地再到目标特化的课程,以及异步双系统架构,在保持高泛化能力的同时实现了实时部署。

实验

实验设计

ZimaBlue 在真实机器人上执行零样本评估,对比仅用目标机器人数据与加入超 12 万小时自我中心视频预训练的版本。评估任务覆盖未见场景和目标交互,同时在不同仿真基准(LIBERO-Plus、RoboTwin 2.0、RoboCasa365)上测试跨环境泛化。推理采用 Slow-Fast 异步双系统,Fast 分支在单张 NVIDIA RTX 4090 上以 30 Hz 输出动作。

关键发现

  • 将训练数据从仅目标机器人扩展至大规模视频后,零样本成功率从 36.1% 提升至 77.8%,相对提升超过一倍。
  • 在多个基准上表现强劲,尤其对未见任务提升明显,表明视频预训练能提供可迁移的物理先验与操作常识。

基线对比解读

与仅用目标机器人数据的常规训练相比,ZimaBlue 的核心增益来自第一阶段的因果视频预训练。这说明大规模无动作视频可作为有效的物理上下文先验,弥补机器人轨迹多样性不足。同时,Slow-Fast 架构将高容量世界模型的通用表征与轻量快速分支解耦,避免大模型推理延迟牺牲实时控制,为部署提供了工程上的可行路径。与纯端到端 VLA 相比,该方法显式建模世界动态,在数据稀缺场景下可能更有优势。

行业影响

落地场景

ZimaBlue 训练 World Action Models (WAMs),从大规模 egocentric 视频中学习通用操作策略,可直接落地于需要机器人泛化能力的场景。例如:

  • 电商仓储自动化:利用人类操作视频进行预训练,降低对特定仓库机器人动作标注的依赖,快速适配分拣、打包等任务。
  • 家庭服务机器人:应对长尾、非结构化环境中的物体操作,通过视频预训练提升对未见物体的成功率。

商业价值

  • 降本:用互联网视频代替昂贵的机器人动作标注,显著降低数据采集与标注费用;预训练模型复用,缩短每个新任务的开发周期。
  • 增收:更强大的零样本泛化使机器人能承担更多任务,扩大自动化服务范围,提高机器人产品竞争力。
  • 体验提升:Slow-Fast 双系统 异步推理保障 30Hz 实时控制,可直接部署在边缘设备(如 RTX 4090),加速产品化落地。

跟现有产品/工作流的接口

  • 与现有 Vision-Language-Action (VLA) 模型兼容:可将 ZimaBlue 的预训练权重作为初始化,再用目标域少量数据微调,替换或增强现有策略网络。
  • 集成到现有机器人软件栈:模型输出统一动作表示,可对接 ROS 2 或专有中间件;慢分支离线更新世界表征,快分支在线执行,不影响控制闭环。
  • 对 AI 团队的可借鉴点:三阶段课程(视频预训练 → 视频-动作中训练 → 目标域微调)可作为标准范式,适用于其他具身智能或时序决策场景。

局限

  • **训练与推理成本较高**:ZimaBlue 的 Stage I 视频预训练使用了超过 120,000 小时的具身视频数据,即使采用异步慢-快架构,慢分支的高容量生成式模型仍然带来显著的计算开销;Fast 分支虽可达 30 Hz 推理,但慢分支的延迟和显存占用可能限制其在计算资源受限场景下的部署。论文未提供详细的训练算力需求和碳排放分析,对实际工程落地是一大障碍。
  • **零样本评估任务范围有限**:真实机器人实验集中在桌面操作、拾取放置等任务,且成功标准可能偏向较简单的几何操作;对于涉及柔性物体、多步长时程规划或接触丰富任务,其 77.8% 的成功率是否依然成立存疑。此外,跨机器人形态(如移动操作、多指手)的泛化未经验证,统一行动表示在更复杂执行器上的有效性有待检验。
  • **视频-行动中间训练仍需异构机器人数据**:Stage II 要求大量多机器人轨迹数据来桥接视频与行动,虽然比纯目标机器人数据便宜,但这类异构轨迹的收集与标准化仍是门槛;若数据源覆盖不足,模型可能在未见过的机器人构型或 action space 上表现下降,削弱其宣称的“通用性”。
论文Xionghao Wu2026-08-31原文

相关内容