论文

GE-Act 2.0:面向机器人操作的 World-Action Model 预训练与规模化

GE-Act 2.0:面向机器人操作的 World-Action Model 预训练与规模化

World-Action Model(WAM)通过预测未来状态来指导机器人动作,因而既能从无动作视频、也能从带动作标注的交互中学习。然而多数 WAM 直接继承预训练视频生成器,其自身的预训练与规模化仍未被充分探索。 我们提出 Genie Envisioner Act 2.0(GE-Act 2.0),其可训练的生成与动作组件全部在操作数据上从零初始化,包含三部分: 1. 面向控制的自编码器(CoAE),在激进压缩下仍保留动作与指令相关信息; 2. 单步视觉规划器(SVP),在单次可微前向中产出完整未来状态; 3. 逆动力学模型(IDM)。 三者可先在互补数据上分别预训练,再用知识对齐选择性优化(KASO)联合训练,通过只保留行为上与真实动作兼容的预测未来,减少监督错配。 我们在 20 个操作技能组、共 100 个任务上直接评测预训练 checkpoint,不做逐任务微调,并使用留出的场景、背景、光照与物体实例。协同训练数据由 300 小时扩至 30,000 小时,G1-OP 成功率从 17.1% 升至 44.1%,G2-90D 从 13.4% 升至 31.1%;后者仅占不到 2% 的数据却提升 17.7 个点,提示存在跨本体迁移。 增益覆盖 19/20 与 18/20 个技能组,技能覆盖度与零样本 OOD 成功率强相关(Pearson r=0.80;Spearman rho=0.85)。相同协议下,模型在至少 90% 的试验中正确 grounding 物体、颜色、形状与位置指代,即便显式指令与已提交行为或常规场景关联相冲突也能遵循。

论文精读

TL;DR GE-Act 2.0 从零预训练世界-动作模型,联合控制导向自编码器、单步视觉规划器和逆动力学模型,在 100 个操作任务上零样本泛化,成功率随数据规模从 17.1% 提升至 44.1%。

问题

问题背景

机器人操作领域正在从单一任务策略转向通用世界-动作模型 (World-Action Model, WAM),这类模型预测未来视觉状态并据此生成动作,能够同时利用无动作视频与带动作交互数据,以提升跨场景、跨本体的泛化能力。

现有方法局限

当前大多数 WAM 直接继承预训练视频生成器作为视觉主干,存在三个关键缺陷:

  • 目标错位:视频生成器以像素级重建为目标,会保留大量与控制无关的视觉细节,同时可能丢失与动作、指令相关的判别性信息,导致下游动作预测的监督信号被削弱。
  • 训练割裂:生成模块与动作模块分开训练或微调,无法端到端联合优化世界模型与动作策略,限制了模型在机器人数据上的可扩展性。
  • 数据利用低效:预训练视频生成器通常需要多步扩散采样,难以在单步内完成未来状态预测,导致无法高效利用大规模动作标注数据进行对比学习或自监督预训练。

由于这些限制,WAM 的预训练和扩展规律(scaling law)在机器人操作领域几乎未被系统探索,模型性能上限受限于继承的视频生成器。

为什么这个问题难/重要

机器人操作数据具有高维、异构、标注稀缺的特点,同时要求模型在极低延迟下输出可执行动作。从零开始训练一个既能生成未来状态又能预测动作的统一模型,需要解决表示学习(哪些视觉信息对控制重要)、生成效率(如何单步生成完整未来)和动作对齐(预测的未来与真实动作是否兼容)三重挑战。业界对零样本 OOD 操控和跨 embodiment 迁移的关注度持续上升,因为真实场景无法为每个新任务、新环境、新本体单独收集大规模微调数据。

行业类比

这类似于语言模型从“预训练视频生成器微调”转向“原生多模态预训练”的范式变迁:与其在通用文本模型上嫁接视觉,不如从数据到目标函数都面向机器人控制原生设计,才能充分释放规模化潜力。

核心洞察

  • 从零预训练世界-动作模型的关键在于用控制导向自动编码器 CoAE 替代通用视觉重建目标:CoAE 在强力压缩下保留动作与指令相关信息,而非追求像素级还原。这不同于直接继承预训练视频生成器的主流做法,后者往往保留大量与控制无关的视觉细节,导致后续动作对齐困难。CoAE 允许使用海量无动作视频进行视觉规划预训练,再与逆动力学模型在互补数据上分离训练,大幅提升数据利用率和可扩展性。
  • 单步视觉规划器 SVP 作为世界-动作接口,将未来状态生成压缩为一次可微前向,避免迭代去噪的不可微瓶颈,从而让视觉规划与逆动力学模型可分离预训练。这与使用扩散模型逐步生成未来帧的工作形成对比,后者通常难以端到端优化动作映射。SVP 的多尺度预测与条件 MeanFlow 设计,使模型能在极低计算预算下快速产生完整未来状态,为大规模联合训练提供可行路径。
  • 知识对齐选择性优化 KASO 通过只选择与记录动作行为兼容的预测未来进行监督,缓解了视觉规划与动作标签之间的有效性差距。相比于直接对预测未来施加动作损失,KASO 避免了在动作与生成未来不一致时产生冲突梯度,使世界-动作模型能够在大规模混合数据上稳定联合训练。这种选择性机制对于利用他人演示、跨本体数据等动作噪声较大的来源至关重要,是零样本泛化能力的重要保障。

方法

输入与整体架构

GE-Act 2.0 的输入包括机器人操作视频、语言指令以及可选的记录动作(仅交互数据)。系统由三个可训练模块组成:控制导向自编码器 (CoAE)、单步视觉规划器 (SVP) 和逆动力学模型 (IDM)。

关键模块与流程

  1. CoAE:对输入帧进行激进压缩编码,通过多教师对齐(而非单纯重建)保留与控制和指令相关的信息,确保低维隐空间中动作和语言信号仍可解读。
  2. SVP:基于压缩隐状态和指令,执行单步可微生成,直接输出完整未来状态。单步特性使视觉规划与逆动力学可以分开预训练:SVP 利用无动作视频,IDM 利用动作标记的交互数据。
  3. IDM:从当前状态与 SVP 生成的未来状态对中推断应执行的动作。
  4. KASO:在联合训练阶段,使用行为兼容性判别器筛选 SVP 产生的预测未来,仅保留与记录动作一致的样本进行优化,从而减少跨模块监督冲突。

输出与工程启示

给定新场景观察和指令,链式执行 CoAE → SVP → IDM,输出机器人动作。这种模块化设计允许不同数据源独立利用,并通过 KASO 对齐知识,避免了昂贵的一致标签需求。

与继承大规模视频生成器的方法不同,GE-Act 2.0 从零开始训练全部参数,专门针对操作任务优化,从而在数据 scaling 时表现出更好的跨技能泛化与零样本 OOD 性能。

实验

实验设计

评估协议为零样本 OOD 泛化,不进行 per-task 微调,覆盖 100 个任务、20 个操作技能组,测试场景包含 held-out 场景、背景、光照与物体实例。训练数据由 300 小时扩展至 30,000 小时,评估两个主要基准:G1-OP 与 G2-90D。模型组件 CoAE、SVP、IDM 分别预训练后,采用 KASO 联合优化;模拟迁移测试在 RoboTwin、GenieSim-Instruction、LIBERO-Plus 上进行。

关键发现

数据规模扩展带来显著提升:G1-OP 成功率从 17.1% 升至 44.1%,G2-90D 从 13.4% 升至 31.1%。值得注意的是,G2-90D 仅占联合训练数据的 <2%,却提升 17.7 个百分点,暗示跨 embodiment 知识迁移。增益覆盖 19/20(G1-OP)和 18/20(G2-90D)技能组,且技能特定覆盖率与 OOD 成功率强相关(Pearson r=0.80,Spearman rho=0.85)。模型在至少 90% 的试验中能正确接地对象、颜色、形状、位置引用,并能遵循与既有行为或常规场景关联冲突的显式指令。

与基线对比解读

与多数继承预训练视频生成器的 WAM 相比,GE-Act 2.0 从零开始训练可训练组件,展示了可控的 scaling 曲线。KASO 通过仅选择行为兼容的预测未来来减少错误监督,避免了直接联合训练中的监督冲突。虽然没有直接与外部 WAM 基线比较,但数据显示同一协议下零样本 OOD 性能随数据量单调提升,表明架构设计有效利用了大规模操作数据,而非依赖预训练视觉先验。

行业影响

落地场景

GE-Act 2.0 作为可从零预训练并规模扩展的 world-action model,可直接服务电商履约中心的机器人拣选、第三方物流仓库的包裹分拣、以及制造业柔性装配线。其零样本 OOD 能力使同一模型在未见过的场景、光照、物体实例下保持较高成功率,无需逐任务微调,适合产品化部署。

具体用例:

  • 电商仓储:机械臂根据自然语言指令(如“抓取红色圆形物体”)操作,应对 SKU 频繁变化。
  • 企业服务:机器人流程自动化中,机械臂处理文档或小型物品,模型可快速适应新办公室环境。

商业价值

主要价值在降本与部署效率提升:

  1. 数据成本:从 300 小时到 30,000 小时训练数据,成功率从 17.1% 提升至 44.1%,显示规模化数据带来的边际收益,企业可复用大规模视频数据而非昂贵的动作标注数据。
  2. 跨实体迁移:G2-90D 数据占比 <2% 却提升 17.7 个百分点,意味着单一基础模型可覆盖多种机器人形态,减少每款硬件的独立开发投入。
  3. 零样本泛化:无需 per-task SFT,缩短从实验室到产线的周期。

与现有产品/工作流的接口

该模型可集成进现有机器人控制栈:

  • 感知层:替换传统视觉编码器,CoAE 在极端压缩下保留动作与指令相关信息,可直接对接现有相机输入。
  • 规划层:SVP 单步生成未来状态,作为模型预测控制(MPC)的目标状态,兼容 ROS 2 等中间件。
  • 控制层:IDM 输出动作,可挂载到现成的逆运动学求解器或力控模块。

部署方式上,可将 GE-Act 2.0 封装为推理服务,提供 gRPC 或 ROS topic 接口,供现有机器人业务系统调用。

局限

  • 论文展示了数据规模从 300 小时扩展到 30,000 小时带来显著性能提升(G1-OP 从 17.1% 到 44.1%),表明方法高度依赖大规模、多样化的操作数据。对于资源有限的团队,积累如此庞大的数据量不可行,且数据收集和标注成本高。此外,虽然利用了 action-free 视频,但数据配比和多样性要求可能限制实际部署灵活性。
  • CoAE 的极端压缩(可能有很高的下采样率或 token 缩减)虽然保留了与动作和指令相关的信息,但可能丢失精细几何和纹理细节,影响精密操作任务(如微小物体抓取、精密装配)。SVP 作为单步视觉规划器,可能只预测下一个状态或有限步未来,难以处理需要长期规划或复杂状态转移的任务。KASO 选择性优化通过过滤不兼容预测数据减少监督冲突,但可能丢弃有价值但暂时不匹配的样本,降低数据利用效率。
  • 与继承大规模预训练视频生成模型的世界模型(如 UniPi、SuSIE)相比,GE-Act 2.0 完全从头训练,缺少在海量视频数据上获得的先验知识,可能在小数据场景或新 embodiment 上泛化能力有限。论文虽然报告了跨 embodiment 迁移(G2-90D 因不到 2% 的数据而提升 17.7 个百分点),但该迁移仍局限于相近的机械臂形态,尚未验证在更异构的机器人(如移动操作、灵巧手)上的有效性。此外,真实机器人实验规模相对较小,缺乏长期部署验证。
论文AgiBot Research Team2026-09-04原文

相关内容