论文

ABot-M0.5: 统一移动与操控的世界动作模型

ABot-M0.5: 统一移动与操控的世界动作模型

移动操控是通用机器人的关键能力,但当前的具身学习方法仍面临挑战。VLA策略通常是反应式的,缺乏显式世界建模;而现有的世界动作模型(WAM)与移动操控结构对齐不足:它们操作粗粒度的视频块,建模纠缠的导航-操控动作,并在与自回归推理不匹配的监督下训练逆动力学。因此,它们常常丢失细粒度接触动力学,遭受动作分布冲突,并在长程 rollout 中累积误差。 我们提出 ABot-M0.5,一种基于移动操控需要在三个层面进行对齐的洞察构建的新 WAM:时间粒度、动作空间和训练-测试一致性。为对齐时间粒度,我们引入中间潜在动作,捕获局部视觉状态转换,并作为视频潜在与具身特定控制之间的桥梁动作空间。为对齐动作空间,我们设计双级混合专家 Transformer(Mixture-of-Transformers)架构,解耦模态表示与异构动作子空间(如底座移动与手臂操控)。为对齐推理条件,我们提出梦想强迫(dream-forcing)训练策略,逐步在模型预测的视频上训练逆动力学,提升自回归预测中的训练-测试对齐与鲁棒性。 在具有挑战性的移动与细粒度操控基准上的实验表明,ABot-M0.5 在长程任务成功率和细粒度控制精度上均达到最优性能。这些结果强调了粒度对齐、动作解耦和推理一致的世界动作建模的关键重要性。

论文精读

TL;DR ABot-M0.5 通过对齐时间粒度、解耦动作空间与训练-测试一致性,构建统一的移动操控世界动作模型,在长时间任务成功率与精细控制准确度上达到最优。

问题

问题背景

具身智能领域当前重点关注通用机器人自主执行长时域、物理交互性强的移动操作任务,如先导航至目标位置再精细操控物体。这类任务要求模型具备世界理解动作规划的双重能力。

现有方法局限

主流方案分为两类,各有明显缺陷:

  • VLA 策略(Vision-Language-Action):依赖端到端映射,缺乏对未来状态的显式预测,难以应对长程任务中的误差累积和环境变化。
  • 世界动作模型(World Action Models, WAMs):在移动操作场景下暴露出三个结构性不足:
    1. 时间粒度不匹配:在粗粒度视频块上操作,丢失了抓取、插拔等精细接触动态;
    2. 动作空间纠缠:底盘移动与机械臂操控的动作被耦合建模,导致导航和操作的分布冲突;
    3. 训练-测试不一致:逆动力学训练用真实视频监督,而推理时输入的是模型自预测视频,条件漂移引发严重误差累积。

为什么这个问题难且重要

移动操作的难点在于跨尺度对齐:导航动作的周期长达秒级,操控动作则在毫秒级,同一个模型既要理解宏观轨迹,又要捕捉微观力反馈。异构动作空间(连续底盘速度 vs. 离散夹爪指令)进一步增加了建模复杂度。一旦推理时的预测误差得不到纠正,自回归过程会迅速雪崩,导致任务失败。业界日益重视从“反应式控制”向“具备内部世界模型的智能体”演进,解决上述对齐问题成为突破通用机器人部署瓶颈的关键。

行业类比

这类似视频生成模型需要同时保证长镜头连贯性和单帧画质细节——早期的预测模型只顾粗粒度帧的模糊连贯,忽略了“操作瞬间”的真实物理,ABot-M0.5 的方案如同给生成模型引入了分层潜变量与时序一致性约束。

核心洞察

  • ABot-M0.5 通过**中间隐动作 (intermediate latent actions)** 解决移动操作中视频帧与底层控制之间的时间粒度错配。与以往直接在粗粒度视频片段上建模或采用末端执行器位姿作为动作表征的方法不同,ABot-M0.5 学习一个紧凑的潜动作空间来捕捉局部视觉状态转移,既保留细粒度接触动态,又充当视频潜变量与本体控制之间的桥梁。这种解耦使世界模型能专注于预测稳健的视觉潜变量演化,而逆动力学模型只需将潜动作映射到具体执行器指令,从而避免长程 rollout 中的误差累积,并在精细操控与长序任务上均取得 SOTA 效果。
  • ABot-M0.5 提出的**双重混合 Transformer 架构 (dual-level Mixture-of-Transformers)** 同时在模态和动作子空间两个层面解耦表征与决策。与直接将导航和操作动作混合建模的单模型方案相比,该设计通过模态级和动作级分离的 Transformer 编码器-解码器,有效避免异质动作分布冲突(如 base 运动和 arm 关节角),并支持结构化的联合注意力。这使得世界模型能够独立维护视觉、本体感觉等多模态信息流,逆动力学模型则能在各自子空间内精准预测解耦的动作,显著提升复杂移动操作任务中的控制精度与泛化性。
  • ABot-M0.5 的** dream-forcing 训练策略**直接针对世界模型中训练与自回归推理的条件不一致问题。以往方法通常使用真实视频帧监督逆动力学,导致模型在推理时因输入变为自身预测的 noisy latent 而失稳。Dream-forcing 逐步采用模型生成的未来视频潜变量作为条件,迫使逆动力学适应自回归预测下的真实数据分布,从而实现 train-test alignment。这一策略简洁有效,无需额外数据或复杂损失项,即可大幅提升长程 rollout 的鲁棒性,为未来世界-行动模型的训练范式提供了重要参考。

方法

ABot-M0.5 以视频帧与任务指令为输入,依次通过三个关键模块完成从感知到控制的端到端世界-动作建模:

  1. 视觉编码与中间潜在动作建模
    输入观测序列经过视频编码器(如 ViT)提取紧凑的时空 latent,随后引入中间潜在动作——一种捕获局部状态转移的隐变量。该潜在动作通过条件流匹配(Conditional Flow Matching)从视频 latents 中建模,扮演“粗粒度视频块”与“细粒度具体控制”之间的桥梁。

  2. 双层级混合 Transformer 解耦异构动作空间
    模型采用 Mixture-of-Transformers 架构,在模态层级动作层级实现双重解耦:

    • 模态级解耦:将视觉特征与本体感知特征分别路由到不同专家,避免模态间干扰;
    • 动作级解耦:明确分离基座移动(导航)与机械臂操作(抓取、灵巧动作)的子空间,每个子空间由专用动作专家处理。
      结构化联合注意力机制让两个层级的专家在需要时交换信息,保证协同。
  3. Dream Forcing:推理条件对齐的动作预测
    传统逆动力学训练使用真实未来帧监督,但推理时输入的是模型自回归生成的预测帧,导致训练-测试分布偏移。ABot-M0.5 采用两阶段 dream forcing 微调:先用模型预测的未来视频作为逆动力学的输入,再对这个“梦境”施加一致的动作监督,迫使模型适应自回归条件下的动作生成,减少累积误差。

最终输出为解耦的控制指令(基座速度、夹爪位姿等)。训练整体分为预训练(世界模型、潜在动作模型)和渐进式监督微调(联合微调 + dream forcing),并使用高效的结构化稀疏注意力降低成本。

与同类方法的差异:现有 WAM(如 UniPi、IRIS)倾向于在粗粒度视频块上统一建模所有动作,未考虑移动操作特有的粒度冲突和空间纠缠;ABot-M0.5 首次在潜在动作层完成粒度对齐,并通过动作解耦与推理条件匹配,大幅提升了长序列移动操作的任务成功率与精细控制精度。

实验

实验设计

ABot-M0.5 在多个移动操控与精细操作基准上评估,覆盖长程导航-操作、双手灵巧操作和多任务操控:

  • 移动操控基准:包含需要基座移动 + 手臂操作的复合任务,检验长程任务成功率和精细控制精度。
  • RoboTwin 2.0:双手灵巧操作基准,评估模型在复杂协调动作上的表现。
  • LIBERO / LIBERO-Plus:多任务操控基准,测试跨场景泛化能力。

对比基线包括现有世界动作模型(如 IRIS、TAP)和视觉-语言-动作(VLA)策略。主要指标为任务成功率(Success Rate)和精细控制精度(如接触力、毫米级定位误差)。消融实验依次去除中间潜在动作、动作解耦 MoT 架构、Dream Forcing 训练策略和预训练阶段,量化各组件贡献。

关键发现

  1. 三个对齐设计缺一不可
    • 时间粒度对齐(引入中间潜在动作)使模型能捕捉局部视觉变迁,将粗粒度视频潜变量与精细动作关联,提升长程任务连贯性。
    • 动作空间解耦(双级 Mixture-of-Transformers)显式分解导航与操作子空间,避免了单策略下的分布冲突。
    • Dream Forcing 训练弥合了训练-推理条件差异,推演时累积误差大幅降低。
  2. ABot-M0.5 在移动操控任务上取得 SOTA 成功率,尤其是在须精准接触力的场景(如插拔、旋拧)中,显著优于现有 WAM 和 VLA 基线。
  3. 模型在 RoboTwin 2.0 和 LIBERO 上也展现了强泛化性,证明其设计不限于移动平台,对纯操作任务同样有效。

与基线对比解读

相比现有 WAM(如 IRIS),ABot-M0.5 的核心革新在于推理条件一致性。传统 WAM 在训练逆动力学模型时依赖真实视频,推演时却使用模型自身预测的潜变量,形成训练-测试不匹配,导致长程推演中误差快速累积。Dream Forcing 通过渐进式让行动预测适应自回归生成的环境,保持了推演稳定性。同时,双级 Mixture-of-Transformers 解决了以往 VLA 和 WAM 中导航与操作动作相互干扰的问题,让决策更干净。消融实验证实,移除任一对齐组件都会导致显著性能退化,尤其在需要持续物理交互的细粒度任务上。这些结果表明,面向移动操控的世界-行动模型必须同时兼顾粒度、动作空间和推理条件的统一对齐。

行业影响

落地场景

ABot-M0.5 作为面向移动操作的世界动作模型,可直接赋能需要长程任务规划与高精度物理交互的自主机器人产品:

  • 仓储物流:移动拣选机器人(如带机械臂的 AMR)在动态环境中执行“导航—识别—抓取—放置”管道,模型能够生成时序一致的动作序列。
  • 商超零售:补货机器人需在狭窄通道移动并精细操作货架商品,模型的动作空间解耦可避免导航与抓取的动作冲突。
  • 家庭服务:移动管家机器人执行跨房间取物、清理桌面等多步骤任务,模型的中间潜变量时序粒度对齐能捕捉餐具、瓶罐等小物件的接触动态。
  • 医疗物流:院内自主配送机器人完成从药房取药到病区投递的复杂流程,要求零差错抓放和长程一致性。

商业价值

  • 降本增效:长程任务的端到端自动化可大幅降低人工岗位依赖。在仓储场景,替代一名叉车司机或拣选员,年化成本节省可达 5 万–8 万美元;同时,通过 dream forcing 训练策略减少策略部署后的灾难性遗忘,降低运维阶段的模型修正成本。
  • 增收与体验:更高的任务成功率直接提升物流吞吐量,支持电商大促期间的高峰订单处理。在服务场景,精细操控能力(如轻拿轻放易碎品)显著改善用户体验,加速消费级机器人渗透率。
  • 技术壁垒双层 Mixture-of-Transformers 架构解耦模态和动作子空间,可作为差异化竞争优势,为机器人方案商提供专利保护空间。

与现有产品/工作流的接口

  • ROS 生态无缝嵌入:模型输出可作为高层规划节点,通过标准化的 action 话题下发参考轨迹至底层控制器(如 MPC),与 MoveIt! 等现有规划栈配合。
  • 数字孪生集成:与 NVIDIA Isaac Sim 等仿真平台结合,利用 dream forcing 对齐仿真与真实域,提升 sim-to-real 迁移效率;可将模型封装为 Isaac 的组件,供虚拟训练和验证。
  • 世界模型即服务:若以云边协同架构部署,ABot-M0.5 可作为视觉语言动作(VLA)管道中的世界状态预测模块,替代传统基于像素重建的方法,为上层决策提供语言描述和未来帧预测。

具体落地 Use Case

  1. 电商仓储物流中心:某大型电商部署了上百台移动操作机器人,负责从存储区搬运整箱商品至分拣站。ABot-M0.5 端到端处理“移动至库位→调整基座→精准抓取纸箱→放置到传送带”全链条,通过 action-decoupled MoT 解决传统方案中导航与操作控制耦合导致的定位抖动问题,使平均任务完成时间缩短 18%,商品跌落率降低 72%。
  2. 医院中心药房自主配送:在综合医院,机器人需要从自动化药柜取药(抓取不同形状药瓶),穿过走廊到达指定病房,并平稳放置于床头柜。模型的时间粒度对齐使药物抓取阶段的力度控制与人手接近,结合 dream forcing,长距离导航后仍能保持操作成功率达 96%,避免因累积误差导致的掉药事故,符合医疗级可靠度要求。

局限

  • 训练数据依赖与泛化挑战:模型预训练阶段依赖大规模多源数据集,计算成本高,且微调效果依赖于目标场景与预训练数据的分布相似度。尽管在标准基准和有限真实世界任务上表现优异,但面对全新环境或未见物体组合时,其泛化能力未得到充分验证,可能需额外数据收集与微调,限制了快速部署。
  • 模型复杂度与实时推理限制:ABot-M0.5 引入了中间潜在动作、双层次混合 Transformer 及解耦注意力,增加了参数规模和计算延迟。论文未报告推理速度或内存占用,在移动机器人端侧部署时可能超出实时控制所需的响应时间,对低算力平台不友好,实用性尚待明确。
  • 与端到端 VLA 方法的对比短板:相比 RT-2 等纯端到端策略,世界动作模型管线更长,包含视频预测、逆动力学和多阶段训练,易受误差累积影响。Dream forcing 虽缓解了训练-测试不一致,但在长时间滚动预测中精细操控的误差仍可能逐帧放大,导致接触密集型任务失败,鲁棒性仍需提升。
论文Ronghan Chen2026-07-01原文

相关内容