论文

重新思考面向组合式与上下文内机器人操作的 World-Action Model

重新思考面向组合式与上下文内机器人操作的 World-Action Model

长时序组合式操作(compositional manipulation)对真实场景中的机器人部署日益关键:单个任务往往包含多个需要协调的子任务。现有 World-Action Model(WAM)虽能联合预测短时域的未来视觉与动作,却普遍缺乏显式的子任务级推理。 为此,作者提出 Visual Goal-conditioned Action Reasoning(ViGAR),一个分层框架,将操作任务分解为 视觉子目标规划器 与 子目标执行器:给定当前观测与全局指令,规划器预测下一个子任务的视觉子目标;执行器则以该子目标为条件,联合生成未来视觉轨迹与动作。两个模块共享同一预训练世界模型表征,使任务级规划与动作生成都能受益于共同的物理知识。该框架还天然支持上下文学习:仅以全局目标图像作为上下文,即可在不更新参数的情况下诱导出不同的子任务分解与行为。 在 RoboTwin 的 Clean2Random 基准上,ViGAR 在 Clean 与 Random 设置下分别取得 82.00% 与 67.02% 的成功率,平均成功率超过最强基线 12.86 个百分点。真实机器人上的五项组合式任务与两项上下文学习任务实验进一步验证了 ViGAR 的有效性。

论文精读

TL;DR ViGAR 将长程操作分解为视觉子目标规划与执行的分层框架,共享世界模型,在 RoboTwin Clean2Random 上平均成功率超越最强基线 12.86 个百分点,并支持上下文学习。

问题

问题背景

长程组合操作正成为真实机器人部署的核心需求,涉及多个协同子任务的场景日益普遍,如整理桌面、装配零件等。

现有方法局限

当前 World-Action Model (WAM) 采用联合预测短程视觉未来与动作的方式,本质上仍停留在低层运动控制层面,缺少显式的子任务级推理。具体表现为:

  • 无法将全局指令分解为可执行的子目标序列,导致长程任务中错误累积、跨子任务转移能力弱;
  • 视觉预测与动作生成共享一个紧凑的隐空间,但缺乏结构化的任务表示,难以处理组合爆炸的未见过子任务组合;
  • 上下文学习能力不足,换一个目标物体或场景往往需要重新训练或微调,无法像大模型那样通过提示立即改变行为。

为什么这个问题难/重要

技术上,难题在于如何在保持世界模型物理一致性的同时,引入层次化的视觉规划:子目标必须是可执行的视觉状态,而不是抽象的自然语言标签;同时底层执行器需要高效利用共享的物理知识。业界高度关注此类能力,因为服务机器人与工业机械臂的实际任务几乎都是长程、组合式的,且要求对新物体、新布局具备快速适应能力。

行业类比

这一思路类似于 LLM 的 in-context learning 被迁移到机器人操作:先针对任务整体进行高层规划,再交由执行模块按步骤生成动作,如同写作时先拟大纲再逐段展开。

核心洞察

  • **显式视觉子目标解耦任务级规划与动作级控制**:ViGAR 引入视觉子目标作为高层规划与低层执行之间的中间表示,将长程组合任务分解为可独立管理的子任务。与现有 WAM 联合预测短期视觉未来和动作、缺乏子任务边界建模的做法不同,ViGAR 强制模型在子任务切换时显式生成新的视觉子目标,从而减少长程任务中的误差累积。工程上,这种层次化分解允许独立调试规划器与执行器,子任务失败可被定位到具体模块,便于快速迭代与模块复用。
  • **共享世界模型表示实现低成本的上下文任务规约**:ViGAR 的高层规划器与低层执行器共享同一个预训练世界模型表示,使两者对物理动态和视觉变化具有一致的理解。基于此,仅需在推理时提供一张全局目标图像作为上下文,即可诱导出不同的子任务分解与行为,无需任何参数更新。相比依赖微调的任务适配方法,ViGAR 的上下文学习机制将新任务的部署成本降至一次图像采集,在动态变化的生产场景中具有更高的灵活性。

方法

方法流程

输入:当前视觉观测(RGB 图像)和全局语言指令(如“清理桌面并归位物品”);在 in-context learning 场景下,还可以额外提供一张全局目标图像作为任务上下文。

核心模块:

  1. 视觉子目标规划器(Visual Subgoal Planner):根据当前观测和全局指令,预测下一个子任务的视觉子目标——即一张期望的未来场景图像。该模块负责高层任务分解,将长程任务切分为可执行的子步骤。

  2. 子目标执行器(Subgoal-guided World-Action Model):接收当前观测和预测出的子目标图像,联合生成短视界的未来视觉轨迹(预测后续几帧)与对应的底层动作序列。执行器采用世界模型架构,具备对未来状态的想象能力,从而指导动作生成。

  3. 共享表示与预训练:两个模块共享同一套预训练世界模型编码器,该编码器从大规模交互数据中学习物理常识,使得高层规划与低层执行都能受益于同一表示空间。

  4. In-context 任务指定:框架无需参数更新即可通过提供全局目标图像作为上下文,诱导不同的子任务分解与行为模式,实现快速任务迁移。

输出:连续的机器人动作指令,驱动机器臂完成整个长程组合操作。

训练要点:摘要未明确具体损失函数,但整体采用分层训练或端到端联合优化;世界模型表示通过自监督视频预测预训练获得,再针对规划与执行任务微调。

与同类方法的差异:现有世界-动作模型(WAM)通常直接联合预测短视界视觉和动作,缺乏显式子任务级推理;ViGAR 通过视觉子目标将长期规划与短期执行解耦,从而更有效地处理组合任务和 in-context 泛化。

实验

实验设计

在 RoboTwin Clean2Random 基准上评估,包含 Clean 和 Random 两种设置。Clean 指测试场景与训练分布一致,Random 则引入更多随机性以考察泛化能力。此外,在真实机器人上进行了 5 个组合操作任务 和 2 个上下文学习任务 的验证。对比基线包括现有 WAM 与 VLA 方法,重点考察长程组合操控的成功率。

关键发现

ViGAR 在 Clean 设置下取得 82.00% 成功率,在 Random 设置下取得 67.02% 成功率,平均较最强基线提升 12.86 个百分点。真实机器人实验也验证了其在组合任务和上下文学习任务中的有效性。

与基线对比解读

相比现有 WAM 仅联合预测短时视觉未来和动作,ViGAR 通过显式的 子目标规划器 将长程任务分解为多个子任务,再交由 子目标执行器 完成。这种层次化设计使模型能够进行 子任务级推理,尤其在 Random 设置下仍保持较高成功率,表明其对新场景的泛化能力更强。真实世界实验进一步证明从模拟到真实迁移的可行性。

行业影响

落地场景

ViGAR 适用于需要长时序组合操作的机器人产品,例如仓储物流的拣选-放置-打包流水线、制造业柔性装配、服务机器人清洁整理、医疗辅助操作等。其核心能力是视觉子目标规划,能将全局指令动态分解为可执行的视觉子目标,适合动态场景和新物体组合。

商业价值

  • 降本:减少人工干预和频繁重新编程,提升复杂任务自主成功率,降低部署与维护成本。
  • 增收:提高机器人吞吐量,在电商履约、物流分拣等高价值场景可扩大自动化规模,带来直接产能增长。
  • 体验提升:通过 in-context learning 用全局目标图像快速切换任务,无需参数更新,使机器人灵活适配新任务,提升服务响应速度和用户满意度。

与现有产品/工作流的接口

ViGAR 可作为规划层集成到现有机器人控制栈:输入 RGB 图像与自然语言指令,输出下一子目标图像,驱动底层动作策略。它与 VLA(vision-language-action)模型兼容,可替换现有 world-action model 或作为高层规划器。预训练世界模型表示可复用,通过 API 或 ONNX 导出部署。

具体落地 use case

  • 电商仓储自动化:在大型履约中心,多 SKU 拣选需要跨货架与容器协同,ViGAR 将订单分解为“取箱-开箱-取物-放入包装”等子目标,提升拣选成功率和订单处理效率。
  • 医疗机器人:手术辅助中多步骤器械操作,通过全局目标图像(如最终缝合状态)引导机器人分步执行,减少人为干预,增强操作一致性与安全性。

局限

  • **ViGAR** 在真实机器人实验上的任务数量有限,仅包含 5 个组合任务和 2 个上下文学习任务,且环境相对结构化。与模拟基准 RoboTwin Clean2Random 的大规模测试相比,真实实验的统计显著性较弱,难以全面验证该方法在复杂、非结构化场景中的鲁棒性和跨场景泛化能力。此外,实验未覆盖长序列任务(如超过 3 个子任务)或需要精细接触力控制的操作,这些在实际部署中常见但可能挑战当前层次化视觉目标分解方法。
  • 该方法依赖于预训练世界模型表示,论文未详细讨论若缺乏高质量预训练数据或需要针对新形态机器人本体微调时的迁移成本。世界模型通常对视觉动力学建模敏感,当执行器或传感器配置变化较大时,共享表示可能失效,需要额外适配。此外,子目标规划器预测视觉子目标,该过程对于语义歧义或子任务边界模糊的任务可能存在误差累积;一旦子目标预测方向错误,下游执行器即使能力足够也可能无法完成全局任务,缺乏全局纠错机制。
  • 与端到端的 VLA 模型或其他层次化方法(如使用语言子目标或技能库)相比,**ViGAR** 的视觉目标条件执行器需要未来视觉轨迹预测,这增加了推理时的计算开销和模型复杂度。论文未提供推理延迟或实时性分析,这对实际机器人闭环控制至关重要。此外,在上下文学习中,使用全局目标图像作为上下文虽然免训练,但需要用户提供准确的最终状态图像,这在开放世界任务中可能难以获取,限制了方法的应用范围。
论文Shukai Gong2026-10-01原文

相关内容