论文

World Action Agent:借助 VLMs 以世界动作预演实现机器人操作

World Action Agent:借助 VLMs 以世界动作预演实现机器人操作

通用 vision-language models (VLMs) 为机器人操作带来广泛知识与空间推理能力,但现有系统要么间接使用它们(预测约束、编写程序),要么只给模型一个场景视图,而非可供其行动的世界。 我们提出 World Action Agent (WAA),一个多智能体 harness:VLMs 借助基础工具操控机器人,每一步决策都在 visual action workspace 内完成。该工作空间具备三个特性: - Contact views 依据场景几何自动选取,呈现当前交互周围的场景; - Action rehearsal 将每个动作变为可编辑提案,智能体可自行或经由 Imagination Agent 对照规划反馈预览、修改后再执行; - In-view correction 打通观测、预演与底层执行的闭环,使智能体在观察到残差的视图中消除残余偏移。 借助同一工作空间,WAA 以两种方式获取具身程序性知识:在基于证据的审阅下,从专家视频与人类教学中演化多模态技能,并通过 Skill Agent 调用;其交互轨迹则用于训练更小的 VLMs 驱动同一 harness。 在 LIBERO-Pro 上,仅从 LIBERO-90 演化出技能的 WAA 取得 75.6% 的平均成功率,达到当前最优,超过端到端 VLAs、code-as-policy 智能体以及同骨干的 visual-harness 基线;这些技能在 robosuite 上无需额外学习仍然有效。用 harness 轨迹微调 Qwen3.5-9B,可将其域外成功率从 1.7% 提升至 43.3%。

论文精读

TL;DR WAA 通过接触视图、动作排练与视图校正构建视觉动作工作空间,让 VLM 直接操控机器人,技能仅从 LIBERO-90 进化即在 LIBERO-Pro 达 75.6% SOTA,并可蒸馏轨迹至小型 VLM 提升泛化。

问题

问题背景

机器人操作正从专用策略模型向通用视觉语言模型(VLM)驱动的智能体演进,核心关注在于如何将 VLM 的广泛知识与空间推理能力转化为可靠的低层操控动作。

现有方法局限

现有系统主要采用两类间接路线:

  • 代码即策略(code-as-policy)方式让 VLM 生成程序或约束,但缺乏对接触丰富、需实时视觉反馈任务的适应性,且依赖手工设计的接口;
  • 端到端 VLA(Vision-Language-Action)模型直接微调 VLM 预测动作,往往削弱其原有的通用理解与推理能力,同时模型只获得单一场景视图,而非一个可交互、可修改动作提案的“世界”,导致动作生成与执行校正脱节。

为什么这个问题难且重要

机器人操作要求空间精度、接触推理和闭环反馈调整,VLM 的输入是图像与文本,输出却是连续或离散动作,二者之间存在表征鸿沟。构建一个能让 VLM 在行动工作区内预演、修订并校正动作的框架,需要解决场景几何感知、多智能体协作、技能从演示中进化与迁移等多重挑战。业界高度关注 VLM 直接操控机器人的可行性,因为它有望减少对大规模机器人数据的依赖并加速技能泛化,但当前成功率仍明显低于专用策略。

行业类比

类似 AI 编程助手从静态代码生成演进到在沙盒环境中执行、测试并迭代修改代码,WAA 让 VLM 在“行动工作区”中对动作提案进行预演与视图内校正,而非一次性输出最终动作,更贴近真实闭环系统的需求。

核心洞察

  • WAA 的核心创新在于构建了视觉动作工作空间(contact views + action rehearsal + in-view correction),使 VLM 代理在动作执行前能够预览、编辑并修正动作提案,并在视图内直接观测并消除残余偏移。这区别于以往仅将 VLM 用于高层约束预测或程序生成、或者仅提供场景视图而缺乏可操作世界的做法,首次将机器人操作决策置于一个闭环、可编辑的动作演练环境中,显著提升了空间推理与执行精度的耦合。
  • WAA 通过双重知识提炼机制实现技能进化与模型压缩:一方面从专家视频和人类教学中进化多模态技能,由 Skill Agent 在 evidence-based review 下调用,实现跨任务甚至跨仿真器的迁移(LIBERO 技能直接用于 robosuite);另一方面利用 harness 的交互轨迹微调较小的 VLM(如 Qwen3.5-9B),使其 out-of-domain 成功率从 1.7% 提升至 43.3%,证明 harness 本身可作为高质量数据生成器,训练更轻量、可部署的策略模型。

方法

方法概览

WAA 是一个多智能体 harness,让 VLM 在 视觉动作工作空间 内直接操控机器人,而非仅输出约束或代码。输入为多视角视觉观察与语言指令。

关键模块

  • 接触视图 Contact Views:从场景几何自动选择相机视角,呈现当前交互区域,确保 VLM 看到最相关的视觉上下文。
  • 动作排练 Action Rehearsal:每个动作先作为可编辑提案生成,主代理可调用 Imagination Agent 对提案进行预览,结合规划反馈反复修订,直到满足约束再执行。
  • 视图内校正 In-view Correction:执行后,利用同一视图中的观察结果计算残余偏移,闭环修正低级执行误差。

知识与学习

  • 技能演化:从专家视频或人类教学中提取多模态技能,经过基于证据的审查后入库,由 Skill Agent 在任务中按需调用。
  • 轨迹蒸馏:将 WAA 的交互轨迹用于微调较小的 VLM(如 Qwen3.5-9B),使其也能操控同一 harness。

输出

输出为机器人末端执行器的动作序列,直接驱动低层控制器。

与同类方法差异:不同于端到端 VLA 将动作预测与通用知识耦合,也不同于代码即策略将 VLM 作为规划器而脱离实时视觉反馈,WAA 将 VLM 置于一个可观察、可排练、可校正的视觉动作循环中,保留其推理能力同时实现闭环操控。

实验

实验设计:在 LIBERO-Pro 基准上评估 WAA,技能从 LIBERO-90 数据集演化,并通过 robosuite 测试迁移。同时,利用 harness 交互轨迹微调 Qwen3.5-9B,测试 out-of-domain 性能。

关键发现:WAA 取得 75.6% 平均成功率,达到 SOTA,优于端到端 VLA、code-as-policy 代理和同骨干的 visual-harness baseline。技能在 robosuite 上无需进一步学习仍有效。微调小模型使 out-of-domain 成功率从 1.7% 提升至 43.3%。

基线对比深度解读:

  • 与端到端 VLA 相比,WAA 将 VLM 作为决策核心而非直接动作预测,保留通用知识;
  • 与 code-as-policy 相比,WAA 在视觉动作工作空间中直接操作而非生成程序;
  • 与同骨干 visual-harness baseline 相比,contact views、action rehearsal 和 in-view correction 带来显著增益,说明 workspace 设计的关键作用。

技能演化机制进一步放大优势,小模型微调验证了 harness 的泛化潜力。

行业影响

落地场景

WAA 的视觉动作工作空间与技能演化机制,适合多品种、快速换产的机器人操作。真实落地场景如:

  • 电商物流:仓库机械臂处理不同尺寸、材质的商品抓取与装箱,contact views 自动选择交互视角,减少换 SKU 时的重新标定与程序重写。
  • 医疗辅助:手术室器械递送或康复训练中的物体抓取,利用人类示教演化技能,in-view correction 降低残余位姿误差,保障操作安全。

商业价值

从 expert videos 和少量人类示教演化多模态技能,显著降低每新增任务的手工编程与端到端模型重训成本;in-view correction 减少因 residual offsets 导致的失败和停机。LIBERO-Pro 75.6% 成功率及 robosuite 零样本迁移表明,一套技能库可服务多个机器人平台,提升部署 ROI。

与现有产品/工作流接口

WAA 可作为高层决策层接入现有 ROS 2 控制栈或专有运动规划器。VLM 通过 API 或本地推理给出动作提案,action rehearsal 生成的编辑轨迹可直接映射为低层控制器目标位姿。交互轨迹可形成数据飞轮,微调更小的 VLM(如 Qwen3.5-9B)部署到边缘设备;Skill Agent 可封装为微服务,与 MES/WMS 等系统交换任务指令。

局限

  • - **技能库依赖与扩展成本**:WAA 通过专家视频和人类示教演进多模态技能,并由 Skill Agent 调用,使模型对新任务的覆盖高度依赖已有技能库。LIBERO-90 到 LIBERO-Pro 仍在同一基准分布内,robosuite 上的效果也限于相似技能;对未见的新颖任务,若缺乏对应专家数据,技能进化难以快速扩展。相比能自主探索的端到端 VLA,WAA 在开放任务集上的自主扩展性较弱。
  • - **视觉工作空间的几何与闭环假设**:Contact views 自动选择依赖场景几何估计,in-view correction 仅处理残余位姿偏移。面对遮挡、透明、反光或可变形物体以及动态扰动时,几何选择与动作预演可能无法准确捕获接触约束,残余误差也可能超出局部修正范围。论文未在杂乱遮挡、可变形物体等场景中验证,低层执行器还需可靠 primitive skills,系统集成复杂度较高。
  • - **无真实世界验证与小模型蒸馏瓶颈**:实验全部在 LIBERO-Pro 和 robosuite 仿真中完成,未部署物理机器人;技能虽跨仿真器有效,但 sim-to-real 的感知噪声与执行力差异未评估。对 Qwen3.5-9B 的微调仅将 out-of-domain 成功率从 1.7% 提升至 43.3%,远未实用,说明 harness trace 蒸馏无法完整保留多智能体预演与纠错能力,小模型在相同视觉推理任务上上限较低。
论文Yehang Zhang2026-09-24原文

相关内容