论文

VoLo: 一种面向开放词汇长程操控的物理编排器

VoLo: 一种面向开放词汇长程操控的物理编排器

开放词汇长程操控要求机器人能够理解灵活指令和复杂多物体场景,同时自适应地规划、执行、监控并从失败中恢复。为应对这些需求,我们提出一个闭环智能体,其中 VLM 将异构机器人能力编排为可中断工具。与虚拟 AI 智能体不同,在物理世界中决策、动作和工具调用的时序至关重要,因为世界不会暂停等待推理。我们将此设定称为 物理编排(Physical Orchestration),并提出 VoLoAgent——一种将 VLA/WAM 视为可中断工具的 VLM,在 rollout 过程中结合视觉模型和动作原语进行规划、监控和恢复。 为评估这些长程能力,我们引入 RoboVoLo,一个高保真度的开放词汇长程操控基准,涵盖常识、记忆/状态追踪、复杂引用和世界知识,并提供任务级成功率和失败模式诊断。实验表明,VoLoAgent 在性能上显著优于单独使用 VLA/VLM 或基于工具的系统,并在真实机器人实验中验证了有效性。项目页面: https://chicychen.github.io/VoLo/

论文精读

TL;DR VoLoAgent 将 VLM 作为物理编排器,把 VLA/WAM 等机器人能力封装为可中断工具,在开放词汇长程操作中实现动态规划、监控与恢复,在 RoboVoLo 基准上大幅超越单一模型和工具链系统。

问题

开放词汇长时程操作(open-vocabulary long-horizon manipulation)要求机器人在复杂多物体场景中理解灵活指令,并具备自适应规划、执行、监控与故障恢复能力。当前领域关注如何将大模型(VLM)的语义推理与传统机器人技能结合,以实现面向真实物理世界的通用操作。

现有方法局限

现有系统多依赖视觉-语言-动作模型(VLA) 或基于 VLM 的代理框架,但它们存在明显短板:

  • VLA 端到端黑箱:以开环方式生成动作序列,缺乏在线监控与中途干预能力,遇到未预见场景时无法动态调整,容易因累积误差导致任务失败。
  • VLM 代理静态规划:典型方案先由 VLM 生成完整计划再调用工具,但物理世界不会为推理暂停——决策的时机与动作执行一样关键。这种“规划-执行”分离的架构无法在长时程任务中实时响应变化,工具调用也不可中断,导致故障恢复能力弱。
  • 基准测试局限:现有长时程评测多仅关注任务最终成功率,忽视失败模式诊断,难以指导系统薄弱环节的改进。

技术挑战与重要性

核心难点在于实现物理编排(Physical Orchestration)——在连续执行流中,让 VLM 作为“大脑”实时感知、决策,并能中断正在运行的低级工具(如 VLA/WAM)进行重新规划。这要求系统协调异构能力的时序、处理环境动态变化的时延,并具备从语义理解到底层控制的鲁棒闭环。业界对自主仓储分拣、家庭服务等长期操作需求迫切,这类系统必须可靠地应对常识推理、状态跟踪和复杂指代,因此打破静态规划范式、走向可中断闭环代理,是通往可信赖实体机器人的关键一步。

行业类比:这类似于微服务编排中引入中断式信号——就像 Kubernetes 可随时终止或重启 Pod 来适应集群状态变化,VoLoAgent 赋予高级决策者实时干预底层技能流的能力,实现操作的可控与弹性。

核心洞察

  • 物理编排 (Physical Orchestration) 的核心挑战在于现实世界不会为推理暂停,因此时序决策比虚拟代理更为关键。VoLo 提出将 VLM 作为可中断工具调用器,在行动执行中动态介入 VLA/WAM 的 rollout,使规划、监测、恢复形成闭环。这区别于常见的一次性规划或分层框架,能更实时地应对动态变化,提升长视界任务的鲁棒性。
  • RoboVoLo 基准通过任务级成功与失败模式诊断,系统区分世界失败 (World Failures) 和 VLM 失败,为系统迭代提供细粒度信号。这种评估方法超越了仅关注最终成功率的做法,有助于工程团队定位模型推理缺陷与感知执行瓶颈,指导下一步优化方向,对构建可靠物理编排系统具有实际工程价值。

方法

物理编排 (Physical Orchestration) 框架

VoLoAgent 将长程操作建模为闭环智能体循环,其中 VLM 作为核心编排器,将多种机器人能力封装为可中断工具 (interruptible tools),以应对真实物理世界中任务无法暂停等待推理的约束。

输入:开放词汇指令(如“把蓝色杯子放到微波炉左边”)、多视角 RGB 图像、机械臂状态、场景物体信息(来自视觉工具)。

关键模块

  1. 初始规划 (Plan)
    VLM 解析指令,结合场景图与常识知识,生成分步计划(如:导航、拾取、放置)。计划以结构化动作序列输出,每个步骤绑定特定工具(VLA/WAM、视觉检测器、动作基元)。

  2. 执行与监控 (Execute & Monitor)
    执行循环中,VLM 在每个时间步主动监控工具执行结果。当检测到动作失败、物体消失或任务状态偏离时,立即中断当前工具,避免无效操作消耗物理时间。监控依赖视觉模型(如开放词汇检测)返回的实时反馈,而非预设超时。

  3. 故障恢复 (Recover)
    被中断后,VLM 结合历史观察与当前场景,在线重规划。恢复策略包括:更换工具(如切换抓取基元)、调整目标物体描述、或在持久失败时向人类请求提示。整个恢复过程与执行交织,形成连续闭环。

输出:机器人最终完成长程任务,并以 task-level successfailure-mode diagnostics 指标评估。系统天然支持中断重试,使成功率显著提升。

与同类方法的差异:VoLoAgent 将 VLA/VWM 等“黑盒”策略降级为可中断工具,VLM 在物理回路中实时决策何时调用、何时终止,而非常规的分层方法中上层只做一次性规划并等待子策略自行结束。

实验

实验设计

作者构建了 RoboVoLo 高保真基准,涵盖开放词汇长程操作任务,按常识推理、状态跟踪、复杂指代和世界知识四个维度设计场景与指令;同时提供任务级成功率和细粒度失败模式诊断。评估在模拟环境中进行,并在真实机器人上验证。

基线分为三类:(1) 单一 VLA / VLM 端到端系统;(2) 固定工具调用链的 VLM 代理;(3) 分层规划-执行架构。核心方法 VoLoAgent 将 VLA/WAM 视为可中断工具,由 VLM 在 rollout 中动态决定何时调用,并配合视觉工具和动作原语实现物理编排。

关键发现

实验表明,VoLoAgent 在长期任务中显著优于所有基线。单一 VLA 模型因缺乏全局监控与重规划能力,在物体多、指令灵活的场景中过早失败;纯 VLM 代理则因无法实时干预动作流,在需要物理交互时序协调时表现不佳。VoLoAgent 的“监控-路由-恢复”闭环能有效捕获并纠正语义误解、抓取失败和步骤遗漏,失败模式诊断显示其将世界故障(抓取、放置错误)和VLM 故障(理解偏差、步骤遗忘)均大幅降低。

真实机器人实验进一步验证了迁移性,证明可中断式工具编排在处理动态物理环境时的优势。

与基线对比的深度解读

与固定工具链方案相比,VoLoAgent 的关键差异在于时间敏感的决策粒度——它不仅决定做什么,还决定何时暂停 VLA、何时注入视觉反馈。这使得系统在遭遇意外状态时无需等待完整推理周期,而是即时路由到恢复行为。这种物理编排范式重新定义了 VLM 在机器人 agent 中的角色:从高层规划者转变为实时流程编排者。未来工程实践中,可按此模式将现有 VLA 注册为“可中断技能”,以较低集成成本提升长程任务鲁棒性。

行业影响

落地场景

VoLoAgent 的物理编排能力可用于需要机器人理解开放指令、应对多物体环境和动态失败处理的场景:

  • 仓储与物流自动化:根据自然语言描述从杂乱货架抓取异形商品,并能在遗漏或掉落时自主恢复。
  • 家庭服务机器人:执行如“把餐桌右侧的蓝色杯子收到厨房第二层抽屉”这类多步、指代模糊的任务,通过连续监控与重规划提升鲁棒性。
  • 柔性制造:小批量、多品类的装配线中,机器人根据口头或文本工单切换工序,无需重新编程。

商业价值

  • 降本增效:大幅减少针对每类任务的专用脚本编写,降低部署和维护成本;通过内置失败恢复逻辑,减少人工干预停机时间。
  • 体验提升:让非专家用户通过口语指令指挥机器人,拓宽操作员范围,加速人机协作。
  • 扩展市场:使机器人能适应非结构化环境(如零售理货、医院物资配送),推动服务机器人向通用化演进。

与现有产品/工作流的接口

VoLoAgent 可作为高层编排器,通过标准化工具 API 与现有 ROS 栈或中间件对接:

  • 感知工具:利用现成的视觉定位、分割模型,作为可调用的 vision_tool
  • 操控工具:封装抓取规划器、运动规划器为中断式动作原语,VLM 在 rollout 中途可暂停、修正。
  • 监控与恢复:输出状态诊断信号,可与现有监控面板或日志系统集成,方便运维追踪失败模式。 整体架构支持在已有机器人平台上叠加,仅需实现工具接口,无需推翻底层控制。

具体落地案例

  1. 全球电商仓储:某跨国电商的智能拣选系统接收“从第三层货架拿一瓶洗发水,如果缺货就换护发素”这种开放式指令。VoLoAgent 驱动机械臂分阶段感知、抓取,并利用视觉搜索在缺货时动态切换目标,将掉落后的重试成功率大幅提升。
  2. 手术室器械准备:手术护士口述“准备腹腔镜套装和两把剪刀”,机器人视觉定位多种器械,处理因遮挡导致的识别失败,并通过工具调用重试策略完成任务,减轻器械护士负担,降低交叉感染风险。

局限

  • - **依赖 VLM 的推理延迟**:系统核心依赖 VLM 进行规划、监控和恢复,每次决策都牵涉到大型模型的调用,在真实物理交互中,即使采用异步中断机制,也**可能因延迟导致响应不及时**,影响任务效率和成败。论文并未量化延迟对长时操作的具体影响,也未与更低延迟的替代方案(如轻量级规划器)进行对比,这**限制了在强实时场景下的部署可行性**。
  • - **基准与真实世界的差距**:RoboVoLo 基准虽然覆盖常识、记忆和复杂参考等维度,但**场景和物体仍受限于模拟器环境**,其纹理、物理特性和交互多样性难以完全复现真实世界的杂乱与不确定性。真实机器人验证仅在小规模(可能少数任务)上进行,**无法充分证明方法在广泛现实任务中的鲁棒性**,尤其当感知噪声或物体模型缺失时,系统可能退化。
  • - **工具集和框架的可扩展性**:VoLoAgent 的有效性依赖于精心设计的异构工具(VLA、WAM 等),**这些工具需要领域专家预定义和集成**,将其适配到新机器人或新任务域可能耗费大量工程努力。物理编排本身的灵活性也**受限于底层 VLM 的能力上限**,当 VLM 在理解特定指令或空间推理上出现错误时,整个系统的恢复策略可能失效,而论文未探讨此类级联故障的处理机制。
论文Siyi Chen2026-06-05原文

相关内容