论文

Agent as Policy:将智能体作为机器人操控策略

Agent as Policy:将智能体作为机器人操控策略

我们证明,通用智能体可以无需任何任务特定或环境特定的训练,直接驱动物理机器人完成整个任务执行过程。为此提出 Agent as Policy (AGP),把任务规划与执行置于智能体自身的控制之下。 给定任务与机器人接口后,智能体解读视觉证据、编写可执行程序、发出运动指令,并根据物理结果修正自身动作,使推理与编程能力与物理世界保持持续交互。 我们在多类真实世界操控任务上研究 AGP,涵盖精密操控、动态运动与可变形物体,具体包括: - 从人类视频中学习装配 - 依据目标图像进行积木搭建 - 骰子重定向与定向投掷 - 双手毛巾折叠 AGP 在三种积木搭建配置上分别取得 100%、100% 与 80% 的成功率。这些结果说明,通用智能体能够充当机器人策略,通过运行时推理、编程与交互,将其自主性延伸至物理操控。

论文精读

TL;DR 通用 agent 无需任何任务或环境特定训练,直接通过视觉理解、实时编程和物理反馈闭环驱动物理机器人完成精密装配、动态投掷、布料折叠等操作,成功率最高达 100%。

问题

机器人操作领域 正从任务专有策略转向通用操作能力,视觉-语言-动作模型(VLA)和基于大语言模型(LLM)的任务规划成为研究热点,目标是让机器人快速适应多样任务。

现有方法局限:

  • VLA 方法 依赖大规模机器人演示数据,采集成本高,且通常绑定特定机械臂/夹爪形态,跨任务泛化弱。
  • 基于 LLM 的规划器 大多只输出高层动作序列,底层执行依赖预定义技能库或运动原语;一旦遇到未建模的物理接触、变形物体或动态场景,无法在线调整代码和控制策略。
  • 多数系统缺乏运行时视觉反馈闭环,错误恢复依靠重新规划而非从物理结果中学习,导致精确操作(如装配、折叠)成功率不高。

为什么难/重要:机器人操作需要将高层推理与毫秒级物理交互融合,涉及视觉感知、程序生成、运动规划和在线修正。真实世界里观测噪声、接触不确定性和非刚性物体形状变化使纯学习策略难以覆盖长尾场景。业界需要一种无需任务特定训练即可直接驱动硬件的策略,以降低部署成本、提升泛化至新任务的能力。

行业类比:类似 LLM 驱动的软件 agent 从静态工具调用走向自主执行代码,机器人领域正在尝试让通用 agent 直接充当底层策略,替代“规划-技能库-执行”的分段式架构。

核心洞察

  • AGP 将通用智能体直接作为机器人策略,替代传统任务特定策略网络,实现零样本跨任务操控。与依赖大量演示数据或交互训练的模仿学习、强化学习不同,AGP 利用预训练智能体的视觉理解与代码生成能力,在运行时动态规划并生成可执行程序,将感知、规划、控制统一在同一推理闭环中。该设计消除了任务特定的数据收集与模型微调,使同一智能体能够泛化到精密装配、动态投掷、双手毛巾折叠等异构任务,展现出通用策略的潜力。
  • AGP 通过运行时编程与物理反馈闭环,使智能体的抽象推理直接作用于物理世界。智能体并非输出固定动作,而是编写可执行程序(如视觉处理、运动原语、几何计算),并在执行中根据观测结果修订程序。这种“编程即策略”的范式区别于将 LLM 输出映射到预定义动作空间的传统方法,它允许智能体表达条件逻辑、循环与误差补偿,从而应对非结构化环境和意外物理结果(如积木塔倒塌后的恢复)。该机制将 LLM 的符号推理能力与机器人控制的实时性结合,为可解释、可调试的机器人策略提供了新路径。

方法

输入与接口

AGP 接收三类输入:

  1. 任务描述:自然语言指令或目标参考(如目标图像、演示视频)。
  2. 机器人 API 规范:预定义的运动控制函数(如 move_to_pose、grasp、release)与夹爪、相机标定等硬件接口。
  3. 实时多视角视觉观测:来自多个 RGB-D 相机的图像流,用于感知物体位姿与场景动态。

关键模块:Agent 决策闭环

AGP 将通用预训练智能体(如 GPT-4o 或 Claude)作为策略核心,通过运行时编程驱动物理机器人:

  • 视觉解释:agent 利用多模态能力从图像中提取物体几何、空间关系和物理状态。
  • 程序生成:agent 根据任务与观测,编写可执行 Python 代码,代码内部调用机器人运动接口,将高层意图转化为具体的运动命令序列。
  • 执行与物理反馈:机器人执行生成的代码,传感器(视觉、力觉、关节状态)返回执行结果,agent 对比预期与实际物理结果。
  • 修订与重规划:若出现偏差(如抓取失败、构型塌陷),agent 修改代码或调整参数,重新执行,形成闭环迭代。

工程实现要点

  • 使用预训练通用大模型,不进行任何任务特定或环境特定的微调。
  • 程序作为中间表示,将 reasoning 与物理执行解耦,便于调试和复用。
  • 可积累可复用任务经验:成功程序存入记忆库,后续相似任务直接调用或微调,降低推理成本与执行时间。
  • 支持强到弱经验迁移:强模型生成的程序可指导弱模型执行,提升效率。

与同类方法差异

相比依赖任务特定数据或强化学习的机器人策略,AGP 利用通用大模型的零样本推理与编程能力,通过程序生成和物理交互实现跨任务泛化,无需预先训练动作策略。

实验

实验设计

AGP 在多种真实世界操作任务上验证,包括从人类视频装配、从目标图像块构建、骰子重定向、目标投掷与双臂毛巾折叠。给定任务与机器人接口,agent 直接解释视觉证据、编写可执行程序、发出运动命令,并根据物理结果修订动作。评估覆盖精度操作、动态运动与可变形物体。

关键发现

在三个块构建配置上,成功率分别为 100%、100% 和 80%,证明通用 agent 无需任务特定训练即可作为机器人策略,实现运行时推理、编程和交互。实验还考察了不同思考努力配置与经验累积对效率的影响。

与基线对比解读

论文未与传统机器人策略基线直接对比,而是比较不同 agent 与思考努力配置的性能差异。相比依赖大规模演示或强化学习训练的专用策略,AGP 直接利用预训练通用 agent 的推理与编程能力,消除了任务特定数据收集成本,但可能面临推理延迟与 token 消耗。通过累积可复用任务经验和强到弱经验迁移,可在保留泛化性的同时提升执行效率。

行业影响

落地场景

通用 agent 直接作为机器人策略(Agent as Policy, AGP)可快速应用于工业机器人、仓储物流、电商自动化拣选等场景。例如电商仓库中,AGP 根据视觉输入和任务描述,现场编写控制程序,处理不同形状、材质的商品抓取装箱,无需为每个 SKU 重新训练模型。

商业价值

AGP 显著降低机器人编程与部署成本:无需任务特定数据采集和模型训练,减少对机器人专家的依赖,实现小批量多品种生产线的快速切换。在内容平台或教育场景中,也可用于物理实验自动化、互动展示机器人,以通用 agent 提供灵活的动作生成,提升用户体验,缩短交付周期。

与现有产品/工作流的接口

AGP 通过 Agent-Robot Bridge 与现有机器人控制栈集成:提供标准化的位置/力控接口、视觉观测接口,agent 生成的可执行程序可调用底层运动原语,并通过运行时反馈进行修正。可集成到 ROS 2 或专有机器人中间件,作为策略层替代传统规划/控制模块,与 MES/WMS 或云端任务系统通过 API 对接。

局限

  • **对基础模型的强依赖与算力开销**:AGP 完全依赖通用 agent 的在线推理、视觉解释和程序生成,执行过程中需频繁调用大模型,导致推理延迟和 token 消耗远高于训练好的端到端策略或传统运动规划。论文报告了 token usage,但未给出实时性 / 成本与现有方法的定量对比,难以评估在资源受限场景(如嵌入式机器人)的部署可行性。
  • **安全性与错误恢复能力有限**:尽管 agent 可根据物理反馈修订动作,但面对意外碰撞、硬件故障或环境突变时,缺乏形式化安全保证和硬实时约束。论文中的错误恢复研究仅覆盖少数构型(如六块塔倒塌),且需人工重置或预设恢复策略;在非结构化环境中长期自主操作的风险较高。
  • **任务覆盖与评估指标较窄**:论文在少量精选任务上展示成功率,但任务数量有限(如三种块构建配置),且主要集中在拾放、装配、投掷等,缺少对灵巧操作、长时序任务、多步骤规划或与人类协作的验证。此外,评估仅报告成功率,缺少效率(执行时间 / 成功率权衡)、鲁棒性(跨扰动)和可重复性(多次试验方差)的系统分析,难以全面衡量泛化能力。
论文Mengzhao Jia2026-09-11原文

相关内容