RobotUse:分配计算、上下文与决策
机器人 agent 必须把预期动作与观测结果关联起来,同时保留在多次尝试中修正选择所需的上下文。现有接口往往把这些选择固化在预定义工具内部,或要求 agent 自行管理细粒度的执行代码及其不断增长的历史。 我们提出 RobotUse,一个机器人 agent harness,围绕物理动作的指定与修正来组织计算、上下文与决策。agent 通过视觉方式选择目标与位姿,后端负责几何、运动规划与控制。Subagents 在每个子目标内保留详细交互,并返回后续决策所需的信息。Continual harnessing 让 agent 通过更新持久化的 playbook 从执行中学习。 在 RoboLab 上,RobotUse 取得 45% 的任务成功率,比 CaP-X 高出 6.7 个百分点,同时保持紧凑的决策上下文,并减少对预定义动作抽象的依赖。此外,我们证明 RobotUse 能在反馈不完美的情况下从真实世界执行中学习,并将其所学迁移到后续任务。项目主页见 https://robotuse-team.github.io/。
论文精读
TL;DR RobotUse 机器人代理框架通过视觉目标/姿态指定、子代理上下文隔离与持续 playbook 更新,将计算、上下文和决策分配至合适层级;在 RoboLab 上达 45% 成功率,超 CaP-X 6.7 个百分点,并能从真实执行中学习迁移。
问题
问题背景
机器人智能体需要连接意图动作与观察结果,在多次尝试中根据反馈修正动作。当前关注如何让 LLM/VLM 驱动的机器人更灵活地执行物理操作,同时保持决策上下文紧凑。
现有方法局限
- 预定义工具封装动作 缺乏灵活性:动作参数固定,智能体难以根据实际场景调整位姿或轨迹,过度依赖预定义动作抽象,限制了新任务的泛化。
- 直接管理底层代码 导致上下文膨胀:若让智能体直接编写运动规划和控制代码,执行历史迅速增长,决策上下文过长,智能体难以区分关键信息与冗余细节。
- 子任务间上下文传递不佳:现有接口很少保留每个子目标内的交互摘要,导致智能体无法有效利用历史执行结果来修正后续尝试。
为什么难/重要
- 闭环修正要求保留关键上下文:机器人操作是非确定性过程,失败可能源于感知、规划或执行,智能体需要精简但充分的反馈来定位原因。
- 计算资源与上下文窗口存在矛盾:几何计算、运动规划等高负载应由后端处理,但决策所需的语义信息必须返回智能体,需合理分配计算与上下文。
- 业界关注具身智能与机器人基础模型:上下文管理和动作指定是决定智能体能否自主执行长程任务的关键瓶颈,直接影响任务成功率和资源消耗。
行业类比
类似于 AI 编程助手在大型代码库中调整代码:高层决策由 LLM 做出,底层语法检查和测试由工具完成,并将关键结果压缩回传给模型,避免上下文过载。
核心洞察
- RobotUse 的核心在于将决策上下文与执行上下文分离:主智能体只进行视觉目标和姿态选择等高层语义决策,后端封装几何、运动规划与控制,子智能体则保留子目标内交互并仅返回后续决策所需信息。这一设计与 CaP-X 等依赖预定义动作抽象或直接生成底层代码的方法形成对比,有效避免了上下文随执行历史无限膨胀,同时降低了对繁琐动作抽象的依赖。
- 通过持续 harness 维护持久 playbook,RobotUse 将真实世界执行经验(包括失败反馈)固化为可复用知识,并迁移到后续任务,实现从执行中学习。现有机器人智能体多为单次会话或无结构的经验记录,缺乏系统化的长期记忆;RobotUse 的 playbook 更新机制使智能体能够在不完美反馈下迭代改进,为具身智能体的自我进化提供了工程化路径。
方法
输入
RobotUse 接收视觉观察(RGB-D 图像)与任务语言指令,同时可选加载持久 playbook 中的历史经验。与传统机器人 Agent 直接生成底层运动代码不同,主Agent 在视觉空间中选择目标物体与抓取/放置位姿,而非编写运动规划细节。
关键模块
- Handoff Unit:将任务分解为子目标,每个子目标由子代理负责执行并保留详细交互记录;子代理仅向主Agent 返回高层结果(成功/失败、关键状态),避免上下文膨胀。
- Closed-Loop Interaction:执行过程中,Agent 根据实时观测结果修订动作,形成“观察-指定-执行-再观察”的闭环,而非一次生成全部动作。
- Continual Harness:将执行反馈(成功与失败案例)整理为持久 playbook(经验库),后续任务可加载复用,实现从经验中学习与快速适应。
输出
输出为一系列视觉指定动作序列,底层几何计算、运动规划与控制由后端自动完成。在 RoboLab 基准上,RobotUse 达到 45% 任务成功率,超过 CaP-X 6.7 个百分点,同时保持更紧凑的决策上下文。
差异点:与依赖预定义动作抽象或让Agent 直接管理执行代码的既有方法不同,RobotUse 通过视觉位姿指定与子代理上下文压缩,在降低上下文长度的同时减少了对手工动作原语的依赖。
实验
实验设计
RobotUse 在 RoboLab 上评测,对比基线 CaP-X,关注任务成功率、决策上下文大小、对预定义动作抽象的依赖。Agent 通过视觉选择目标和位姿,后端处理几何/运动规划/控制;子 agent 在子目标内保留详细交互,主 agent 维持紧凑决策上下文。Continual Harness 允许从真实执行中学习,更新持久 playbook。
关键发现
- RobotUse 取得 45% 任务成功率,较 CaP-X 提高 6.7 个百分点。
- 即使真实世界反馈不完美,也能从失败中学习,并将经验迁移到后续任务。
- 减少了对预定义动作抽象的依赖,同时保持紧凑上下文。
与基线对比解读
45% 对 38.3%(推算)不是单纯提升,关键在于上下文与动作抽象的权衡。
工程启示:将几何/规划/控制下沉到后端,使主 agent 只做视觉选择与决策修订,降低 token 消耗;子 agent 隔离细节并按需返回信息,避免长历史污染。Continual Harness 的 playbook 机制可视为可复用的任务经验库,适合实机部署。
行业影响
落地场景
RobotUse 将机器人决策从预定义工具中解放,适用于需要灵活物理操作的环境。
- 电商仓储:拣选、分拣环节中,代理视觉选择目标与抓取姿态,后端处理运动规划,避免为每个 SKU 硬编码。
- 制造业柔性装配:小批量多品种场景下,持续学习 playbook 积累经验,快速适应新工件。
- 服务机器人:酒店送物、餐厅传菜等长任务中,子代理 handoff 机制保持决策一致性。
具体 use case:电商仓库拣选机器人通过视觉界面框选商品,失败后更新 playbook,后续遇到同类商品可直接调用已验证姿态。
商业价值
- 降低部署成本:非专家可通过视觉交互部署机器人,减少每任务重新编程与调试。
- 提升成功率与灵活性:RoboLab 上 45% 成功率,比 CaP-X 高 6.7 个百分点;紧凑上下文节省 LLM token 开销。
- 复利学习效应:playbook 跨任务迁移,让机器人越用越智能,缩短新任务学习曲线。
与现有产品/工作流集成
- 可作为机器人代理框架叠加在 ROS 2 或云机器人平台上,提供高层动作接口。
- 与现有视觉模型(Grounding DINO、SAM)对接,将视觉选择映射为可执行抓取计划。
- 子代理 handoff 机制可融入多智能体 LLM 栈(如 LangChain、AutoGen),管理复杂任务上下文。
局限
- **成功率仅 45%**, 离实际部署仍有较大差距。尽管高于 **CaP-X**, 但未达到可接受水平,尤其对于长程、多步骤操作,错误累积可能导致任务失败。此外,实验主要在 **RoboLab** 仿真环境和有限真实世界任务上,跨环境和跨任务的泛化能力尚未充分验证。
- **依赖视觉选择目标和位姿**, 对传感器精度、相机标定和视觉基础模型能力要求较高。在遮挡、光照变化或动态场景下,视觉选择可能不稳定,导致规划失败。与直接输出动作的端到端模型相比,中间视觉选择环节增加了延迟和潜在误差源。这限制了 RobotUse 在非结构化环境中的鲁棒性。
- **持续学习 playbook** 依赖执行反馈,但真实世界反馈往往稀疏、有噪声且成本高,可能引入错误修正。同时,初始 playbook 的构建可能需要人工设计和验证,自动化程度有限。与完全自学习的代理相比,RobotUse 仍需人类定义任务结构和子代理边界。这削弱了其在未知任务上的扩展能力。