论文

趣味性自主机器人学习

趣味性自主机器人学习

当前自主机器人系统能够编写可执行的 Code-as-Policy 程序、观察反馈并在多次尝试中修正行为,但它们仍主要受任务驱动:只有在明确指令后才会获得可重用技能。我们研究 趣味性自主机器人学习 (Playful Agentic Robot Learning),其中具身编码代理在接收下游任务之前,将自我导向的玩耍作为持续的技能学习阶段。我们引入 RATs (机器人代理团队),专为玩耍时技能获取而设计。在玩耍阶段,RATs 提出新颖且可学习的探索性任务,规划并执行 robot-code 策略,验证中间进度,诊断失败,利用密集的步骤级反馈进行重试,并将成功执行提炼为持久的代码技能库。测试时,代理从该冻结库中重用相关技能以帮助解决新任务。在 LIBERO-PRO 和 MolmoSpaces 上的实验表明,与无玩耍和随机玩耍基线相比,玩耍学习的技能在保留的下游任务上分别提升了 20.6 和 17.0 个百分点(相对于 CaP-Agent0)。此外,这些学习到的技能可以通过简单检索到上下文的方式插入到其他推理时的 Code-as-Policy 代理中,无需微调底层模型,即可在 RoboSuite 和真实世界迁移中分别提升 8.9 和 8.8 个百分点。

论文精读

TL;DR 让机器人在无任务驱动下自我玩耍,通过探索-验证-提炼循环构建可复用代码技能库,直接插入下游推理智能体,显著提升多任务性能而无需微调。

问题

问题背景

当前具身智能领域正探索 Code-as-Policy 范式,即由大语言模型 (LLM) 根据任务描述直接生成可执行的机器人代码策略,并能观察执行反馈进行多轮修正。这种范式让机器人从僵硬的动作序列走向动态的程序化控制,显著提升了任务表达能力和闭环适应能力。

现有方法的局限

然而,现有系统基本都是 任务驱动 的:只有在接收到明确的人类指令后,才会为当前任务编写专用策略,过程中获得的可复用执行技能(如“抓取把手”“沿边对齐”)并未被系统性地保存与积累。这导致:

  • 技能孤岛:每个任务都从零开始规划,无法复用过去成功的子程序。
  • 学习低效:面对新任务时仍需消耗大量推理 token 和时间重新生成代码,且无累积知识支撑,容易陷入简单错误的重复试错。
  • 泛化受限:没有预先建立通用技能库,机器人难以快速将经验迁移到未见过的环境或任务变体。

为什么这个问题既困难又重要

自导玩耍 (self-directed play) 与技能积累的核心挑战在于:

  • 开放探索:机器人必须在无外部奖励的情况下,自主生成既新颖又可学习(难度适中、步骤可分解)的探索任务,这是一项复杂的创意与自评估问题。
  • 可靠执行与记忆:需要多智能体协作(任务提出、执行、验证、失败诊断、记忆管理)来闭环地提炼技能,任何环节的脆弱性都会导致技能质量下降。
  • 工程价值:若能建成一个可插拔的技能库,不仅能大幅提升下游任务成功率(论文中提升 20.6 个百分点),还能让其他 Code-as-Policy 智能体直接检索技能而无需重训底层模型,这对工业部署中的成本与响应延迟至关重要。

行业类比

这一范式类似于大语言模型的 预训练阶段:通过大规模的自监督探索获得广泛的基础能力,再在测试时通过上下文检索解决特定任务,无需针对每个新任务做昂贵的有监督微调。

核心洞察

  • 自我导向游戏将机器人从被动任务执行器转变为主动技能构建者。现有 Code-as-Policy 系统仅在收到明确指令后才生成代码并迭代修复,学习局限于任务上下文。RATs 让机器人在无下游任务时自主提出可学习探索任务,通过试错、诊断和技能蒸馏构建持久技能库,形成持续学习的先验。这种“先游戏后应用”范式与人类通过玩耍积累经验再解决新问题的方式一致,显著提升对新任务的零样本泛化能力。
  • 多智能体团队(RATs)通过分工实现高密度反馈的闭环学习。传统单智能体方法依赖最终结果的稀疏反馈,导致重试效率低。RATs 将任务提出、执行验证、失败诊断、记忆管理分配给不同角色,形成步骤级验证与即时修正循环。任务提出团队生成新颖且可学习的探索目标,执行团队规划并验证中间步骤,记忆团队提炼技能并管理失败记忆,使每次交互都转化为结构化知识,避免重复错误,加速技能积累。
  • 游戏学得的技能可作为即插即用的通用模块,跨智能体和环境迁移。之前的工作中,技能通常与特定模型绑定,需要微调才能复用。RATs 将执行成功的代码策略蒸馏为文本化技能条目,存储在冻结库中。下游任务或不同的 Code-as-Policy 智能体只需检索相关技能并注入上下文,即可提升推理性能,无需任何模型更新。在 RoboSuite 和真实机器人上的 8.9 和 8.8 百分点的增益验证了这种轻量化知识迁移的有效性,为技能复用提供了新范式。

方法

RATs(Robotics Agent Teams)将机器人学习分为自我导向玩耍阶段下游任务评估阶段。在玩耍阶段,系统驱动具身智能体在没有明确任务指令的情况下,自主探索环境并积累可复用技能。整体流程由三个专业化团队协作完成:

任务提议团队(Task Proposer Team)

该团队负责生成新颖且可学习的探索任务。它通过分析环境特征与现有技能库,避免重复或超出当前能力的任务,保证玩耍既多样又可行。任务被转化为自然语言描述,传递给执行团队。

执行团队(Execution Team)

执行团队采用 Code-as-Policy 范式,将玩耍任务转为可执行的机器人代码策略。内部包含多个子代理:

  • 规划器 将任务分解为子步骤并草拟代码骨架;
  • 策略编写器 生成具体 Python 代码;
  • 验证器质量检查器 在仿真环境中运行代码,捕获执行错误与中间状态;
  • 失败诊断器反馈生成器 提供步骤级密集反馈,指导策略重试;
  • 成功执行的任务会触发目标验证器 确认完成。

该设计通过快速重试循环,将玩耍中的试错过程结构化为可追踪的代码迭代,显著提高采样的有效性。

记忆管理团队(Memory-Management Team)

负责维护两个持久化组件:

  • 技能库:由 子代理技能提取器 从成功执行记录中提炼出通用代码片段或宏技能,存入冻结的技能库;
  • 失败记忆:记录失败尝试与诊断信息,供任务提议团队避免无效探索。

在测试阶段,面对全新下游任务时,RATs 仅从技能库中检索相似技能并注入上下文,无需更新底层策略模型,即可复用玩耍阶段获得的能力。实验表明,该方法在 LIBERO-PRO 和 MolmoSpaces 上相较 CaP-Agent0 分别提升 20.6 和 17.0 个百分点,且技能可即插即用到其他推理时 Code-as-Policy 代理中。

与以往被动等待指令后从零生成代码的方法不同,RATs 通过自监督的团队化探索,提前建立可泛化的技能储备,将学习压力从测试时转移到可扩展的玩耍阶段,这是 Code-as-Policy 范式迈向持续自主学习的关键一步。

实验

实验设计

实验在两个机器人操作基准上进行:LIBERO-PROMolmoSpaces,并评估向 RoboSuite 与真实世界迁移的能力。Play 阶段,RATs 代理团队自主提出探索任务,编写并执行机器人代码策略,通过验证步骤、诊断失败与重试,将成功执行提炼为持久技能库。测试时冻结库,仅为下游任务检索相关技能,无需额外微调。基线包括无 Play 的 CaP-Agent0 与随机 Play 策略。

关键发现

  • 玩中学显著提升:相对 CaP-Agent0,LIBERO-PRO 下游成功率提高 +20.6 百分点,MolmoSpaces 提高 +17.0 百分点
  • 技能可跨环境即插即用:仅从LIBERO学得的技能检索到上下文,便将RoboSuite和真实世界迁移性能分别提升 +8.9+8.8 点
  • 消融证实:有目的的 Play 策略优于随机 Play,且按需检索技能优于一次性注入全部技能。
  • Sim-to-Real 验证:技能有效迁移至真实硬件,成功率显著改善。

与基线深度对比

CaP-Agent0 属任务驱动型,只在收到指令时才尝试从零试错,无法积累可复用能力。RATs 将探索前置化,通过 自我驱动的 Play 预先构建技能库,把单次任务的高成本推理转化为一次性投资。随机 Play 易产生无关或琐碎技能,而 提案‑验证‑诊断闭环使技能兼具挑战性与可学习性。跨环境迁移的提升更说明,习得的抽象技能不绑定具体环境或底层 VLM,可直接增强其他推理时 Code-as-Policy 代理,凸显该范式的实用价值。

行业影响

落地场景

RATs 提出的 自我导向 Play 技能学习 范式,天然适合需要长期自主运行、任务频繁变动的机器人产品:

  • 仓储与物流:抓取、分拣、码垛等操作,可通过 play 自主探索生成可复用的技能库,应对不断变更的 SKU 与料箱布局。
  • 柔性制造:装配、质检等环节需要快速切换产线,play 阶段积累的微操作技能可大幅降低重编程开销。
  • 服务与护理机器人:家庭或医院环境中,机器人可通过安全探索自主学习物体操作与交互原语,再迁移到递送、辅助翻身等具体任务。

商业价值

核心价值在 降本增效提升系统自主性

  • 降低部署成本:减少对专家逐任务编程的依赖,缩短从场景搭建到稳定运作的时间,尤其适用于长尾任务频繁的应用。
  • 提高资产复用率:技能库跨机器人、跨环境可迁移,一次 play 投入,多处受益,避免重复开发。
  • 减轻云端推理压力:技能固化为本地可执行代码,降低对大模型实时调用的需求,减少推理延迟与带宽成本,同时增强离线稳定性和数据隐私。

与现有产品/工作流的接口

RATs 输出的是 冻结的技能代码库,可直接嵌入现有 Code-as-Policy (CaP) 代理的上下文,无需微调底层 VLM/LLM。

  • 与机器人操作系统(如 ROS、MoveIt)集成:技能以独立函数模块存在,可被任务规划器动态检索、组合和调用。
  • 与现有监控与诊断管道对接:play 阶段的失败诊断、步级反馈可直接复用已有的日志与 CI/CD 基础设施。
  • 即插即用提升现有代理:实验表明,将 RATs 技能库注入 CaP-Agent0 等已有代理,在 RoboSuite 和真实世界任务上可提升 8.9 和 8.8 个百分点。

具体落地 Use Case

  1. 全球电商仓储自动化:大型仓库的抓取机器人利用无货时的 idle 时间进行 play,自主探索不同包装、物体的抓取策略,形成技能库。当新商品上线或促销季到来,仅需少量迁移学习或零样本直接复用,显著减少人工介入与误操作。
  2. 跨国医疗机构辅助机器人:病房服务机器人在模拟环境下通过安全 play 学习递送药物、辅助病患移动等技能,技能库可跨院区、跨文化环境迁移,部署时只需微调高层任务规划,底层运动原语保持不变,既降低定制成本,又满足医疗场景对稳定性和可解释性的要求。

局限

  • **玩耍阶段的计算开销较大**:RATs 包含多角色团队(任务提出者、执行者、记忆管理)及密集的验证、诊断、重试循环,需多次调用大语言模型。论文虽在附录中分析了 token 成本,但对资源受限的场景(如长时间真实机器人在线学习)可能难以承受,限制了实时部署的可行性。
  • **技能库的泛化边界未充分探索**:实验涵盖 LIBERO-PRO、MolmoSpaces 和少量 sim-to-real 迁移,但任务对象多为刚体拾放和简单操作。对于更复杂的精细操作、动态场景或零样本泛化到全新任务族,玩耍所学技能的适应性尚未验证。此外,跨环境迁移依赖任务相似性,若下游任务与玩耍环境差异过大,检索出的技能可能无效。
  • **玩耍任务的多样性与安全性依赖生成模型**:任务提出器自主生成探索性任务,可能重复、超出机器人能力或隐含安全风险。虽然设计了“新颖且可学习”的过滤,但缺乏对不安全动作的硬性约束。在真实世界中,这需要额外的人工审核或安全验证层,否则可能导致机器人损坏或危险行为。
论文Junyi Zhang2026-06-17原文

相关内容