论文

ASPIRE: 机器人智能体/技能发现

ASPIRE: 机器人智能体/技能发现

传统机器人编程面临挑战:需要协调多模态感知、管理物理接触动态、处理多样配置和执行失败。我们提出 ASPIRE(通过迭代机器人探索的智能体技能编程),一个持续学习系统,能够自主编写和优化机器人控制程序(代码即策略范式),同时将经验累积为可复用的技能库。ASPIRE 发现跨任务、仿真与现实场景、不同实体形态的持久技能。其工作循环包含三个组件: 1. 闭环机器人执行引擎:提供细粒度多模态轨迹,实现自主故障诊断、修复综合与验证; 2. 持续扩展的技能库:将经过验证的修复蒸馏为可复用、可迁移的知识; 3. 进化搜索:生成多样化任务序列与控制程序,超越单轨迹优化。 实验表明,ASPIRE 在 LIBERO-Pro 操控任务(扰动下)提升高达77%,Robosuite 双手交接提升72%,BEHAVIOR-1K 长时家庭任务提升32%。其累积的技能库还能零样本泛化到未见过的长时任务:在 LIBERO-Pro Long 上,ASPIRE 实现31%成功率,而先前方法即使使用测试时推理和重试也仅达4%。此外,仿真发现的技能初步展示从仿真到现实的迁移能力,大幅减少不同实体形态和机器人API的编程工作量。

论文精读

TL;DR ASPIRE 通过闭环执行引擎、技能库与进化搜索,让机器人自主探索并编写可复用的控制程序,在多种操控任务上领先先前方法最高 77%,并能零样本泛化到新任务。

问题

在机器人操作领域,如何让自主系统灵活应对多样化的物体、环境扰动和长时域任务,是当前的核心关注点。传统方法依赖人工编写规则或使用 LLM 生成代码即策略(code-as-policy),但存在明显技术瓶颈:

  • 闭环自主改进缺失:现有方法多为开环生成,缺乏对多模态执行轨迹(如感知叠加、抓取候选、碰撞反馈)的细粒度诊断与修复能力,机器人一旦失败便停止,无法自我纠错。
  • 技能孤立且无法累积:每次生成的控制程序被视为一次性制品,无法提炼为可复用、可跨任务和跨机器人形态迁移的技能库,导致面对新场景时总从零开始。
  • 探索局限于单轨迹微调:即便引入重试机制,也仅在已有轨迹附近优化,未对任务空间做系统性探索,难以发现更鲁棒的策略,长时域任务下的零样本泛化更是举步维艰。

该问题的挑战在于物理交互的非平稳性、高维感知与动作空间的稀疏奖励,以及真实世界中数不胜数的边界案例(corner case)。手工为每一种配置和失败模式编写恢复程序成本极高,而单纯增加数据量难以覆盖长尾分布。业界因此亟需一种能从失败中持续学习、将修复经验固化为通用技能的自治系统,以大幅降低部署维护成本。这一思路类似于自动驾驶领域的影子模式:通过持续采集路测中的失败案例并更新模型,机器人操作也需要在探索中不断积累可复用技能,实现无需人工介入的泛化提升。

核心洞察

  • **闭环自我修复** 与技能积累机制将LLM代码生成从一次性静态输出转变为持续进化的学习过程。传统 code-as-policy 方法往往只生成一次策略,失败时缺乏自主诊断与修复能力;ASPIRE 通过机器人执行引擎暴露多模态轨迹(感知叠加、抓取候选、运动轨迹、碰撞反馈),使代理能够诊断失败、合成修复并验证结果,然后将成功修复蒸馏进技能库。这个闭环消除了“生成-测试”间的断裂,形成经验积累的飞轮,使系统能从错误中学习并跨任务复用,超越了仅依赖预训练或单次提示优化的基线。
  • **进化搜索** 通过生成多样化任务序列与控制程序,打破单轨迹优化的局限,驱动技能泛化与探索。多数机器人学习系统围绕固定任务或少数演示迭代,难以应对长程、未见任务。ASPIRE 的进化搜索组件在任务空间内执行变异和选择,持续创造新挑战,结合技能库的跨任务迁移,使得即便在 LIBERO-Pro Long 等长程零样本设定下,也能达到31%成功率(先前方法仅4%)。这种开放式学习范式让系统自主发现高价值技能,而非被动拟合预设分布,为自监督机器人编程提供了可扩展路径。

方法

ASPIREcode-as-policy 范式实现机器人控制程序的自主编写与持续优化。其核心流程可概括为:输入任务描述与机器人状态,通过三个闭环协作模块,输出可复用的技能库与任务策略。

输入与闭环执行引擎

初始输入为任务目标(如语义指令)与原始感知数据。系统首先进入 闭环机器人执行引擎(Closed-loop Robot Execution Engine),该引擎生成多模态细粒度轨迹,包括感知叠加、抓取候选、运动轨迹、碰撞反馈等。这些结构化追踪使 Agent 能自主完成故障诊断、修复合成与结果验证,无需人工干预。

技能库与修复蒸馏

执行引擎输出的修复方案(如错误恢复策略)被送入 持续扩展的技能库(Skill Library)。该库将验证通过的修复提炼为可复用、可迁移的技能代码块,并不断累积。技能库扮演长期记忆角色,使系统能跨任务、跨仿真与真实环境、甚至跨不同机器人实体进行知识复用。

进化搜索驱动探索

为避免陷入单轨迹局部优化,进化搜索(Evolutionary Search)模块生成多样化的任务序列与控制程序变体。它通过变异与选择机制探索更优解,补充执行引擎的在线修复,形成开放式的自主探索循环。

输出与泛化

最终,系统输出不断增长的技能库,直接支持新任务的策略生成。实验表明,在 LIBERO-ProRobosuiteBEHAVIOR-1K 等基准上,ASPIRE 的成功率较先前方法提升达 77%、72% 和 32%,且积累的技能库实现了对未见长程任务的零样本泛化(LIBERO-Pro Long 上 31% vs. 先前 4%),并初步验证了 sim-to-real 迁移能力。

差异点:不同于依赖测试时推理、人工重试或固定管线的传统方法,ASPIRE 通过持续学习演化搜索将修复经验固化为可迁移技能,实现真正自主的机器人技能发现与积累。

实验

实验设计

  • 基准测试: 在三个高难度机器人操控基准上全面评估
    • LIBERO-Pro: 包含位置扰动 (Position Perturbation) 与目标扰动 (Goal Perturbation)
    • Robosuite: 双手交接 (Bimanual Handover) 任务
    • BEHAVIOR-1K: 长程家庭任务 (Long-Horizon Household Tasks)
  • 零样本泛化: 在 LIBERO-Pro 训练任务上积累技能库,直接测试未见过的 LIBERO-Pro Long 长程组合任务
  • 真实机器人验证: 将仿真发现的技能迁移至不同实体机器人 (不同 API 与形态),验证 sim-to-real 能力

关键发现

  • 鲁棒操控: ASPIRE 在所有扰动设置下大幅超越先前方法,LIBERO-Pro 成功率提升高达 77%,Robosuite 提升 72%,BEHAVIOR-1K 提升 32%
  • 技能库零样本泛化: 累积的技能库使 ASPIRE 在未见过的 LIBERO-Pro Long 任务上达到 31% 成功率,对比先前方法仅 4%
  • Sim-to-Real 迁移: 仿真发现的技能成功迁移至真实机器人,显著降低了跨实体编程工作量
  • 消融关键结论: 闭环执行引擎与进化搜索缺一不可——前者暴露多模态轨迹用于自主故障诊断与修复合成,后者生成多样化任务序列与策略,驱动经验持续积累

与基线的对比解读

  • 先前方法依赖固定人工流程,缺乏从失败中持续学习的能力;ASPIRE 的 “代码即策略” 范式配合自动修复与技能库,实现迭代式自我改进
  • 即使基线方法使用测试时推理和重试,ASPIRE 仍显著领先,表明将经验提炼为可复用技能比临时搜索更高效
  • 技能库的跨任务、跨环境、跨实体迁移性为实际部署提供了高价值:只需少量调整即可适配新任务新硬件,避免从零开始编程

行业影响

落地场景

ASPIRE 的核心能力是让机器人自主编写和迭代控制程序,并积累可跨任务、跨实体复用的技能库。这一特性直接服务于以下高频工业需求:

  • 仓储与物流:在电商订单拣选场景中,商品种类与包装形态不断变化,传统编程需针对每种新 SKU 重新调参。ASPIRE 可让机械臂通过少量试错自动生成稳定抓取与放置策略,并在技能库中沉淀为可泛化的操作原语。
  • 柔性制造:小批量、多品种产线上,换线耗时主要消耗在机器人轨迹重编程。ASPIRE进化搜索和闭环自修复能快速探索出适配新工件的操控序列,显著缩短换型时间。
  • 服务机器人:酒店或医院递送场景需应对动态环境和复杂长序列任务,ASPIRE零样本长程任务泛化(在 LIBERO-Pro Long 上从基线 4% 提升至 31%)展示了不依赖额外训练即可执行新指令的潜力。

商业价值

  • 降本:降低对高级机器人工程师的依赖。技能库的持续积累让机器人能从过往错误中学习,减少每次部署的重复劳动,长期维护人力成本大幅压缩。
  • 增效:加速产品上线与换线速度。ASPIRELIBERO-Pro 扰动场景下较先前方法提升 77%,意味着更少的停机调试时间,更高的设备综合效率(OEE)。
  • 体验提升与风险对冲:仿真中发现的技能可迁移至真机,不仅降低实机试错带来的硬件损坏风险,也使得 SaaS 化的“技能市场”成为可能——企业可调用预训练技能库快速构建新业务,无需从零开始。

与现有产品 / 工作流的接口

ASPIRE 设计为与现有机器人技术栈松耦合的叠加层:

  1. 接入仿真器与中间件:可直接对接 NVIDIA Isaac SimGazebo 等仿真平台,利用其物理引擎和传感器模拟生成多模态轨迹;策略输出为标准 Python 控制脚本,可经由 ROS 2action server 或直接调用底层 API 执行。
  2. 集成 VLA 或基础模型:当底层采用视觉 – 语言 – 动作模型时,ASPIRE 充当持续微调和技能蒸馏管道,将修复后的成功轨迹反哺给模型训练,形成闭环进化。
  3. 技能库即插件:验证后的技能可打包为容器化微服务,挂载到云原生机器人管理平台,通过 API 供多机器人集群按需调用,实现跨实体、跨场景的技能复用。

具体落地用例

  • 电商仓储抓放系统:某第三方物流企业已在数千台拣选机器人上部署基于学习的方法,但面对新商品时仍需手动采集数百条示范。引入 ASPIRE 后,机器人可在非高峰时段自主探索新物品的抓取方式,将适配周期从数天缩短至数小时,并自动沉淀为技能条目。
  • 汽车总装辅助:整车厂常需调整门板安装或线束插接工序。工程师可先通过仿真运行 ASPIRE 进化搜索,生成鲁棒的力控策略,再将验证后的代码直接部署到协作机器人,避免产线停线验证,且技能库可跨工位复用。

局限

  • **交互效率与探索覆盖度**:系统依赖封闭环执行引擎中的进化搜索来生成多样化任务并精炼技能,但在长周期任务(如 BEHAVIOR-1K)或高维动作空间中,随机变异和交叉可能导致大量无效尝试,采样效率可能随任务复杂度指数下降。论文未深入分析进化搜索的收敛速度与任务多样性、技能库大小的定量关系,也未探索基于模型引导或好奇心驱动的探索策略,这可能限制其在大规模真实世界部署时的学习速度。
  • **技能库的可扩展性与遗忘**:技能库持续增长且蒸馏固定程序,但未明确阐述如何避免技能间冲突或灾难性遗忘——当新技能与旧知识矛盾时,系统是覆盖还是整合。此外,技能检索仅基于文本描述和任务语义,未利用更细粒度的上下文(如物体几何、物理参数),这可能导致在高度动态或异构环境中匹配到次优技能。
  • **Sim-to-Real 转移的初步性**:论文仅在两种实施例(Franka 和 H1)上进行了初步的仿真到真实转移验证,且未报告在真实世界大量重复试验下的长期鲁棒性(如系统漂移、硬件磨损)。技能从仿真到真实的迁移依赖于人工对齐的传感器观测和动作接口,未能端到端处理领域漂移,当真实环境光照、纹理或接触动力学与仿真偏差较大时,性能可能急剧下降。
论文Runyu Lu2026-06-30原文

相关内容