英伟达开源机器人技能库 ASPIRE,实现持续学习新范式
英伟达开源 ASPIRE,一种让机器人通过迭代试错积累可复用技能的持续学习框架,在三个基准测试上大幅提升成功率。
ASPIRE 让机器人像人类工程师一样,在执行任务时记录感知、规划、抓取等过程,失败后分析原因、修复程序,并将修复经验存入技能库。随着技能积累,机器人从新手逐渐变专家,新任务成功率持续提升。
正文摘录
就跟 GPT 能把你的 prompt 和工作记录炼成可复用的 skill 一样,ASPIRE 也会把机器人的一次次失败和修复,沉淀成之后可以持续调用的经验。 每当机器人执行任务时,ASPIRE 就会把感知、导航、抓取、碰撞、运动规划这些过程都记录下来。它背后调用的 GPT / Claude 则会像研究员一样,判断任务中哪里出了问题,迭代程序。如果跑通,就把沉淀出来的经验写进 Skill。 英伟达机器人主管 Jim Fan 还表示,ASPIRE 代表了一种全新的 持续学习范式。 ASPIRE 的全名叫 Agentic Skill Programming through Iterative Robot Exploration。它能让机器人用代码执行任务,失败后查看多模态执行轨迹,再修改程序,把修好的经验存进一个不断变厚的 skills library。 这里的 Skill,虽然本质上还是一段喂给大模型的上下文,却沉淀着一套经过验证的代码修复经验(Code Repair Pattern),让机器人知道遇到某类问题时,该如何修改控制程序。 Agent 能分析出来原因并非识别错了,而是规划器(Planner)给出的目标点都落在障碍物的碰撞缓冲区内。如果遇到这种规划失败,就尝试从 45°、90°、180° 等不同角度重新接近目标,直到找到一条无碰撞路径。以后再遇到类似场景,无论目标变成收音机、微波炉还是其他家具,这条经验都可以直接复用,不必重新试错。 说到这,你可能会好奇:机器人训练,不应该都是搞数据、梯度下降、模型权重、真机采集、仿真到现实迁移吗? 跟 VLA 等端到端的策略模型不同,Code as Policy 不让模型直接输出机器人动作,而是让大模型写一段可执行的机器人控制程序。程序里可以调用感知模块、规划 API 和控制原语,比如识别物体、规划路径、移动机械臂、执行抓取。