RL-100 框架融合模仿与强化学习,机器人操作千次试验零失败
把人类示范与强化学习结合,RL-100 让机器人真实操作成功率做到 100%,且效率不输人类。
机器人学会一个动作不等于真掌握。RL-100 是一种统一框架,结合模仿学习(让机器人从人类示范中学习)和强化学习(通过试错优化策略)。它先用人类示范打底,再利用离线数据和少量真实环境交互微调。在 8 项真实操作任务中,RL-100 成功率 100%,完成速度接近甚至超过人类远程操作。
正文摘录
.jpg) 编辑丨\O/ 对于机器人而言,完成一个动作并不意味着真正掌握了一项技能。在实验室环境中,机器人已经能够完成越来越多复杂操作:抓取物体、整理物品、折叠衣物,甚至完成连续操作任务。 但当机器人进入真实环境时,问题会变得更加复杂。高成功率,高稳定性,高执行效率,三者缺一不可。 为支持机器人在现实任务中的强化学习,2026 年 7 月 22 日,发表于《 Science Robotics 》的研究「 Performant robotic manipulation with real-world reinforcement learning 」提出了 RL-100 框架,通过结合模仿学习(IL)与强化学习(RL),进一步优化了基于扩散模型的机器人控制策略。  论文链接: https://www.science.org/doi/10.1126/scirobotics.aed6267 优化机器人能力 近年来,机器人学习的重要路线之一,是让机器人通过观察人类示范获得技能。 这种方法称为模仿学习。研究人员通过遥操作设备控制机器人,让机器人记录关于移动、抓握等相关测试信息。随后,模型学习这些示范数据,并生成类似的人类操作策略。 理论上,强化学习可以通过不断试错,让机器人寻找更优策略。但在真实机器人环境中,直接使用强化学习并不容易。 RL-100 针对这一问题提出了一套统一优化框架。