论文

ENPIRE:真实世界中代理机器人策略自我改进

ENPIRE:真实世界中代理机器人策略自我改进

现实世界中灵巧机器人操控的进步高度依赖人工监督和算法工程,这成为追求通用物理智能的核心瓶颈。尽管新兴的编码代理能自动生成算法搜索代码,但其成功仍局限于数字环境。我们推测,自动化机器人研究缺失的抽象层是一个可重复的真实世界策略改进反馈循环:重置场景、执行策略、验证结果、优化下一次迭代。 为填补这一空白,我们提出 ENPIRE 框架,这是一个为编码代理设计的支持系统,通过四个核心模块实例化物理反馈流程:环境模块 (EN) 负责自动重置与验证;策略改进模块 (PI) 启动策略优化;执行模块 (R) 评估策略(支持多台物理机器人并行操作);进化模块 (E) 中编码代理分析日志、查阅文献、改进训练基础设施和算法代码以处理失败模式。该闭环系统将真实操控学习转化为可控优化过程,在最小化人工干预的同时,允许对训练配方和代理变体进行公平消融实验。 借助 ENPIRE,前沿编码代理可自主训练策略,在整理针盒、紧固扎带、工具使用等挑战性灵巧操控任务上达到 99% 成功率。当我们在机器人集群上部署代理团队时,该过程进一步加速。我们的结果表明了一条实用且可扩展的路径,能够部署编码代理在物理世界中自主推进机器人技术。

论文精读

TL;DR ENPIRE 为编程智能体构建了真实世界的闭环反馈框架,通过自动重置、验证与策略进化,让机器人自主将灵巧操作成功率提升至 99%,并借助多机并行加速迭代。

问题

真实世界灵巧操纵(dexterous manipulation)是通往通用物理智能的关键,但当前研究高度依赖人类专家的手工算法工程与现场监督,自动化水平极低,成为规模化复制的核心瓶颈。

现有方法局限

  • 自动化算法搜索:新兴 coding agents 虽能生成代码来探索策略空间,但其成功案例几乎全局限在数字环境(如仿真或代码合成),无法直接接触真实世界的物理反馈。
  • 缺失的闭环:真实机器人学习需要环境重置、策略执行、结果验证、迭代优化,现有方案需人工完成大部分环节,实验不可重复且难以进行公平消融。
  • 难以迁移:仿真中训练的策略因 domain gap 无法保证真实表现,而 coding agents 缺乏机制来编码物理约束、多模态感知噪声和硬件特异性,导致自动化链路断裂。

为什么难 / 重要

  • 技术挑战:构建一个可自动重置、验证并基于物理反馈进化的学习回路,必须同时解决硬件编排、安全约束、多机器人并行采样、失败模式泛化等难题,这对系统鲁棒性和 agent 的推理能力提出极高要求。
  • 业界关注度:若能实现自主物理研究,将大幅降低 dexterous manipulation 的研发成本,让算法工程师从繁琐的现场调试中解放,其意义可比拟 AutoML 之于监督学习——将科学方法从人力驱动转向智能驱动。

行业类比

类似于 AutoML 自动化了特征工程和超参搜索,ENPIRE 试图为机器人学习构建一个“端到端的 AutoML 但面向物理世界”的闭环系统,把人类现场工程师升级为系统设计者。

核心洞察

  • 物理世界中的自主机器人研究需要可重复的闭环反馈抽象,而不仅仅是代码生成。ENPIRE 通过环境自动重置与验证、策略改进、并行 rollout 和进化分析四个模块,将零散的人工调参转化为系统化的优化过程。这与已有的数字环境编码代理(如软件工程任务)本质不同,因为物理操作面临不可逆状态变化和真实约束,必须依靠自动化环境模块来提供可靠的重置与成功判定。
  • 多智能体与多机器人并行扩展显著加速物理策略学习,揭示了规模化的价值。传统单机器人人工调参方法难以快速探索超参空间,而 ENPIRE 利用 agent 团队在机器人集群上并行评估策略、共享经验,实现了超线性加速。这表明,将硬件资源管理、并行数据收集和进化算法集成到统一框架中,是实现物理世界自主研究的关键工程路径。

方法

ENPIRE 框架将真实世界的机器人策略自改进形式化为一个闭环优化流程,其核心线索为:任务描述与初始策略 作为输入,经过四个关键模块的迭代,输出持续进化的操控策略

第一阶段:环境构建

从人类演示中提取硬安全约束,并构建自动验证自动复位机制。该阶段产出一个可重复的物理反馈环境,无需人工干预即可评估策略成功与否并重置任务场景。

第二阶段:自动策略改进

闭环由以下模块协同完成:

  • 环境模块 (EN):执行自动复位与验证,将成功/失败信号及日志返回。
  • 部署模块 (R):在单机或机器人集群上并行执行策略,收集 rollout 数据(传感器、动作轨迹、任务结局)。
  • 进化模块 (E)编码代理(如 LLM-based coding agent)分析失败日志、查阅文献,生成改进的训练基础设施代码或算法代码(例如调整奖励函数、修改仿真到真机迁移参数、引入新的数据增强)。
  • 策略改进模块 (PI):根据进化模块的输出启动新一轮策略训练(启发式学习或梯度优化),生成待评估的候选策略。

模块间形成 reset → execute → verify → refine 循环。编码代理不仅调整策略本身,还能优化任务奖励设计训练管道,甚至多机器人调动逻辑,显著加速搜索过程。

与同类方法的差异

不同于依赖人工监督调优的传统机器人研究,也不同于仅限数字环境的自主编码代理,ENPIRE 首次将真实物理反馈嵌入编码代理的自主改进循环,使算法搜索直接在真实世界中自动展开,最小化人工介入的同时允许公平消融实验。

实验

实验设计

ENPIRE 框架在真实世界的灵巧操作任务上进行评估,包括整理针盒、系扎带、工具使用等挑战性场景。实验以前沿编码代理(如 GPT-4o、Claude)作为自主研究主体,利用环境自动重置与验证、策略改进、并行执行及进化模块构成的闭环,将策略学习抽象为可重复的优化过程。消融研究涵盖:不同编码代理模型对比、原生视觉能力的必要性、多代理并行扩展效率、token 利用率分析,以及在 RoboCasa 仿真基准上的公平对比。

关键发现

  • 通过 ENPIRE 驱动的自主训练,真实世界操作策略达到 99% 成功率,在复杂灵巧任务上首次接近人类水平。
  • 在机器人群上部署多代理团队显著加速策略收敛,验证了“代理团队+物理并行”对自主机器人研究的可扩展性。
  • 进化模块使代理能够分析执行日志、查阅文献并自主改进训练基础设施与算法代码,形成“文献→代码→部署→验证”的闭环。
  • 研究发现基于代码的策略与视觉语言动作模型(VLA)存在协同效应,混合方案优于单一范式。
  • 资源消耗分析表明,token 成本随机器人数量超线性增长,当前算力与机器人利用率仍不饱和,存在优化空间。

与基线对比的深度解读

相较于依赖密集人类监督的传统策略迭代,ENPIRE 首次在物理世界构建了可重复、可审计的自动化研究循环,将人力干预降至最低。消融实验揭示:不同编码代理在抽象推理与代码生成上的能力差异直接影响策略改进效率,例如 GPT-4o 在日志分析上的深度优于 Claude,而 Claude 在多步规划中更稳定。多代理并行虽缩短 wall-clock 时间,但 token 成本非线性增加,表明未来需在代理调度与通信效率上做权衡。仿真对比进一步显示,ENPIRE 的物理反馈循环相较于纯仿真训练具有更强的 sim-to-real 迁移鲁棒性。

行业影响

落地场景

ENPIRE 为物理机器人策略自治提供了完整的闭环工具链,可直接应用于:

  • 仓储物流:商品打包、拣选与装卸,如纸箱整理、封箱胶带/扎带操作
  • 柔性制造:小批量多品种装配(接插件安装、螺丝锁付),快速换线无需人工重编程
  • 机器人即服务 (RaaS):部署在不同客户现场时,机器人自主适应新对象和环境,降低定制化成本
  • 服务机器人:酒店、商超等场景下的灵巧物品整理、餐具摆放、工具使用

商业价值

  • 降本:将人工逐任务算法工程替换为 coding agent 驱动的自动化迭代,显著减少现场调试人员和高昂的专家时间成本
  • 增效99% 成功率(纸盒整理、扎带、工具使用等)意味着产线连续运行,减少停机;多机器人并行 (robot fleet) 可进一步缩短训练时间
  • 体验与扩展性:闭环自进化能力使机器人可针对新 SKU 或新任务快速适应,使机器人产品从“专用机”变为“可以持续学习的物理智能体”,提升产品粘性和市场空间

与现有工作流的接口

ENPIRE 是一个 harness 框架,可作为中间层接入现有机器人软件栈:

  • 环境模块对接自动化夹具、传送带和传感器,通过 API 实现物理重置与结果验证
  • 策略改进模块可集成现有 RL/BC 训练管道(如 Isaac LabLeRobot),接收 coding agent(如 GPT-5Claude)生成的代码补丁
  • Rollout 模块通过统一接口调度不同机器人(如 FrankaUR5e),支持 gRPC/ROS 2 通信
  • 进化模块读取日志后产出 代码 PR,可直接合并到策略代码库,形成 CI/CD 式的物理策略迭代

具体落地 use case

  1. 电商物流中心“按灯拣选”后包装
    在订单完成拣选后,机器人需完成多样的末道包装:封袋、捆扎、放入礼品盒并系丝带。使用 ENPIRE 后,只需提供奖励信号(如“盒盖闭合且丝带交叉”),coding agent 即可在数小时内迭代出策略,无需人工示教。运营方可快速从人海战术切换为机器人值守,并按季节促销动态调整包装样式。

  2. 3C 产品总装线的接插件装配
    消费电子装配中常需插入微型 FPC 排线、BTB 连接器等,对位精度高、力控敏感。ENPIRE 可利用自动重置与验证模块持续采集成功/失败样本,coding agent 自动调整力控阈值、视觉定位策略,使机器人换型时间从数天缩短到数小时,良率稳定在 99% 以上,支持产线的小批量多品种柔性生产。

局限

  • - **Token 成本随舰队规模超线性增长**:论文指出,随着并行机器人数量增加,编码智能体产生的 token 开销呈超线性上升。原因在于多机器人产生的日志量更大、交互轮次更密集,导致每次迭代都需要更长的上下文窗口。在实际工程中,这意味着大规模部署时推理成本可能成为瓶颈,需要结合上下文压缩或分层摘要技术来缓解。此外,实验页面提到“机器人和计算资源未被充分利用”,表明当前调度策略还有优化空间。
  • - **任务与环境的泛化边界尚不明确**:ENPIRE 仅在三种灵巧操作任务(整理针盒、绑扎带、工具使用)上验证了 99% 成功率,但未展示对新任务或动态环境的零样本迁移能力。真实世界中物体形状、光照、背景噪声等变化都可能破坏依赖视觉验证的奖励信号。自动重置模块目前仍依赖特定任务的人为设计(如夹具布局、重置脚本),扩展到完全非结构化的家庭或仓库场景需要更强的感知与规划能力。
  • - **物理重置的自动化程度受限**:与纯模拟环境的自主研究不同,真实世界无法完美恢复初始状态,这直接影响策略搜索的统计效率。ENPIRE 依赖硬件夹具和环境模块实现自动重置,但在多阶段长周期任务中,场景的微小偏差会随时间累积,导致结果不可复现。相比于仿真中瞬间重置和无限并行,物理闭环的迭代速度慢 1-2 个数量级,且仍需人工介入定义安全约束和成功判定条件,尚未达到完全“研究员离开”级别的自主性。
论文Wenli Xiao2026-06-18原文

相关内容