PhysEvo:Astra 能行动,就让它行动
Astra 具备行动能力,但可靠的操控取决于它观察与控制世界的系统。我们提出 PhysEvo,一个围绕单个冻结模型的 物理递归自我改进(RSI) 框架。 方法上,任务智能体 执行机器人任务;元智能体 利用产生的轨迹诊断失败、修订工具与技能,并测试修正。元智能体还能改进自身的诊断工具,因此被保留的修订同时支撑后续行动与后续自我改进。该过程培育出关节级控制、寻求证据的观察与可复用的操控技能,且无需更新模型权重,也无需单独训练动作策略。 实验中,在 42 个 RoboDojo 任务上,对保留的任务专用部署版本做 held-out 布局评估,取得五维度平均分 68.14/100 与 62.00% 成功率,而 RoboDawn 的一次性 Astra 智能体为 47.17%(我们对比中最强的已发表参考)。在八项对直接 Astra 构成挑战的操控任务上,PhysEvo 成功率 55.00%,直接 Astra 参考仅 1.25%。将仿真演化的 harness 部署到 AgileX PiPER 并持续修订技能后,在五个真实任务共 25 次试验中取得 90.60/100 平均分与 84.00% 成功率。 PhysEvo 把行动的后果转化为持久、可检验的改变,从而改变冻结模型如何行动与如何自我改进。
论文精读
TL;DR PhysEvo 围绕冻结的 Astra 模型构建可编辑的工具与技能层,通过物理轨迹反馈递归自我改进:不更新权重,把失败经验转化为可测试修订,使操作成功率从直接 Astra 的 1.25% 提升到 55%,真实世界达 84%。
问题
问题背景
具身智能领域,基础模型驱动的机器人操作逐渐成为研究热点。模型本身不直接接触物理世界,必须通过感知、控制接口与工具集(harness)与环境交互,因此可靠操控不仅取决于模型能力,更取决于这一交互系统的设计质量。
现有方法局限
主流做法是让 VLA 模型直接输出末端位姿或关节指令,采用一次推理执行任务。例如 RoboDawn 的 one-shot Astra 代理 在 RoboDojo 任务上平均成功率仅为 47.17%。这类方法存在三个具体局限:
- 控制接口固定:难以在不同任务间切换关节级精细控制与笛卡尔空间控制,无法根据物理反馈调整控制参数。
- 缺乏失败诊断机制:执行轨迹中的错误模式不会被自动分析并转化为可测试的修正,导致重复犯错。
- 经验无法沉淀:成功经验与失败教训不能固化为可复用的技能库或诊断工具,每次任务都从零开始推理,模型权重也保持冻结,无法利用历史交互改进。
为什么这个问题难且重要
物理交互的反馈稀疏、噪声大且延迟高,从失败轨迹中自动生成可验证的修正(例如新的观测工具、控制参数集合、技能封装)需要元代理同时理解低层控制与高层策略语义。此外,递归自我改进(RSI)在物理世界面临安全性与泛化性约束:修正后的行为必须在仿真和真实硬件上都可测试、可持久化,且不能引入不稳定因素。业界对自我改进系统的关注多集中在纯语言或仿真环境,物理世界的 RSI 仍然稀缺,这正是 PhysEvo 试图填补的空白。
行业类比
如同 LLM 代理通过工具调用与 reflection 从反馈中迭代优化答案,PhysEvo 把这种“从后果中学习并修改工具”的循环搬到物理机器人上,使冻结模型通过持续编辑 harness 获得进化能力。
核心洞察
- 物理递归自改进(Physical RSI)让一个冻结模型通过与可编辑的工具-技能层交互,从执行轨迹中迭代诊断、修订和测试,无需更新模型权重或单独训练动作策略。与一次性 agent 或依赖微调的方法不同,PhysEvo 的 meta-agent 不只在任务后修订,还能改进自身诊断工具,使每次修订都沉淀为可复用的观测与控制原语,形成行动与自我改进的双重回馈闭环。
- PhysEvo 将行动后果转化为持久、可测试的修改,从而演化出关节级控制、证据寻求观察和可复用操作技能。这些能力在 RoboDojo 仿真中显著超越直接 Astra 基线(八个挑战任务 55.00% vs 1.25% 成功率),并且仿真演化的 harness 部署到真实机器人后继续技能修订,在五个真实任务上达到 90.60/100 与 84.00% 成功率。该路径区别于以往依赖预训练策略或仿真一次性适配的范式,展示了物理交互驱动的持续 RSI 的跨域可行性。
方法
输入与初始化
- 输入:机器人任务描述、初始控制/观测工具集、空的技能库。
- 共享冻结模型 Astra 不更新权重,仅通过工具调用和提示与外部世界交互。
关键模块与流程
- 任务执行与物理反馈:任务代理(task agent)基于当前工具和技能生成动作序列,在仿真或真实机器人上执行,产生轨迹与物理反馈(如状态、图像、成功/失败信号)。
- 失败诊断与修订生成:元代理(meta-agent)分析轨迹,识别失败模式(例如缺少关节级控制、观测不足、动作序列不鲁棒),提出工具修订(如新增
set_joint_positions控制接口)或技能修订(如“抓取前先调整末端姿态”)。 - 测试与递归复用:修订在任务子集上回测,通过则持久化到共享库。元代理还能改进自身用于诊断的观测/分析工具,实现“元层”递归。
- 可演化实体框架:最终保留的修订形成分层能力:关节级控制、主动与回顾性观测、可复用技能与诊断工具。
输出
- 持久化的工具/技能修订库,无需模型权重更新即可提升任务成功率和泛化性能。
- 可直接部署到真实机器人的仿真演化 harness,支持继续在线修订。
与同类方法差异点:不同于 RoboDawn 等一次性 Astra 智能体或单独训练动作策略,PhysEvo 通过持久化修订 harness 使冻结模型在物理反馈循环中递归改进自身,既不需要微调,也不依赖独立策略网络。
实验
实验设计与关键发现
PhysEvo 评估分三组:仿真 RoboDojo 42 个任务的 hold-out layout 泛化、8 个对直接 Astra 挑战性操控任务、以及真实世界 AgileX PiPER 五个任务(叠积木、叠碗、放笔、倒水、书写 "PhysEvo")。指标为 五维平均分(five-dimension average score)与 成功率。
关键发现:
- 仿真保留任务特定部署版本在 hold-out layout 下取得 68.14/100 平均分 与 62.00% 成功率,相比 RoboDawn one-shot Astra 的 47.17% 成功率显著提升。
- 在挑战直接 Astra 的 8 个操控任务上,PhysEvo 成功率为 55.00%,而直接 Astra 仅 1.25%,差距近 44 倍。
- 将仿真演化的 harness 部署到真实机器人并继续技能修订,在 25 次试验中获得 90.60/100 平均分 与 84.00% 成功率。
对比解读
PhysEvo 的核心优势在于将动作后果转化为持久、可测试的工具与技能修订,而不依赖模型权重更新。与 RoboDawn 的 one-shot Astra 相比,PhysEvo 通过 meta-agent 在任务执行后诊断失败、修订工具和技能、递归改进诊断工具,形成物理递归自改进闭环。这解释了为何在 hold-out layout 上成功率高出约 15 个百分点。尤其值得关注的是 direct Astra 在操控挑战子集上近乎失效(1.25%),而 PhysEvo 沿用同一 frozen model 却提升至 55%,证明系统级 harness 设计(观测、控制接口、技能库)对 embodied 智能体能力有决定性影响。真实世界结果进一步验证了该方法从仿真到现实的迁移能力,且无额外策略训练成本。
行业影响
落地场景
PhysEvo 为物理递归自我改进 提供了一种无需更新模型权重的实施路径,适用于仓储物流、柔性制造、服务机器人等场景。
- 电商履约:拣选/打包机器人可通过轨迹反馈持续修订抓取技能 与 视觉观测工具,应对 SKU 频繁变化。
- 医疗 / 实验室自动化:液体处理、样本转移等精确操作任务,可利用失败诊断迭代改进关节级控制 和 主动观测 策略。
商业价值
主要降低成本与提升部署效率。
- 降低数据与训练成本:冻结基座模型,避免昂贵的微调或强化学习训练;利用真实/仿真轨迹中的失败样本进行轻量级工具修订。
- 提升任务成功率:模拟中从 47.17% 提升至 62.00%,真实世界达 84.00%,显著减少人工干预与停机时间。
- 快速适应新场景:无需重新训练模型,通过更新技能库即可扩展至新任务,缩短从需求到上线的周期。
与现有产品/工作流的接口
PhysEvo 以任务代理 + 元代理 分层架构嵌入现有机器人控制栈。
- 任务代理调用现有 API / 工具接口,输出动作决策;
- 元代理消费轨迹数据,运行诊断工具,产出可持久化的工具与技能修订;
- 修订结果作为配置或轻量代码插件版本化存储,与 MLOps / GitOps 流程对接。
对实际工程的启示:可将 PhysEvo 视为“模型之上的自适应控制层”,在不破坏既有基座模型部署的前提下,实现持续的行为优化与故障自愈。
局限
- 论文主要在 RoboDojo 仿真基准和五个真实世界任务上验证,虽然仿真任务数量较多(42 个),但真实世界任务仅覆盖堆叠、放置、倒水、书写等简单操作,且只使用 AgileX PiPER 一种机械臂,硬件多样性和场景复杂度不足。因此,框架在开放世界、长时程操作或高动态环境中的泛化能力尚未得到充分证明,真实世界结果可能受限于特定硬件和任务配置。
- PhysEvo 围绕冻结模型编辑工具和技能,模型权重不更新,这从根本上限制了能力提升的上限。对于需要模型内在知识、常识推理或复杂语义理解的任务,单纯修订工具和技能可能无法弥补模型本身的不足。递归自我改进的深度、可扩展性以及长期演化中可能出现的错误累积或工具冲突等问题也未在论文中深入探讨。
- 对比基线较少,仅与 RoboDawn 的一次性 Astra 代理和直接 Astra 策略比较,没有与当前先进的机器人操作智能体、基于强化学习或模仿学习的方法进行系统对比,难以全面评估框架的相对优势。此外,元代理的诊断和修订过程可能依赖手工设计的工具接口、提示模板和测试协议,自动化程度和稳健性仍有待提高,在面对全新任务时可能需要人工干预重新设计工具。