InterEvolve: 面向人形 Loco-Manipulation 的奖励程序测试时演化
我们研究面向人形 loco-manipulation 的测试时演化(test-time evolution):不重新训练,仅靠复用 controller 已有技能、从自身尝试中改进并保留所学,去完成它从未被训练过的任务。核心洞见是:通用 controller 本身已具备新任务所需的大部分能力,只要存在一个足够有表现力的规划-控制接口:既能描述接触丰富、多阶段的交互,又足够可执行、可度量,让执行反馈指导规划。 InterEvolve 用两个组件实现该接口: 1. 构建 object-aware forward-backward(FB)行为基础模型,其在冻结 body prior 上的 object residual 可在测试时把关于本体或物体的新奖励转化为 loco-manipulation 行为; 2. 将任务写成 reward programs:带完成条件与可调常量的分阶段奖励。LLM agent 结合执行反馈和已验证程序的 skill library 在上下文中修改程序结构,数值优化器则调优其常量。 每个候选程序都在并行的 simulation 场景中验证,因此程序能持续探索新的方式去诱导、复用并组合 controller 已有的运动能力,并逐轮改进。实验显示,人工设计的奖励远未挖掘出 FB 模型的 loco-manipulation 潜力,而 InterEvolve 演化出的程序释放了这些能力,有时还催生新颖策略;它还能在 simulation 中为多样任务、复杂场景与长时程组合生成行为,演化出的技能可在 Unitree G1 实体上基于第一视角机载感知自主运行。
论文精读
TL;DR InterEvolve 通过测试时演化奖励程序,让冻结的人形机器人控制器复用既有技能解决未见任务,无需重训练,释放被手工奖励遗漏的潜力。
问题
问题背景
人形机器人移动操作(loco-manipulation)正在成为机器人学习领域的核心议题。随着行为基础模型(behavioral foundation model)的发展,研究重心逐渐从单一任务训练转向跨任务泛化与测试时适应。
现有方法局限
传统控制器通常针对固定任务进行强化学习训练,面对新任务时往往需要重新训练或在线微调,成本高且难以部署。基于大语言模型的任务规划方法虽然能生成奖励函数或子目标,但多数方案停留在静态规划阶段:生成的奖励程序缺乏对实际执行反馈的利用,无法根据接触丰富、多阶段交互的结果迭代改进。此外,当前人形机器人的预训练控制器能力大多被人工设计的奖励函数所掩盖,其内在的运动技能未能被充分挖掘和重组。
为什么这个问题难/重要
核心挑战在于需要一个表达力足够强、同时可执行且可测量的接口,连接高层规划与底层控制。接触丰富的多阶段任务要求奖励信号能够精确描述物体交互与阶段性完成条件,而无需重训练即可重用已有技能,这对实际部署至关重要。业界关注度高,因为这类能力决定了人形机器人能否像基础模型一样,通过上下文调整而非参数更新来快速适应新任务。
原作者论断:一个广泛训练的控制器已经持有新任务所需的大部分能力,关键在于通过合适的接口释放这些能力。
行业类比
类似大语言模型通过提示工程与工具调用在零样本条件下解决新问题,人形机器人基础模型需要类似的测试时进化机制,在不更新网络权重的前提下,动态组织已有技能完成未见任务。
核心洞察
- 将任务表示为可编辑的奖励程序,使测试时进化能通过结构化搜索而非直接策略生成来适配新任务。与冻结策略上的 prompt 条件或微调不同,InterEvolve 用 LLM 修改程序结构、数值优化器调整常量,执行反馈驱动迭代。该抽象在表达力上足以指定接触丰富、多阶段的 loco-manipulation 交互,同时保持可执行性和可测量性,让仿真验证器能可靠评估候选,从而高效复用基础控制器的已有运动能力。
- 对象感知的前向后向行为基础模型通过对象残差在冻结身体先验上注入新奖励,实现测试时零样本行为合成。不同于常规 FB 模型直接输出动作,该设计保留了身体运动先验,同时允许对象交互目标灵活改变,从而将新任务奖励直接转化为 loco-manipulation 行为。这避免了为每个新任务重新训练控制器,并证明人类手工奖励远未充分挖掘基础模型的潜力,而进化奖励程序能释放这些能力。
- 技能库与并行仿真验证为测试时进化提供了累积性和可复用性。LLM 代理从已验证的程序中检索相似技能,结合执行反馈修改结构,数值优化器调参,并行仿真快速评估候选。由此,系统在少量迭代内发现新策略,甚至通过组合已有技能产生新颖解决方案,相比一次性 LLM 规划或随机搜索显著提高了样本效率和任务成功率。
方法
方法概述
InterEvolve 采用 test-time evolution,核心思想是:一个预训练的 object-aware forward-backward (FB) behavioral foundation model 已经具备广泛的 loco-manipulation 能力,通过一个可编辑的 reward program 接口将新任务转化为行为,并在测试时迭代演化该程序,无需重训练。
输入 → 关键模块 → 输出
- 输入:新任务描述或初始 reward program,预训练的 FB 模型(其 body prior 冻结),以及一个 skill library。
Reward Program 表示:任务被建模为分阶段奖励,每个阶段包含完成条件和可调常数,结构清晰、可编辑。
FB 模型执行:给定 reward program,FB 模型通过 object residuals (物体感知残差)在冻结的 body prior 上生成运动行为。该模型利用 forward-backward 表征将 reward 梯度映射到动作,在测试时直接输出 loco-manipulation 轨迹,无需重新训练。
演化循环:
- LLM agent 根据执行反馈和 skill library 中的相似程序,修订 reward program 的结构(如调整阶段顺序、增删条件)。
- Numerical optimizer 微调程序中的常数,以最大化任务得分。
- 候选程序在并行仿真场景 中验证,评估鲁棒性。
反馈与选择:验证结果返回给 LLM agent 进行下一轮迭代;优秀程序加入 skill library 以支持跨任务复用和组合。
- 输出:演化后的 reward program,在仿真中表现良好,可直接部署到真实机器人(如 Unitree G1)使用 egocentric onboard perception 自主运行。
与同类方法的差异点:替代了手工奖励设计或端到端 RL 训练,在测试时通过 LLM 与数值优化直接演化 reward program,充分利用 frozen controller 的已有技能,实现快速适应。
实验
实验设计
- 在多样仿真任务、复杂场景、长程组合任务上验证 InterEvolve 的 reward program 进化能力。
- 控制器为 object-aware forward-backward (FB) 基础模型,冻结 body prior,通过 object residuals 响应新 reward。
- LLM agent 根据执行反馈和技能库修改 reward program 结构,数值优化器调参数,候选程序在并行仿真场景中验证。
- 在物理 Unitree G1 上部署进化后的技能,使用 egocentric onboard perception 自主运行。
关键发现
- 人工设计的 reward 对 FB 模型的 loco-manipulation 能力利用率不足;InterEvolve 进化的 reward programs 能释放这些能力,有时发现 novel strategies。
- 支持任务迁移、技能重用与组合,无需重训练。
与基线对比解读
- 相比固定人工 reward,进化 reward program 提供了更可编辑、可反馈优化的任务策略表达。
- 其优势在于将 test-time search 与 LLM structured revision 结合,显著超越静态 reward 设计的表达能力;但量化指标尚未在摘要中披露。
行业影响
落地场景
InterEvolve 提供一种无需重新训练的人形机器人任务适配方法,适用于:
- 电商仓储:人形机器人在混 SKU 拣选、包装台物料搬运中动态切换任务,例如从“抓取纸箱”切换到“推车对接”。
- 商业服务:酒店/医院物流中,机器人根据当日需求调整送物、开门、清理等长时程操作。
- 具身智能平台:作为人形机器人基础模型的测试时适配层,处理分布外操作任务。
商业价值
- 降本:省去为新任务收集示教或强化学习训练的费用,只需在现场迭代 reward program,单任务适配成本显著下降。
- 提效:同一批机器人复用多种技能,提升资产利用率;新任务上线时间从周级压缩到小时级。
- 体验:reward program 结构可解释,便于安全审计与人工接管。
与现有 stack 集成
- 以 ROS 2 action/task graph 作为执行层,将 reward program 映射为可观测的 completion condition 与 reward 节点。
- 用 digital twin + Isaac Sim 并行验证,接入现有仿真 CI 流程。
- LLM agent 作为任务编排插件接在机器人中间件之上,skill library 对齐行为树。
局限
- **对预训练 FB 模型的高度依赖**:InterEvolve 的核心执行机制建立在物体感知的 forward-backward 行为基础模型之上,该模型需要大规模、多样化的 loco-manipulation 预训练数据。如果新任务与预训练分布差异过大(例如全新的物体交互模式或极端动力学条件),object residuals 可能无法有效诱导所需行为,导致 reward program 演化失败。论文虽展示了多个任务,但并未系统量化分布外泛化边界,这限制了方法在开放世界场景中的适用性。
- **演化过程的计算与样本开销**:每个 reward program 候选都需要在多种并行仿真场景中验证,LLM agent 迭代修改程序结构、数值优化器调整常数,整个过程需要大量 rollout。虽然论文没有给出精确成本,但可以推断出这需要相当规模的仿真计算资源,对于实时或资源受限的机器人系统而言可能难以承受。此外,仿真验证与真实物理部署之间的 sim-to-real gap 未被充分讨论,物理实验仅展示有限任务,长期自主运行时的感知噪声、模型误差等因素可能进一步降低成功率。
- **LLM 搜索的可靠性与程序空间爆炸**:reward program 的结构由 LLM agent 在上下文内修改,其生成质量受限于 LLM 本身的推理能力和对任务语义的理解。程序空间极大,包含分阶段奖励、完成条件和可调常数,LLM 的随机性可能导致低效探索或陷入局部最优。论文依赖 skill library 提供已验证程序作为先验,但库的构建和覆盖范围需要人工设计,这削弱了方法的全自主性。与端到端强化学习或直接策略搜索相比,这种符号化程序搜索可能难以处理需要连续微调行为细节的任务。