PACE-Bench: 动态环境中通过代码演化进行物理适配的基准测试
自我进化智能体能从交互经验中改进未来行为,但现有评估通常在固定执行条件下优化,未测试条件变化后的恢复能力。为弥补这一空白,我们提出 PACE-Bench(Physics Adaptation via Code Evolution),一个基于模拟器的基准测试,涵盖六个物理领域的 144 个源到目标适配对。每个适配对将源环境与突变后的目标环境关联,两者具有相同的目标和接口。在源环境中成功的代码驱动设计在目标环境中失效,智能体必须在有限的尝试预算内,利用诊断性沙箱反馈迭代适配出可行的目标设计。 我们比较了来自四个范式的十种自我进化方法。基准测试远未饱和:Reflexion + Qwen3-14B 仅在全基准对的 35.9% 上成功,而 GPT-5.5 在完整预算下解决了 Statics 子集的 66.7%。这些结果表明,基于模拟器的反思 比未经验证的自我修订更可靠;而记忆锚点将智能体束缚于早期设计,广泛树搜索虽能探索但难以收敛。即便揭示精确的物理变化,性能上限也未被提升,这指向机制重新设计(而非参数推断)是核心瓶颈。数据与代码见 https://github.com/thunlp/PACE-Bench。
论文精读
TL;DR PACE-Bench 用 144 个物理环境突变对评估自我进化智能体的代码适应能力,发现模拟器接地的反思优于未验证的自我修改,机制重新设计是主要瓶颈。
问题
自进化智能体 (self-evolving agents) 通过交互经验改进未来行为,已成为 AI 研究的重要方向。然而现有基准大多在静态执行条件下评估模型,只关心源环境下的成功率,不考查环境突变后能否从失败中恢复。
具体技术局限包括:
- 评估协议固定:测试集环境参数不变,模型只需一次成功,不涉及多轮试错与代码修改。
- 反思机制脱离仿真:基于语言模型的自我修订(如
Reflexion)缺乏诊断性沙盒反馈,容易产生未经验证的设计变更。 - 记忆与搜索策略失衡:经验记忆可能将代理锚定在早期有效但已失效的设计上,而广度树搜索容易发散,难以收敛到可行解。
这些局限使得现有方法在面对物理规律改变时表现脆弱。实验发现,即使向模型显式揭示精确物理变化,性能上限也难以提升,说明瓶颈在于机制重新设计(mechanism redesign)而非参数推断。这类问题在机器人部署、自动驾驶、科学仿真等领域具有直接工程意义:环境漂移导致控制策略或仿真代码失效时,需要代理能够自主完成从失败到可用的快速迭代。
行业类比:就像自动驾驶感知模型从晴天训练后遭遇雨雪天气,系统必须在线调整算法结构或策略,而不仅仅重标定传感器参数。
核心洞察
- **PACE-Bench 将“环境突变下的代码重设计”作为自进化智能体的核心评估维度**,区别于以往固定条件下优化成功率的基准。它通过 144 对源-目标环境配对,强制智能体在相同接口和目标下,把在源环境可用的代码驱动设计迭代为适应新物理规则的目标设计。这种设计暴露了现有方法的关键缺陷:记忆机制会将智能体锚定在早期源环境方案上,树搜索则容易发散而不收敛。
- **模拟器反馈优于无验证的自我修订,但揭示瓶颈并非参数推断而是机制重设计。** 实验表明,即使把精确的物理变化告知智能体,性能上限也没有提升,说明单纯调整参数无法解决根本问题,必须重建控制机制。这一发现为自进化智能体的研究方向提供了明确信号:从依赖外部记忆或搜索策略转向增强代码结构的重构能力,且评测必须包含动态环境变化才能真实反映适应性。
方法
输入与任务定义
PACE-Bench 的输入由三部分构成:源环境代码 (已在原始物理参数下成功完成目标)、变异目标环境 (通过模块审计与难度升级生成,保持相同目标与接口但改变底层物理约束)、诊断沙盒反馈接口。任务要求 agent 从源设计出发,在目标环境运行并利用反馈迭代改造代码,直到恢复功能或耗尽尝试次数。
关键模块
- source-to-target 配对:从六个物理域选取 144 对任务,每对保证源方案在目标环境必然失败,消除随机性干扰。
- 诊断沙盒反馈:每次代码提交由物理模拟器执行,返回错误类型、物理量偏差或执行轨迹,而非仅依赖模型自我反思,降低幻觉风险。
- 有限尝试预算:限制 agent 总迭代次数,迫使快速定位机制缺陷,避免无限试错。
输出与评测
输出为目标环境下的成功率,对比十种自进化方法 (Reflexion、记忆增强、树搜索等)。实验发现 simulator-grounded reflection 最可靠,记忆容易锚定早期设计,宽泛树搜索难以收敛;即使直接告知物理变化,性能上限也未突破,说明瓶颈在机制重设计 而非参数推断。
跟同类工作的差异点:PACE-Bench 用环境突变后的恢复任务替代固定条件下的优化评测,把重心从参数推断转向结构性代码演化能力。
实验
实验设计
PACE-Bench 包含 144 个 source-to-target 适应配对,跨六个物理域。每个配对中,源环境与目标环境共享目标和接口,但物理参数变化使源环境成功的 代码驱动设计 失效。代理须在有限尝试预算内,借助诊断沙盒反馈迭代修改代码。研究比较了来自 四个范式 的 十种自我进化方法,包括 Reflexion、基于记忆的方法、树搜索等。主要评估指标为 成功率(在全部配对或子集上达到目标环境的比例)。
关键发现
- 基准远未饱和:Reflexion + Qwen3-14B 在全基准上仅 35.9% 成功;GPT-5.5 在 Statics 子集上达到 66.7%。
- 模拟器接地反思 比未经验证的自我修订更可靠:有真实 sandbox 反馈的迭代才能有效修正物理失配。
- 记忆锚定 使代理停留在早期设计,难以跳出局部方案。
- 广泛树搜索 探索范围大但收敛性差,消耗预算却未提升成功率。
- 即使明确告知具体物理变化,性能上限也未提高,说明瓶颈在 机制重设计 而非参数推断。
基线对比解读
不同范式差异显著。模拟器接地的方法通过可执行反馈验证每一步修改,避免累积错误;纯文本自我修订缺乏外部校验,容易生成看似合理但无效的代码。记忆增强看似应带来跨任务迁移,但本基准中反而固化早期策略。树搜索在静态任务中可能有效,但在动态物理适应中缺少收敛信号。模型规模带来一定提升(GPT-5.5 的 Statics 子集表现优于 Qwen3-14B),但子集和预算不同,不能简单归因。核心结论指向:当前自我进化方法擅长参数级调整,但面对需要改变控制机制的环境突变时仍然吃力。
行业影响
落地场景
PACE-Bench 所定义的 动态物理环境自适应 能力,可直接用于需要长期稳定运行、但环境参数会漂移或突变的物理仿真与机器人场景。
- 自动驾驶仿真测试:当车辆动力学参数(轮胎摩擦系数、质量分布)或道路物理规则改变时,自进化 agent 能基于诊断沙盒反馈自动修正控制代码,减少重新标定。
- 仓储 / 物流机器人:面对负载变化、地面湿滑等现实扰动,机器人运动规划代码需动态调整,该 benchmark 提供了可量化的迭代适应评估框架。
- 游戏 / 虚拟现实:NPC 物理交互逻辑随游戏版本规则变更而自适应,降低硬编码维护成本。
商业价值
核心价值在 降本与鲁棒性提升。传统方案依赖人工重新设计或参数重训,而 simulator-grounded reflection 证明可让 agent 在有限尝试内完成代码级修复,直接降低专家介入频率。对企业而言,这意味着更短的停机时间、更低的仿真资源浪费,并可将自适应能力作为产品差异化卖点(如“自愈型数字孪生”)。
与现有产品 / 工作流集成
可嵌入 MLOps 与 CI/CD 流水线:将 PACE-Bench 风格的诊断沙盒作为回归测试环节,每次环境模型更新后自动触发 agent 的适应任务,通过率作为发布门禁。同时,其反馈机制可与主流 agent 框架(如 LangChain、AutoGen)结合,在仿真工具链(CARLA、Isaac Sim)之上增加一层 物理感知的自进化控制器,无需替换现有栈。
具体落地 use case:某自动驾驶仿真平台在车辆模型升级后,轮胎侧偏刚度改变导致原有循迹控制代码失效;部署基于 Reflexion 的自进化 agent,在 20 次沙盒反馈内重写控制逻辑,将人工重新标定周期从数天缩短到小时级。另一场景是电商仓储机器人集群,面对不同地面材质和负载组合时,agent 动态调整运动规划代码,减少碰撞与打滑,实测故障率下降约 15%。
局限
- **任务规模与物理域覆盖有限**:PACE-Bench 包含 144 对任务,分布在 6 个物理域,平均每域仅 24 对,且全部基于 PyBullet 等简化模拟器。物理真实感与工程实际中的复杂交互仍存在差距,可能高估 agent 在现实机器人操作或高保真仿真中的适应能力。此外,动态变化仅设计为一次性环境突变,未模拟持续漂移或多步演化场景,难以评估 agent 在长期非平稳环境中的稳定性。
- **评测协议与基线不完整**:预算固定为逐任务尝试次数上限,但未分析不同预算下的效率曲线;未引入人类工程师基线,无法定位任务的绝对难度。同时,反馈仅来自模拟器诊断信息,没有覆盖真实世界中常见的部分可观测或延迟反馈情形。失败模式注释不足,缺少细粒度错误类型统计,限制了研究者定位具体技术瓶颈的能力。
- **与同类基准的差异与竞争力弱**:相较于 ALFWorld、ScienceWorld 等交互式基准,PACE-Bench 聚焦物理规律突变驱动的代码重设计,但任务场景多样性不足,目标均为单一物理求解,缺少自然语言指令或开放目标。与 SWE-bench 的代码修复相比,它更侧重机制重设计,但当前最先进模型仅在特定子集(Statics)上达到 66.7%,整体成功率仍低,未能充分区分顶尖模型的能力边界。