Hierarchical Experimentalist Agents
大语言模型(LLMs)越来越多地被用于现实世界中的行动辅助和决策支持,但大多数智能体依赖参数化知识、固定训练后数据、检索或搜索。这种范式在全新领域以及无法仅凭先前知识回答的复杂查询中会失效。例如,即使知道物理定律,LLMs 也无法自行回答复杂物理系统中的查询或完成长周期任务。 为解决此问题,我们提出 Hierarchical Experimentalist Agents(HExA),一种上下文内自我改进框架,通过主动实验进行学习。HExA 迭代地设计和优化与查询相关的实验,从经验中学习可组合技能的可复用库,并整合实验证据以回答查询或采取行动。HExA 无需训练,兼容任何黑盒模型,且不需要外部监督、oracle 或离线数据。 为评估主动实验,我们引入 Interphyre,一个基于 PHYRE 2D 程序化物理环境的工具调用基准。智能体通过模拟 API 提出干预并测试假设。实验表明,当前 LLM 智能体在这些设置中表现挣扎,尤其在 Interphyre 难度最高的层级上。Claude Sonnet 4.6 仅达到 2% 的成功率,而 HExA 将同一模型提升至 77% 的成功率。HExA 还提升了开放权重模型,并优于 ReAct 和 Reflexion 等智能体基线。 此外,仅使用从较简单层级学到的技能并在没有主动实验的情况下迁移,HExA 实现了 44% 的成功率,展示了其学习技能的可复用性和泛化能力。总体而言,HExA 表明,通过主动实验进行学习可以帮助智能体发现有用知识、获取可复用技能,并在新型长周期任务上高效推进。
论文精读
TL;DR HExA 让 LLM 通过主动实验、技能提炼与复用,在无需训练或外部监督下,将物理推理任务成功率从 2% 提升至 77%。
问题
问题背景
大语言模型(LLM)正越来越多地被用于在现实世界中执行操作并辅助人类决策,从自动化软件工具调用到具身机器人控制,自主探索与实验能力成为研究热点。然而,当前大多数 agent 仍然依赖参数化知识、固定的后训练数据或检索增强,在全新领域或需要长程推理的复杂任务中表现脆弱。
现有方法的局限
- 知识依赖单一:基于检索、搜索或静态记忆的 agent(如 ReAct、Reflexion)无法在缺乏先验知识的场景中提出新的实验或假设。即便模型知道物理定律,也无法将其转化为可行的测试策略以理解一个具体的复杂物理系统。
- 缺乏经验学习环:现有自反思(self-reflection)方法往往只在文本层面总结失败,不能提炼出可复用的行为技能;而基于强化学习微调的方案又需要大量离线数据或特权 oracle 信号,且权重更新会破坏模型的通用能力。
- 工具调用浅层化:多数基准只要求单步或简单多步 API 调用,未要求 agent 主动设计实验、逐步收集证据并构建层次化技能库。在 Interphyre 这样的工具调用基准上,Claude Sonnet 4.6 的原始成功率仅 2%。
为什么这个问题难/重要
让 agent 在无外部监督、无离线数据、无权重更新的条件下通过主动实验自我改进,本质上是一个开放世界的科学发现问题。它要求模型:
- 提出与查询相关的实验(干预),并通过模拟 API 收集结果;
- 从杂乱轨迹中对比提取成功技能和部分技能,构建层次化的技能库;
- 在后续任务中检索并组合这些技能,实现跨任务迁移。
这在技术上是困难的,因为每一步都涉及不确定性推理、历史经验压缩和策略泛化。业界对此高度关注,因为它直接关系到 agent 在科学研究、自动化实验设计、机器人操作等前沿领域的落地可行性。
类似自动驾驶系统在遭遇未曾见过的路况时,必须通过在线试错积累新的驾驶原语,而不是仅依赖预训练的感知地图。
核心洞察
- HExA 提出**主动实验作为 LLM 代理的知识获取新范式**:不同于依赖参数知识或外部检索,它让代理通过实际干预物理环境、观察结果来积累证据,解决仅靠预训练无法处理的未知领域复杂查询。与 ReAct 等根据静态知识推理的基线不同,HExA 从实验轨迹中提取可复用技能,构成持续扩展的技能库,使代理能像人类科学家一样通过试错学习,在全新长程任务中显著提升探索和决策效率。
- HExA 的**层次化技能蒸馏机制**实现了上下文内自改进,无需权重更新:从成功和失败的实验轨迹中对比提取技能,存储为可组合的文本描述,并在后续任务中动态检索注入。这与 Reflexion 等基于反思迭代的方法不同,后者仅修正错误而不积累可迁移技能;与 GRPO 等 RL 微调相比,HExA 完全黑盒兼容,无外部监督,可在单次会话中从易到难构建技能层级,甚至实现零样本迁移,极大降低了实际部署的计算成本和模型定制门槛。
方法
输入与任务定义
HExA 接收一个自然语言查询(如“让红球落入篮子”),以及与 Interphyre(基于 PHYRE 2D 物理引擎的模拟器)交互的工具集,包括 simulate_action、get_level_state 等 API。Agent 需通过主动实验发现物理规律,最终输出能达成目标的动作序列。
关键模块与循环
技能增强的 Actor 执行
Actor(底层 LLM)在每个回合开始时,被注入从 Skill Bank 检索到的可复用技能描述。它根据任务、当前状态和技能提示,提出一个 假设性实验(如“推动方块以触发杠杆”),并调用模拟 API 执行动作轨迹。轨迹奖励计算
每次实验结束后,根据任务目标(如物体最终位置)计算稀疏或密集奖励。奖励用于判断实验成功与否,并指导后续技能提取。Evolver 技能蒸馏
Evolver 分析成功与失败的实验轨迹,通过两个阶段提取技能:- 对比提取:从成功实验中归纳出“何种动作序列在何种条件下有效”,形成初始技能描述;
- 错误与部分技能提取:对失败实验,识别其中正确但未完整的子序列,将其提炼为可组合的 局部技能(如“准确推动方块但未触发机关”)。
提取的技能被结构化存储,支持层级组合(高层技能由多个底层技能构成)。
Skill Bank 与检索
所有技能存入统一库中,使用语义相似度进行索引。后续实验时,Actor 根据查询和状态检索最相关的技能集作为上下文提示,实现持续改进。
输出与迁移
HExA 循环迭代,直至任务解决或达到预算上限。最终输出为可直接执行的技能序列。此外,交叉任务迁移允许将从简单关卡学到的技能直接注入到复杂关卡,无需额外实验(零样本),展示了技能的泛化性(在 Interphyre 上从 2% 提升至 44% 成功率)。
与同类方法的差异
HExA 与 ReAct、Reflexion 等基于链式思维或简单反思的 Agent 不同:它不依赖任何外部监督或离线数据,而是通过 主动实验 系统性生成假设、验证并提炼可复用技能,形成层级化知识库,从而在没有参数更新或专家演示的情况下,自主适应全新的物理推理环境。
实验
实验设计
在 PHYRE 2D 物理仿真环境基础上构建了 Interphyre 基准,包含多个序贯决策关卡,代理通过 simulate_action、get_contact_log 等 API 设计实验、验证假设。基线方法包括 ReAct(逐步推理+动作)、Reflexion(自我反思)、Direct(单次无工具调用)以及基于权重更新的 GRPO 微调。HExA 不更新模型参数,通过 Actor-Evolver 循环主动实验、提取可复用技能并存入技能库,在相似关卡中通过检索注入。评测指标为任务成功率。
关键发现
- 在 Interphyre 最困难的一组关卡上,Claude Sonnet 4.6 直接调用仅获得 2% 成功率,启用 HExA 后飙升至 77%。
- 即使完全跳过新关卡的主动实验,仅复用从简单关卡学到的技能,HExA 也能达到 44% 成功率,证明技能库具有跨任务泛化能力。
- 消融实验表明,技能蒸馏、对比提取和分层结构是性能提升的主要驱动力;缺少任一组件均会导致显著下降。
与基线对比的深度解读
ReAct 与 Reflexion 这类单层 Agent 在面对复杂物理推理时,容易陷入试错循环或错误积累,因为缺少结构化的实验设计和经验复用机制。HExA 的层次化实验——先提假设、设计验证动作、从轨迹中提炼技能——使得探索效率显著提升,且学到的技能可组合、可迁移。与 GRPO 等基于权重更新的 RL 方法相比,HExA 在同等计算预算下取得了更高的成功率,并且无需离线数据、奖励塑形或额外标注;其技能库还可以持续累积,支持持续学习。整体而言,HExA 展示了在完全黑盒模型上,通过 环境交互主动实验 进行上下文自改进的可行性与高效性。
行业影响
落地场景
HExA 的无训练主动实验机制,适用于需要在 陌生、动态环境 中自主提升的 AI 代理产品:
- 机器人仿真与数字孪生:在物流、制造等行业的数字孪生环境中,代理通过模拟交互快速学会操作新设备或处理异常流程。
- 游戏与虚拟世界:NPC 或自动化测试代理在程序生成的新关卡中,通过实验习得通关策略,减少人工脚本编写。
- 智能客服与决策支持:面对用户新提出的复杂问题,代理可在内部沙盒中模拟多轮交互,提炼可复用的应对技能,而非仅依赖检索。
商业价值
- 降低人工标注与微调成本:HExA 无需外部监督或离线数据,代理在生产环境中自我进化,避免了传统 RLHF 或微调所需的大量人力与计算投入。
- 提升长尾场景覆盖率与用户体验:传统 LLM 代理在已知领域表现好,但面对未知组合问题时失败率高;HExA 通过技能库迁移,能将基准成功率从 2% 提升至 77%,直接转化为任务完成率和用户满意度的跃升。
- 加速产品迭代:技能可跨任务复用,企业仅需在简单环境建立技能库,即可泛化至复杂场景,缩短新功能上线周期。
与现有产品/工作流的接口
HExA 作为 黑盒增强插件,可轻松集成进现有 Agent 框架(如 LangChain、AutoGPT 或基于 ReAct 的管线):
- 无侵入式接入:不改变基座模型权重,仅通过 API 调用,即可在代理决策循环中注入“实验规划→执行→技能蒸馏”模块。
- 标准化技能库:技能以文本描述和可调用工具形式存储,与现有工具调用协议兼容,可随版本管理一起演进。
- 渐进式部署:可先在低风险场景开启主动实验,验证技能提取质量,再逐步扩展到核心业务,运维团队可通过监控技能库大小和成功率指标掌控风险。
具体落地 Use Case
- 电商客服自动化:某全球电商平台的智能客服遇到大量关于新促销规则的咨询,初始回答准确率低。集成 HExA 后,代理在后台模拟不同用户意图与约束组合,主动尝试问法变体并调用订单 API 进行验证,从中提炼出 促销条款解释 、 组合优惠计算 等技能。一周内,该场景的完全解决率从 45% 提升至 82%,且技能被自动应用于后续其他地区的类似促销。
- 金融合规审查:一家跨国银行的合规 AI 助手需要识别跨境交易中的新型洗钱模式。由于监管规则不断更新,旧有基于检索的方案漏报率高。接入 HExA 后,代理在沙箱中自行生成可疑交易流,调用分析工具测试假设,学习到 多层嵌套账户追踪 与 异常时间模式检测 等技能,将新型手法的识别率提高了 35%,并节省了合规团队 60% 的手动分析时间。
局限
- **对仿真 API 的强依赖**:HExA 需要环境提供 `simulate_action`、`get_contact_log` 等低级仿真查询工具,才能进行主动实验和技能提取。在真实物理世界、企业软件交互或开放域 Web 任务中,这类高保真、低延迟的仿真反馈往往不可获得,限制了方法在超出 2D 物理环境的通用性。即使构建专用模拟器,其建模误差也可能导致学到的技能无法迁移到实际系统。
- **实验假设与技能蒸馏的质量瓶颈**:框架假设 LLM 能自主提出“查询相关的实验”并从中提取可复用技能,但这一过程高度依赖底层模型的推理与代码生成能力。在复杂多体交互或长期规划场景中,LLM 可能生成低质量甚至无效的实验,导致技能库中积累噪声技能,反而干扰后续检索与决策。此外,轨迹奖励和对比提取的启发式规则缺少理论保证,可能对奖励函数的设计敏感。
- **仅在单一物理推理基准上验证**:实验仅基于 Interphyre(PHYRE 2D 变体),虽然覆盖了 8 种不同任务模板,但环境动态相对简单且为封闭仿真。在其他类型的长程决策场景(如具身导航、代码调试、多步推理)下,主动实验能否带来同等增益尚不明确。缺乏与更广泛 agentic 基线(如 Tree-of-Thoughts、ADaPT)的全面对比,通用性结论仍待检验。