Toward Generalist Autonomous Research via Hypothesis-Tree Refinement
科学进步依赖探索、实验和抽象化的循环。研究者测试候选方向、解读证据并将经验用于后续尝试。我们研究AI智能体如何在长时间跨度内自主运行这一循环。 提出Arbor框架,结合长期协调器、短期执行者和Hypothesis Tree Refinement (HTR)——一棵持久化树,跨时间链接假设、成果、证据和提炼的洞见。协调器管理全局研究策略,执行器在隔离工作树中实现并测试单个假设。结果返回后,Arbor更新树、传播可复用经验、优化搜索前沿并纳入已验证改进。这使自主研究从局部尝试序列变为累积过程,策略、执行和证据跨时间传递。 在Autonomous Optimization (AO)设置下评估Arbor:智能体通过迭代实验改进初始研究产物,无需逐级人类监督。在模型训练、工具工程和数据合成六个真实研究任务中,Arbor均取得最佳保留结果,平均相对保留增益超过Codex和Claude Code的2.5倍。在MLE-Bench Lite上,Arbor使用GPT-5.5达到86.36% Any Medal,为本对比中最强结果。
论文精读
TL;DR Arbor 通过假设树精炼(HTR)将自主研究转化为累积过程,在六个真实研究任务中全部领先,MLE-Bench Lite 奖牌率达 86.36%,展示出长期迭代研究的工程可行性。
问题
自主研究代理 近年成为 AI 工程化探索的热点,其目标是在模型训练、数据合成等真实研究任务中,让代理像人类研究员一样通过迭代实验自动提升产出质量。
现有方法的局限
主流自主研究代理(如 Codex、Claude Code 等)在长时域任务上存在明显短板:
- 短视实验策略:每次实验独立运行,缺乏跨实验的知识积累,成功经验难以复用,失败教训常被重复。
- 缺乏结构化状态:没有持久的记忆机制来记录假设、中间产物和实验证据,导致搜索效率随任务复杂度急剧下降。
- 开发/测试过拟合:在缺少留出验证的流程中,代理容易在开发集上过度优化,实际泛化能力不足。
挑战与重要性
长期自主研究的核心挑战在于:
- 搜索空间管理:如何在计算预算下平衡探索与利用,避免在无效分支上浪费资源。
- 证据积累与抽象:需要从多次实验中提取可迁移的洞见,并将其融入后续决策——这要求代理具备假设精炼与因果推断能力。
- 全局策略:单纯堆砌更强大的模型或更长的上下文无法解决这类问题,必须有层次化规划(战略协调与战术执行分离)。
业界对自主研究代理的关注度持续上升,因为其直接关系到实验效率和研发成本,在模型训练、架构搜索、数据合成等场景中应用价值显著。
类比场景
这类似于 自动化 A/B 测试平台 但面向开放研究:不仅需要执行实验,还要从结果中习得规律并动态调整实验路线图。
核心洞察
- 洞察一:自主研究应从无序试错转向结构化知识积累,通过假设树实现策略、执行与证据的跨时间累积。 与将研究视为独立试验的现有 agent(如 Codex、Claude Code)不同,Arbor 的 Hypothesis Tree Refinement 将每次实验的结果持久化,形成可复用的知识图谱。协调器基于全局证据动态调整搜索前沿,避免重复失败路径,使优化过程从“采样竞赛”变为“认知迭代”,显著提升了长期任务的探索效率与最终成果的泛化能力。
- 洞察二:协调器-执行器分离架构与孤立工作树,解决了自主研究中的方向漂移与上下文遗忘问题。 Arbor 通过长期运行的协调器维护全局研究策略,短期执行器在隔离环境中验证假设,二者通过假设树异步通信。这种设计使每个实验不受其他分支的干扰,成功经验与失败教训被沉淀为树的节点和边,在下游任务中自动引用,从而实现真正的跨任务迁移,而非依赖单一 agent 的残存记忆。
方法
Arbor 面向自主科研长周期场景,将研究过程建模为在假设树上的持续精炼。输入为初始研究工件、任务指令与预算,输出为经过多轮验证性实验迭代优化后的最终工件。
核心循环由三个关键模块驱动:
- Hypothesis Tree Refinement (HTR):一棵持久化的树结构,每个节点存储假设、关联的实验工件、证据及提炼的insight。树既是研究状态的持久记忆,也定义搜索前沿。
- Coordinator(长期协调器):按全局策略管理树,基于已有证据选择待探索的前沿分支,决定下一步要验证的假设,同时负责跨任务知识迁移与策略调整。
- Executor(短期执行器):在独立的
worktree中实例化单个假设,执行隔离的实验(如修改训练代码、调整数据合成逻辑),产出可复现证据。
每次迭代中,Coordinator 从树中选取高价值假设,分派给 Executor;Executor 返回实验结果后,树被更新——节点附加证据,提炼可复用insight,前沿被重新评价以淘汰无效方向、扩增有希望的分支。此设计将自主研究从局部试错序列转变为累积性的长程过程,策略、执行与证据跨时间传递。
与同类自主研究代理相比,Arbor 的核心差异在于显式维护可演化的假设树作为统一研究状态,实现全局策略与局部执行的解耦,使证据积累与策略更新真正跨实验循环生效。
实验
实验设计
评估基于 Autonomous Optimization (AO) 设定:从一组真实的科研任务出发,每个任务提供一个初始 artifact 与一个 held-out 测试集(对 agent 不可见),agent 需通过多轮迭代实验自主改进 artifact,全程无步骤级人类监督。任务覆盖三类:
- 模型训练:Optimizer Design、Architecture Design
- 工具框架工程:Terminal-Bench 2.0、BrowseComp
- 数据合成:Search-Agent Data Synthesis、Math-Reasoning Data Synthesis
Arbor 使用 GPT-5.5 作为协调器与执行器的 backbone,在相同任务接口与资源预算下对比 Codex 与 Claude Code 基线,并在 MLE-Bench Lite 上验证通用性。
关键发现
- 全任务最佳 held-out 结果:Arbor 在所有六项任务上均取得最强 held-out 性能,平均相对 held-out 增益超过 Codex 与 Claude Code 的 2.5 倍。
- 结构化搜索防止过拟合:通过 Hypothesis Tree Refinement 与 held-out admission 机制,开发集上的改进会经过留出验证筛选,有效缓解了自主搜索中的过拟合现象。
- 累计性长期优化:假设树持续存储跨轮次的假设、证据与洞察,使得探索不再是孤立尝试,而是 逐轮累积 的全局优化过程。
- 通用基准表现:在 MLE-Bench Lite 上达到 86.36% Any Medal,为对比最强。
基线对比解读
与 Codex 和 Claude Code 这类通用 agent 相比,Arbor 的核心差异在于 长期策略与证据的持久化。基线 agent 通常将每次实验视作独立作业,缺少跨步骤的知识整合;Arbor 的协调器利用假设树控制搜索前沿,执行器在隔离工作树中验证具体假设,并将结果反哺到树中,形成 可累积、可回溯的研究状态。这种设计让 agent 能够复用已验证的子假设、避免重复失败路径,从而在相同资源下实现显著更高的 held-out 增益。held-out admission 进一步保证了搜索成果的泛化性,而非仅在开发集上过拟合,这对于自主研究场景的实用化尤为关键。
行业影响
落地场景
Arbor 的自主科研能力可直接嵌入 AI 研发自动化平台,例如 AutoML 服务(模型架构搜索、超参数优化)、持续模型改进管道(针对生产模型自动迭代)、数据合成与增强引擎(生成高质量训练数据)以及 基准测试与评估工具集。在 模型训练、harness engineering、数据合成 三类任务中,Arbor 无需逐步骤人类监督即可产出超越基线的方案,适合需要频繁实验的业务。
具体 use case:
- 自动驾驶感知模型迭代:团队用 Arbor 自动搜索目标检测或分割模型的 backbone、数据增强策略,以及训练超参,在指定算力预算内持续提升 mAP,替代大量手动消融实验。
- 电商搜索推荐系统:在线模型需要周期性更新,Arbor 作为自动化实验引擎,探索召回层、排序层的结构变体与训练方案,在 held-out 数据上验证提升后平滑上线,减少工程师干预。
商业价值
- 降本:将实验设计、执行与结果解读从数天/周缩短至小时级,显著降低高级研究人力投入;通过结构化搜索减少无效尝试,节省算力开支。
- 增收:更频繁、更高质量的模型迭代直接改善关键业务指标(如点击率、转化率、检测精度),带来收入增长。
- 体验提升:在内容平台,Arbor 可自主改进内容理解或推荐多样性算法,提升用户留存与满意度。
与现有工作流的接口
Arbor 可封装为 MLOps 流水线的一个智能调度组件,通过以下方式集成:
- 对接 实验跟踪系统(如 MLflow、Weights & Biases),读取历史实验记录作为先验知识;
- 通过 Kubernetes 等容器平台 动态分配执行器资源,复用现有计算集群;
- 协调器作为 有状态微服务,维护假设树并暴露 API,供 CI/CD 系统触发自动优化周期;
- 最终产出的验证模型或代码可通过 模型注册中心(如 MLflow Model Registry)交付生产。
这种“插入即用”的设计使得已有 MLOps 栈的团队能以较低摩擦引入自主研究能力,逐步替代重复性实验劳动。
局限
- **模型依赖性与成本**:Arbor 的实验主要基于 GPT-5.5 等强大闭源模型,推理成本高昂,单次运行需消耗大量 token(论文提及 token 消耗分析但未给出绝对成本)。依赖特定模型能力会限制方法的可复现性与广泛部署,尤其当基座模型更新或不可用时。自主研究的长周期运行累计成本可能阻碍实际落地,且对小模型或开源模型的适用性未经充分验证。
- **任务覆盖与泛化性**:实验仅在六个精心设计的开发-测试分离任务上进行,涵盖模型训练、工具工程与数据合成,但这些任务仍偏向代码生成与优化,未涉及物理实验设计、理论推导等更广泛科研范式。论文承认“评估范围有限”,且假设树的累积机制在需要长期探索、结果延迟反馈或高随机性的开放科研场景中是否有效尚待检验。跨任务知识迁移虽初显效果,但远未达到通用跨域自主科研的水平。
- **长期自主性与人机协作**:Arbor 的协调器负责全局策略,但整个流程仍依赖人类预先定义的目标函数、基线方案与评估器。自主性局限于在预设边界内迭代改进,无法自主提出新问题或重新定义研究方向。论文也指出“创意生成”为目标设计的一部分,但未解决如何让代理自发产生根本性新假设。此外,系统缺乏与人类科研者的动态交互与反馈,这在实际科研中至关重要,可能导致搜索方向偏离实际价值或陷入徒劳优化。