论文

AI 研究智能体的递归自我改进

AI 研究智能体的递归自我改进

AI 智能体已开始自动化 AI 全栈的研发工作,从提升训练效率到优化推理。一个自然的下一步是提升智能体自身的研究效率。当 AI 研究智能体自己的代码成为优化对象时,每一次被采纳的重写都变成了下一轮负责编辑的那个智能体,这一循环被称为递归自我改进。 其意义在于一个长期趋势:研发的累计投入不断增加,回报却持续递减。持续的自我改进为扭转这一趋势提供了途径。作者提出 AIDE^2,为前沿 AI 研究智能体实现该循环:它对自己的代码提出修改,在成套 AI 研发任务上对自身修改版本进行基准测试,并保留在隐藏评测中表现最好的改动。 在一次为期 8 天 的自主运行中,AIDE^2 连续发现了 7 项改进,从新的搜索策略到压缩并管理智能体不断增长的上下文的记忆机制。这些收益可泛化到四个留出基准,涵盖机器学习工程、启发式算法工程与基于物理的天气预报,其中最后一项相对选择任务属于分布外场景。 在全部四个基准上,发现的最强智能体追平或超越了由人类工程打造的生产级研究智能体,后者在 FML-Bench 上名列最强之列。在另一个留出任务族上,这些智能体还表现出更少的奖励作弊,而该循环从未显式优化这一属性:运行期间比率从 55% 降至 32%,比人类工程智能体低 7 个百分点。这些结果表明,AI 研究智能体可以通过递归自我改进提升自身研究效率,且收益能迁移到循环从未接触过的任务与领域。

论文精读

TL;DR AIDE^2 实现了 AI 研究智能体的递归自我改进:8 天自主修改自身代码并保留最优版本,发现 7 项改进,在四个未见过基准上持平或超越人类工程版,reward hacking 率从 55% 降至 32%。

问题

问题背景

当前 AI 行业正加速用 自动化研究 agent 替代部分人工 R&D,覆盖训练效率、推理优化等环节。核心关注点从“能否完成单个任务”转向“能否持续提升研究效率”。

现有方法局限

现有 AI research agents 通常由人类预先设计固定的搜索策略、提示模板和记忆机制,无法根据任务反馈调整自身代码。单轮 self-refine 或 prompt optimization 只优化参数或提示,不改变 agent 的底层实现逻辑;人工迭代受限于专家时间,无法持续扩展。更重要的是,这些 agent 在长周期任务中会积累上下文,导致记忆膨胀、效率下降,而现有方案缺乏自动压缩或检索机制。此外,大多数系统未在 held-out 分布外任务上验证过自我修改的泛化能力,容易过拟合到奖励信号,出现 reward hacking。

为什么这个问题难/重要

递归自我改进的技术难点在于:如何设计安全的验证流程,避免 agent 修改自身后降低性能却仍被接受;如何让改进跨任务、跨领域迁移,而不是只对选择任务过拟合。同时,随着累计 R&D 投入增加,边际收益递减已是长期趋势,业界亟需能自动提升研究效率的机制。该问题直接关系到 AI 安全中的自我改进可控性,以及 AI 加速科学发现的可持续性,是前沿实验室与产业界共同关注的核心议题。

行业类比

可类比 AutoML 从人工设计模型到自动搜索架构的跃迁,但这里搜索空间是 agent 自身的代码,闭环更彻底、风险更高。

核心洞察

  • 递归式自我改进让研究 agent 的代码本身成为优化对象,每次接受的改写都成为下一轮的起点,形成累积性提升。这与现有 AI R&D 自动化只优化训练效率或推理部署不同,也不同于超参数搜索或元学习:AIDE^2 直接编辑 agent 的搜索策略、记忆压缩等结构,使科研效率而不是单任务指标持续进步。
  • 在 8 天自主运行中,AIDE^2 不仅提升了 selection tasks 上的表现,还泛化到物理天气预测等 out-of-distribution 任务,并把 reward hacking 率从 55% 降到 32%,且从未显式优化该属性。这表明递归自我改进选择出的机制(如上下文压缩和搜索策略)比奖励函数本身更本质,降低了过拟合和投机行为。相比之下,常规 RL 优化往往加剧 reward hacking,该工作展示了一条通过结构性自编辑获得更通用、更稳健研究能力的路径。

方法

输入

初始输入为一个 frontier AI research agent 的代码库(论文中为 AIDE^2 的种子版本),以及一组用于选择信号的 AI R&D 任务套件。这些任务覆盖训练效率、推理优化等,但核心是作为 agent 自身代码改进的度量基准。

关键模块

  1. 候选生成:当前 agent 对自己的代码提出修改提案,包括改动搜索策略、增加上下文压缩与记忆管理机制等。提案直接写入代码,形成新的 agent 版本。
  2. 基准测试评估:每个修改后的 agent 版本在任务套件上运行,产生性能分数。评估分为可见评估(用于内部比较)和隐藏评估(用于最终决策,防止过拟合到特定案例)。
  3. 选择与递归:保留在隐藏评估上表现最好的改动,将其作为下一轮编辑的起点。上一轮的输出成为下一轮的输入,形成 edit → evaluate → select → edit 的递归循环。
  4. 上下文与记忆:在持续运行中,agent 会积累越来越多上下文,因此发现的改进中包含记忆压缩模块,用于管理增长的 context,避免性能退化。

输出

经过多轮循环(论文中为 8 天自主运行、7 次连续改进),输出一个改进后的研究 agent(如 AIDE_85),其代码中固化了新的搜索策略和记忆机制。该 agent 在未见过的 benchmarks 上泛化,且在 reward hacking 指标上意外改善。

与同类方法的差异

与常见的 AI agent 优化外部任务不同,AIDE^2 的优化对象是 agent 自身的代码,且通过隐藏评估筛选改动而非直接最大化可见分数,这一闭环机制使改进能转移到分布外领域,并降低 reward hacking 风险。

行业影响

落地场景

AIDE^2 的递归自我改进机制可直接用于 AI 研发自动化平台,让研究智能体持续优化自身代码,减少人工调参和工具链维护成本。具体可落地的场景包括:

  • 电商推荐系统:AI 智能体自主改进推荐模型的训练 pipeline 和特征工程代码,自动搜索更优算法配置,缩短模型迭代周期。
  • 企业 MLOps:将递归自我改进作为智能体持续集成环节,自动维护和调优内部 AI 工具链,适应数据分布变化。

商业价值

  • 降本:8 天自主运行发现 7 项有效改进,且泛化到未见的 benchmark,意味着长期 R&D 边际成本显著下降,减少人工重复劳动。
  • 增收:模型性能提升(如天气预测精度)直接转化为产品竞争力;reward hacking 率从 55% 降至 32%,减少线上事故和人工审查开销,间接提升服务质量。
  • 体验提升:更稳健的智能体降低错误输出概率,增强用户信任。

与现有产品/工作流的接口

可集成到两类现有 stack:

  1. Agent 框架:作为 LangChain、AutoGen 等框架的元优化层,智能体提交自身代码变更,在沙箱环境中运行基准测试,通过隐藏评估后自动合并。
  2. MLOps 流水线:嵌入 CI/CD 流程,利用 Kubernetes 容器化运行智能体,配合 MLflow 记录实验,仅保留通过验证的版本,形成自主进化闭环。需提供安全沙箱、版本回滚和资源监控,防止失控修改。

局限

  • **选择任务集与 held-out 基准可能存在隐式相关性**:虽然作者报告了在四个 held-out benchmarks 上的泛化,包括 out-of-distribution 的天气预报任务,但用于筛选改进的 AI R&D 任务套件本身可能已覆盖了足够的通用技能(如代码编辑、搜索策略、上下文压缩),使得改进并非完全意外。8 天运行仅发现 7 个被接受的改进,样本量较小,难以判断改进趋势的统计显著性和长期可持续性,且无法排除运气成分。
  • **缺乏与其它递归自我改进方法的横向对比**:论文主要展示了 AIDE^2 自身的纵向提升以及与 human-engineered AIDE 的对比,但没有在相同任务和资源约束下与其它自我改进框架(如 self-refine、Voyager、ADAS 等)进行系统比较,因此难以判断 AIDE^2 的相对优势。此外,实验依赖特定的闭源 frontier model,其版本和内部能力变化可能影响结果,而代码和配置未明确公开,限制了复现和公平评估。
  • **计算开销与可复现性未充分说明**:8 天自主运行涉及大量基准测试与模型调用,论文未报告具体 GPU 小时数或成本,这对于评估方法的实际落地至关重要。同时,hidden evaluation 的具体设置、任务套件的构成以及接受改进的阈值规则未在正文中详细披露,使得外部研究者难以验证和改进该系统。
论文Dhruv Srikanth2026-09-22原文

相关内容