论文

AI agents 能否进行开放式 AI 研究?来自两个案例研究的初步证据

AI agents 能否进行开放式 AI 研究?来自两个案例研究的初步证据

关于 AI 进展爆炸的预测依赖于 AI agents 自动化 AI 研究,但目前缺乏 agents 能否进行开放式 AI 研究的证据。现有评估要么在狭窄的可验证任务上测试 agents(排除开放式研究),要么将 AI 生成的论文提交给盲审(成本高、随机性强、评审质量差)。我们提出第三种衡量 AI 研发自动化进展的方式:shadow evaluations。 方法:让 agent 承担一篇高质量未发表论文的核心开放式研究问题,由该论文的原作者对其输出进行评分。我们对两篇未发表的 NeurIPS 2026 投稿进行了 shadow evaluations,给予前沿 agents 六天时间和数千美元的计算资源。Agents 在无人辅助下完成了所有工程,但未能对研究问题做出实质性进展。因此,两篇论文均被作者明确拒绝。 我们识别出五个反复出现的失败模式: 1. 对可发表研究的门槛判断力差; 2. 对研究设计缺陷缺乏创造性应对; 3. 从死胡同中无效回溯; 4. 资源意识差; 5. 指令漂移。 使用第二种模型和支架进行的稳健性检验再现了这些失败。我们公开发布了专家评审、调查回复、agent 仓库和日志。我们的结果为今天 agents 能完成 AI 研究的工程但难以应对研究生命周期中的关键部分提供了初步证据。

论文精读

TL;DR 本文提出**影子评估**框架,首次系统验证当前 AI 代理虽能独立完成 AI 研究的工程实现,但在判断研究价值、应对设计缺陷、回溯死胡同、资源感知及指令遵循等关键环节上仍普遍失败,为 AI 研发自动化提供早期实证。

问题

问题背景

构建能自主推进开放式研究的 AI 代理 是实现 AI R&D 自动化 的核心目标,业界对此寄予厚望,因为一旦突破,将可能带来 AI 进步的指数级加速。

现有方法局限

目前评估 AI 研究能力的方案存在明显不足:

  • 窄任务评测:将代理限定在收敛的、可验证的问题上(如刷榜已知基准),完全回避了开放式研究中定义问题、探索未知的环节,无法反映真实研究能力。
  • 盲审对比:将 AI 生成的论文提交至学术会议,依赖同行评议,但审稿过程本身过载、随机且质量参差不齐,难以作为稳定可靠的测量工具。

为什么这个问题难且重要

开放式 AI 研究需要 判断力(识别有发表价值的方向)、创造性调整(当实验失败时重新构想方法)、资源意识(在有限算力下做取舍)以及 长期目标维持。现有代理在这些认知维度上暴露了系统性缺陷,例如遇到死胡同时无法有效回溯、对发表门槛缺乏理解。这并非简单的工程扩展问题,而是要求智能体具备类似人类科学家的元认知能力。正因如此,AI 自动化研发 的进展是衡量迈向通用人工智能的关键里程碑,全球头部实验室均将其作为重点方向,相关证据的任何进展都直接影响行业对 AI 发展曲线的判断。

行业类比

如同 自动驾驶 从封闭场地测试走向开放道路:处理常规驾驶容易,但应对罕见长尾场景才是 L5 级能力的关键——AI 研究代理同样需要面对未知、模糊和失败,而非仅仅完成已知流程。

核心洞察

  • **工程能力达标, 科学判断缺失** 是当前 AI 代理在开放研究中失败的核心瓶颈。 该研究通过让代理处理真实 NeurIPS 级论文的开放性问题, 发现前沿模型可在无人干预下完成全部工程实现, 却无法做出实质研究进展。 区别于以往在封闭任务上测试代理工程能力的评估, 这项工作揭示了研究自动化真正的障碍不在于代码实现, 而在于形成假设、评估研究标准、创造性地应对设计缺陷等高阶认知环节。
  • **影子评估** 为 AI R&D 自动化提供了高信号、可复现的中间基准。 现有评估要么局限于可验证窄任务, 要么依赖充满随机性且质量不佳的同行评审。 该研究让未发表论文的原作者直接对代理的研究输出进行评分, 兼顾了任务的开放性与评价的可靠性。 这种方法不仅能量化进展, 还能系统性地暴露代理在研究生命周期中的失败模式, 比传统基准更贴近真实研究场景。
  • **五大失败模式** 具体化了 AI 研究代理的改进路径: 对发表标准的误判、面对设计缺陷时缺乏创造性、无效回溯、忽视资源约束、指令漂移。 这些模式并非简单的能力不足, 而是体现在代理试图自主导航开放式问题时的系统性缺陷。 通过双模型复现, 该工作证实了这些问题是当前范式的共性短板, 为下一阶段代理设计明确了方向——需要强化元认知、长期规划与不确定性下的决策能力。

方法

影子评估框架

论文提出一种评估AI智能体进行开放式AI研究能力的新方法——影子评估(shadow evaluations)。核心思路:让智能体承担高质量未发表论文的核心开放式研究问题,由原论文作者直接评判其输出,从而获得更可靠的进展信号。

输入

  • 两篇NeurIPS 2026未发表论文,每篇包含明确定义的开放式研究问题。
  • 完整的工程环境:代码库、数据集、计算资源预算(数千美元)和时间限制(六天)。
  • 无需人类干预的自主运行权限。

关键模块

  1. 任务实例化:将论文的研究问题转化为智能体可执行的目标,提供起始代码、文献上下文和评估标准。
  2. 智能体自主执行:前沿智能体(搭配scaffold)在六天内独自完成所有工程工作,包括实验设计、代码实现、超参数调优、结果分析与报告生成,期间无人类介入。
  3. 作者评判:原论文作者审查智能体生成的完整成果(代码、实验记录、报告),判断其是否对研究问题做出了实质性贡献,并给出明确的接受/拒绝决定。
  4. 失败模式归因:通过对比智能体行为与成功研究过程,系统归纳出五大重复出现的失败模式:
    • 发表标准判断力差:无法区分渐进式改进与真正突破的界限。
    • 对设计缺陷的非创造性响应:遇到方法不足时缺乏灵活变通,仅机械调参。
    • 无效回溯:在死胡同方向持续投入,不能及时识别并切换路径。
    • 资源感知薄弱:对计算和时间预算缺乏全局规划,导致低效分配。
    • 指令漂移:在执行过程中逐渐偏离原研究目标,最终产出与核心问题无关。

输出

  • 两篇论文均被作者明确拒绝,智能体未能取得实质性进展。
  • 详细的专家评审、调查问卷、智能体代码仓库与完整日志全部公开。
  • 第二模型与scaffold的稳健性检查再现了相同失败模式,验证结论的普遍性。

与同类方法的差异:不同于窄任务基准(如SWE-bench)仅考察可验证工程能力,或盲目同行评审(引入随机性与低质量审稿),影子评估直接度量智能体完成开放式研究的核心能力,并由最了解问题的原作者把关,极大降低了评估噪声。

实验

实验设计

本研究提出 shadow evaluations 方法,评估 AI agent 进行开放式 AI 研究的能力。选择两篇未发表的 NeurIPS 2026 投稿论文,将其核心研究问题交给前沿 agent,给予 6 天时间和数千美元算力,agent 需独立完成全部工程实现并尝试推进研究问题。完成后,由论文原作者对 agent 的产出进行评分(接受/拒稿)。此外,用 第二个模型和 scaffold 做了 robustness check,以确认失败模式的可复现性。

关键发现

  • 两篇论文均被原作者明确拒稿,agent 未能在核心研究问题上取得实质性进展。
  • 识别出 五种重复出现的失败模式:
    1. 对可发表研究的基准判断不佳
    2. 面对实验设计缺陷时缺乏创造性应对
    3. 从死胡同中回溯的能力不足
    4. 资源意识薄弱(对算力与时间分配不合理)
    5. 指令漂移(逐渐偏离原始研究目标)
  • robustness check 复现了以上失败模式,表明问题并非特定模型或工具链独有。

与基线对比的深度解读

传统评估要么局限于 窄领域可验证任务(无法衡量开放式研究),要么依赖 盲审(流程过载、随机性强、审稿质量差)。shadow evaluations 开辟了第三条路径:直接让 agent 复现真实未发表研究,由原作者的专家视角判定质量。对比盲审,该方法更具确定性,且能暴露 agent 在 研究生命周期关键环节 的短板。结果表明,当前 agent 已能完成 AI 研究的工程部分,但在 评判、创新、纠错、资源规划 等高阶认知能力上仍严重不足。这为 AI R&D 自动化进程提供了早期但关键的基准。

行业影响

本论文通过影子评估(shadow evaluations)揭示了当前 AI agent 在开放式 AI 研究中的严重局限,但其工业界洞察在于:agent 已能完成 AI 研究的工程部分,却无法驾驭研究设计、判断与迭代。这对自动化 AI 研发的落地路径有直接指导意义。

落地场景

尽管 agent 尚不能自主提出或推进研究问题,但在需要明确工程流程的场景中已具备实用价值:

  • 模型实验自动化:给定固定研究假设,agent 可自动编写训练脚本、调试超参数、管理实验版本,适用于电商推荐模型、内容平台排序算法的快速迭代。
  • 基线复现与扩展:agent 可复现现有论文的代码,并尝试将方法迁移到新数据集,例如自动驾驶感知模型在不同传感器配置下的适配。

商业价值

主要作用于降本增效,而非增收:

  • 将工程师从重复性实验操作中解放,聚焦于高阶问题定义与创新,缩短模型迭代周期。
  • 在金融风控、医疗影像等强监管领域,agent 可标准化实验流程,减少人为错误,降低合规成本。

与现有工作流的接口

  • 可嵌入 MLOps 流水线(如 Kubeflow / MLflow),作为实验生成与执行的智能节点,但需人工设定研究框架和审查节点。
  • 与论文评审辅助结合:影子评估方法本身可作为企业研发的内部质量关卡,在立项前快速 test 研究可行性,避免资源浪费。

原作者论断:"今天的 agent 能做 AI 研究的工程,但在研究生命周期的关键环节上挣扎。" 因此,当前工业集成应定位 agent 为高自主性的实验助理,而非独立研究者。

局限

  • - **案例覆盖度与生态效度有限**:实验仅针对两篇未发表的 NeurIPS 2026 投稿论文,且仅测试了有限的前沿代理模型(及一次鲁棒性检查中的第二个模型和 scaffold)。六天时间窗口和数千美元计算预算虽能覆盖大量工程实现,但可能不足以应对需要更长期试错、广泛文献调研或创新方法论突破的开放式研究。论文自身也明确承认这仅是“早期证据”,结论的通用性受样本和设定制约,尚未覆盖不同学科、不同研究范式或多样化代理工具链。
  • - **评估依赖主观评分,可重复性弱**:shadow evaluation 的核心是让原论文作者对代理输出打分,这本质上是主观、高方差的过程。尽管作者使用了评审表格和调查问题来引导评判,但不同作者对“实质性进展”的理解仍可能存在差异,且作者对自身工作的熟悉可能引入偏见(例如对代理方向偏离的容忍度更低)。与固定、可自动验证的基准相比,该方法难以标准化,不同论文的评估结果不易横向对比,限制了其作为通用度量标准的能力。
  • - **焦点限于独立研究,未探索人机协同场景**:任务设置要求代理在无人类干预下独立完成从实验设计到结果分析的闭环研究,而现实中 AI R&D 自动化的早期形态更可能是人机协作。实验未能度量代理在研究人员提供方向调整、关键线索或分步指导时的表现,也未对比不同交互模式(如对话式协作、迭代反馈)下的能力差异。此外,识别出的五种失败模式(如研究标准判断差、资源意识弱等)主要源自对代理行为的观察,还未深入拆解到底是模型能力、scaffold 设计还是任务表示本身导致了这些弱点。
论文Peter Kirgis2026-07-29原文

相关内容