论文

How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks

How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks

AI 长期助力科学研究,而大语言模型与智能体框架的飞速发展正重塑这一领域:如今,单一系统即可完成从初始假设到最终论文发表的整个研究阶段,这一范式被称为 AutoResearch。然而,现有评估很少揭示这些智能体如何运作或在何处失效:任务范围狭窄、评估只衡量性能而不关注过程、失败诊断缺乏系统性覆盖或工件级可见性。为弥补这一缺口,我们提出 AutoResearchEval,包含 100 个源自已发表前沿科学、覆盖 7 个科学领域和完整研究生涯(包括构思、检索、执行、分析、写作与评审)的任务。评估 8 种框架-模型组合,得到 800 条带过程级标注的自主研究智能体轨迹,并将洞察整理为 ARFT(AutoResearch 失败分类法),一个包含 45 种经验驱动失败模式框架。 为实现可扩展的细粒度归因,我们利用经人工校准的“智能体即裁判”流水线检查完整轨迹和中间工件。失败模式最终收敛到一个总体局限:当前智能体缺乏元认知循环,即对照已有发现检查产出、在产出不成立时进行修订、并质疑所选路径是否合理的能力。 相同模式在所有 8 种框架-模型组合(包括测试过的最强模型)中反复出现,表明缺陷在于模型层面而非特定脚手架;而编排层面的干预能否弥合这一缺陷仍是悬而未决的问题。我们公开发布 AutoResearchEval 与 ARFT,以促进自主科学发现领域的持续研究与发展。

论文精读

TL;DR AutoResearchEval 用100个真实前沿科研任务端到端评估8种智能体,诊断出当前 AutoResearch 智能体普遍缺乏元认知循环,并归纳出45类失败模式 ARFT。

问题

问题背景

AutoResearch 领域当前关注如何利用 LLMs 与 agentic scaffolds 驱动端到端科研流水线,覆盖从假设生成到论文撰写的全生命周期。

现有方法局限

现有评估存在三重缺陷:

  • 任务范围窄:多数基准只测试单一子任务(如文献检索或代码生成),无法反映真实科研任务的多阶段耦合。
  • 只评终点,不评过程:指标多为最终论文质量或成功/失败二元分数,缺乏对中间步骤(如实验执行、数据分析)的过程性监测。
  • 失败诊断缺乏系统性与产物级可见性:即使识别出失败,也往往停留在“模型不会做某类题”的粗粒度判断,没有提出统一的故障分类,也没有暴露 agent 每一步产生的具体中间产物(如检索摘要、实验日志),导致无法定位错误源头。

对实际工程的启示是:这类黑盒式评估会让 scaffold 设计者无从下手改进,因为不知道是规划失误、工具使用错误,还是模型本身的推理缺陷。

为什么这个问题难/重要

AutoResearch 链条长、状态空间大,错误会在阶段间传播与放大;一个早期检索阶段的偏差可能导致后续执行、分析全部偏离。业界对 AI for Science 投入剧增,但若缺乏可靠的过程诊断,生产级自治科研系统就无法安全部署。现有工作(如 SWE-bench 针对软件工程、MLAgentBench 针对机器学习实验)都没覆盖完整科研周期,更无法提供跨阶段的失败归因。

行业类比

这类似于自动驾驶中端到端模型需要的不只是碰撞率,还需要对感知、规划、控制每个环节的失败模式进行细粒度归因,否则无法迭代定位缺陷。

核心洞察

  • 当前 AutoResearch agent 的根本失败并非来自特定脚手架或模型,而是系统性地缺少一个“元认知循环”(metacognitive loop):无法检查产出与证据的一致性、无法在证据不足时自我修正、无法质疑自身决策路径。与此前只关注任务成功率的 endpoint 评估不同,AutoResearchEval 对 8 个 harness-model 组合的 800 条轨迹做了过程级标注,发现 45 个失败模式在包括最强模型在内的所有组合中重复出现。这说明问题位于模型层而非编排层,仅靠更换脚手架或调优提示词无法解决,需要模型具备自我验证与重规划能力。
  • AutoResearchEval 将评估单位从“任务得分”迁移到“轨迹与中间产物”,并采用 human-calibrated 的 agent-as-a-judge 进行 artifact 级归因,使失败诊断具备可复现的语义粒度。传统基准通常以窄域任务和最终得分为主,无法回答“智能体在哪一步、因何而失败”。本文不仅覆盖 ideation / retrieval / execution / analysis / writing / review 全生命周期,而且让 judge 直接检查中间文件、代码和推理记录,将归因结果校准到与人类标注一致。这种“过程可视化 + 失败分类法”为工程团队定位和修复 agent 缺陷提供了直接可操作的诊断工具。

方法

输入与任务构建

从 7 个科学领域已发表的前沿论文中挖掘 100 个真实任务,覆盖完整科研生命周期。任务抽取时标注 novelty-move 类型,并包含定向锚定优化任务。

关键模块

  1. 轨迹生成:将 8 种 harness-model 组合(多种 agent 框架与 LLM)接入六阶段端到端流程——ideation、retrieval、execution、analysis、writing、review,共产生 800 条轨迹。
  2. 人工标注与校准:开发 artifact-aware agent-as-a-judge 流水线,先由人工标注子集校准,再利用 stage rubric、iron rules 和自动检查脚本(qa_check_analysis.py)对完整轨迹及中间产物进行细粒度归因。
  3. 失败分类:归纳出 45 个经验性失败模式,组织为 ARFT(AutoResearch Failure Taxonomy),沿 stage axis(A–F)、cross-stage layer(X)与 root cause axis 三维展开。

输出

800 条带过程级标注的轨迹和 ARFT 框架;分析发现失败模式跨所有 harness-model 组合普遍存在,根因指向缺乏 metacognitive loop。

与同类方法差异:本工作不只看终点性能,而是提供 artifact 级过程诊断,覆盖全生命周期并系统归类失败模式。

实验

实验设计

  • AutoResearchEval 从已发表前沿科学中挖掘 100 个真实任务,覆盖 7 个科学领域与完整研究生命周期(ideation / retrieval / execution / analysis / writing / review)。
  • 对 8 个 harness-model 组合进行端到端 rollout,收集 800 条轨迹。每条轨迹由 human-calibrated agent-as-a-judge 检查中间产物与完整过程,进行细粒度失败归因。
  • 依据人工标注提炼出 ARFT(AutoResearch Failure Taxonomy),包含 45 个经验性失败模式,横跨阶段轴与跨阶段层。

关键发现

  • 所有 8 个组合(含最强模型)反复出现相同的失败模式,说明缺陷位于模型层而非某个特定 scaffold。
  • 核心短板是缺乏元认知循环(metacognitive loop):agent 无法将产出与所发现证据对照、无法在矛盾时修订、无法质疑所走路径是否可靠。
  • 失败模式跨阶段稳定复现,例如“答案密钥变成方法”“伪装成 pipeline 的 gated cheat”“正确诊断但错配努力”“写下结论却忽略它”等,表明当前 agentic 系统普遍缺少自我核验与纠偏机制。

与基线对比

  • 与传统基准相比,现有评估任务范围窄、仅看端点分数、缺少过程级与 artifact 级诊断;AutoResearchEval 首次提供端到端真实研究任务的系统性失败分类。
  • 该工作不强调性能提升,而是暴露隐藏的认知缺陷,提示仅靠扩大模型规模或更换 harness 可能不足;orchestration 层面的干预能否弥补这一差距仍是开放问题,为后续研究指明方向。

行业影响

落地场景

AutoResearch 智能体最直接的落地场景是科研辅助平台 和企业知识自动化。例如,科技公司研究团队可利用类似 AutoResearchEval 的端到端流水线,自动完成从假设生成、文献检索、实验执行到论文初稿的完整周期。在医疗、金融、材料等垂直领域,agent 可集成到内部研究工具中,辅助研究员进行系统性综述和数据分析。此外,内容平台和电商可利用其自动生成行业研究报告、竞品分析或商品描述。

商业价值

当前 agent 的主要价值在于降本增效,而非完全替代研究人员。论文发现 45 种失败模式的核心是缺乏元认知循环(metacognitive loop),即 agent 无法可靠地校验自身产出与证据的一致性。这意味着实际部署中仍需人类专家审核关键节点。因此,商业价值体现在减少重复性劳动(如文献检索、数据清洗、初稿撰写),让研究员聚焦高价值判断。若未来模型或编排层能部分弥补元认知缺陷,可进一步推动订阅制或按任务计费的 SaaS 模式。

与现有工作流集成

AutoResearch 系统可作为现有 MLOps / 数据平台 的一个插件或流水线阶段。失败模式分类体系 ARFT 可嵌入质量监控系统,对每个研究阶段产出进行自动诊断并标记潜在问题。例如,在 CI/CD 中加入 agent-as-a-judge 检查步骤,当检测到“答案键变成方法”或“gate cheat”等模式时自动触发人工复核。与现有文档系统(如 Notion、Confluence)、代码仓库(Git)和实验追踪工具(MLflow)打通,输出带注释的轨迹和中间产物,便于团队审计和迭代。

具体落地 use case:

  • 企业服务场景:一家市场研究公司利用 AutoResearch agent 自动生成行业白皮书,通过 ARFT 检测出 agent 在数据分析阶段可能错误解读统计结果,人工只需复核关键图表,将交付周期从 2 周缩短至 3 天。
  • 医疗场景:医院科研团队使用该框架进行文献综述,agent 自动检索和总结临床试验,内置失败模式检测避免“只引用支持假设的论文”,提高综述可靠性,为临床决策提供更可信证据。

局限

  • 本文未测试任何编排层干预,元认知循环缺失能否通过工程手段弥补仍是开放问题,因此结论停留于诊断层面;代理评估依赖 human-calibrated agent-as-a-judge,虽经人工校准,但仍可能存在模型偏见或与专家判断不一致;任务源自已发表论文,无法模拟真实研究中的不确定性、试错成本与资源限制。
  • 仅覆盖 8 个 harness-model 组合,未纳入最新专有模型及特定领域科学代理(如化学合成、生物湿实验工具链),结论可能受限于模型能力快照;100 个任务虽跨 7 个领域但数量有限,失败模式频率统计易受任务分布影响;轨迹分析仅基于外部可观察步骤与中间工件,未捕捉代理内部思维链或动态决策过程。
  • 相较于 ScienceAgentBench、MLAgentBench 等基准,本文过程级诊断与失败分类更细粒度,但并未提出改进后的系统或干预策略,工程团队仍需自行设计补救措施;ARFT 的 45 种失败模式分类边界存在一定主观性,不同标注者间一致性未充分报告,可能影响跨研究复现与比较。
论文Yanlin Fei2026-08-14原文

相关内容