论文

NatureBench: 编程智能体能否匹配Nature系列论文已发表的SOTA?

NatureBench: 编程智能体能否匹配Nature系列论文已发表的SOTA?

为解决当前AI智能体在科研基准测试中环境碎片化、可信度有限的问题,本文提出NatureBench——一个从Nature系列同行评审论文中蒸馏出的90项跨学科任务基准,旨在评估AI编程智能体是否能够超越复现、实现真正的科学发现。 NatureBench构建于NatureGym自动化流水线之上,该流水线从源论文中提取任务并自动构建标准化、容器化运行环境,从而消除了环境碎片化问题。在严格禁用网络搜索的协议下,我们对10种前沿智能体配置进行了评估,结果显示:最强模型仅在g0.1准则下于17.8%的任务上超越了已发表SOTA。对方法路径的分析表明,智能体的成功主要依赖于方法翻译——将科学任务转化为熟悉的监督预测问题,而非真正的科学发明。失败案例中,方法选择错误和计算预算不足是主要原因,而非任务理解偏差。 我们已发布基准、NatureGym流水线以及一个可维护端复现的公开排行榜,代码见 https://github.com/FrontisAI/NatureBench 。

论文精读

TL;DR NatureBench 从 Nature 系列论文中提炼出 90 个跨学科科学任务,严格评测发现最先进的 AI 编程智能体仅能在 17.8% 的任务上超越现有最佳水平,且成功主要依赖方法论转化而非真正的科学创新,揭示了当前 AI 在自主科学发现上的局限性。

问题

问题背景

AI 编码智能体正从复现已知实现迈向 自主科研,业界迫切需要可靠的基准来检验它们能否进行 真正的科学发现,而不仅仅是模式套用。

现有方法局限

现有的 论文基准(如 Starace et al. 2025 / Siegel et al. 2024)存在三类关键缺陷:

  • 环境碎片化:每个任务须手动搭建依赖环境,导致不可复现和隐性偏差,无法公平对比智能体能力;
  • 搜索依赖与数据泄漏:开放网络搜索引入先验知识,使评估偏向信息检索而非科研创新,且易产生基准污染;
  • 目标单一化:多数基准聚焦 再现已发表结果,而非衡量智能体在 未知问题 上探索新方法、突破原有 SOTA 的潜力,无法反映真实科研中的 发现维度

为什么这个问题难/重要

  • 技术挑战:构建一个既能隔离干扰(禁用网络搜索)、又能覆盖跨学科 异构任务(图论、物理建模、基因组学等)且保证 环境完全可复现 的基准,本身就需要自动化流水线(如 NatureGym)和严格审核流程。
  • 评估深度:仅看最终得分不足;须分析智能体的 方法路径,辨别是 方法论翻译(将任务转化为熟悉的监督学习问题)还是 真正的科研创造
  • 业界关注度:随着 GPT-5 / Claude 等前沿模型进入科研助手甚至自主研究者角色,能否客观评估它们的 发现能力 直接关系到 AI for Science 投入的 ROI 和未来研究范式的可信度。

行业类比

这一挑战类似 自动驾驶 在封闭测试场的考核:没有真实道路的无限变量,却需通过精心设计的标准化场景,严格检验系统应对 未知障碍 的规划与适应能力,而非依赖高精地图的 记忆复现

核心洞察

  • 当前 AI 编码代理在科学任务上的成功主要来自**方法翻译**(methodological translation)而非真正的科学发明:代理倾向于将新颖的科学问题重新表述为熟悉的监督预测范式,借此匹配甚至超越已发表的 SOTA,但并未产生新的方法或见解。这与先前宣称 AI 能独立发现的基准形成对比——NatureBench 通过分离任务理解与方法选择,量化了这种“照搬老路子”的局限性,揭示现有系统在方法论多样性上的根本不足。
  • 失败根源不是任务误解,而是**错误的方法选择**与**计算预算不足**:在无网络搜索的严格协议下,代理即使正确理解任务也常因未能选中合适算法或分配不够的算力而失效。这突破了以往将 AI 科学能力不足归咎于理解误差的假设,指向一个更工程化的瓶颈:代理缺乏高效元学习或自动方法论探索机制,而此类缺陷在跨学科、异质任务中尤为致命。

方法

NatureBench 的构建与评估围绕 NatureGym 自动化流水线展开,将 Nature 系列期刊论文 转化为可复现、可评测的标准化任务。输入为经过三层过滤的论文原文;流水线依次执行:

  1. 数据集获取与验证——从论文中定位数据源,通过文件级防火墙隔离原始文件与代理访问,确保数据完整性,防止污染训练集。
  2. 任务包构建——将数据集、任务说明文档、自动评估器及依赖环境打包为容器化执行环境,每个任务独立封装,消除环境碎片化。评估器基于指标计算与参考实现对比的 SOTA 归一化相对差距 (g 指标),自动判定性能。
  3. 质量校准——经首轮诊断修复、复现模式审计,确保基准任务可复现且评分可靠。

最终生成 NatureBench,包含 90 个跨学科任务,覆盖异构评估设计。评测协议中,代理必须禁用网络搜索,在统一计算预算内独立解决任务;成功与否按 g > 0.1 判定,输出整体成功率及分域表现。

与同类工作的核心差异:NatureBench 不依赖众包或合成任务,而是直接从同行评审论文蒸馏出真实科学问题,并通过 NatureGym 实现全自动环境固化,将评测重心从“复现代码”转向“超越发表 SOTA 的科学发现能力”。同时,严格的隔离机制和无搜索协议迫使代理依赖方法论创新而非数据泄露。

实验

实验设计

在 NatureBench 的 90 个跨学科任务 上评估 10 种前沿 AI 编码代理配置,严格遵循 禁用网络搜索 的协议,并使用 NatureGym 管道为每个任务构建标准化、容器化的执行环境,消除以往研究中环境碎片化对可信度的影响。代理需直接复现或超越已发表论文的 SOTA 结果,最终以相对差距(g>0.1 表示实质性超越)衡量成功。

关键发现

最强模型仅在 17.8% 的任务上超越了已发布的 SOTA。成功案例中,代理的前进路径高度依赖 方法论翻译——将开放的科学问题转化为其熟悉的监督预测框架(如分类或回归),而非通过真正的科学发明。失败原因主要集中在 错误的方法选择不足的计算预算,任务误解本身并不占主导。分数分布呈现长尾,大量任务上代理仅能获得较低甚至负的相对提升。

深度解读

这一结果揭示了当前 AI 代理从“复现”到“发现”的巨大鸿沟。虽然它们能熟练调用现有模型库、执行调参,但缺乏 自主提出新架构或理论假设 的能力;其所谓“成功”更接近于将新数据适配到已知的算法范式。此外,算力约束作为关键失败因素,提示实际部署中 自动资源分配与早停策略 的设计至关重要。与以往仅关注代码生成正确率的基准不同,NatureBench 将环境搭建、数据获取和真实科研评估融为一体,为衡量 AI 在科学研究中的真实贡献度提供了更严格的标尺。对于工程实践而言,若希望将代理应用于开放问题,必须为其配备 方法筛选机制与弹性算力调度,否则以当前状态难以可靠产生突破性成果。

行业影响

落地场景

NatureBench 所代表的标准化科研任务基准与 NatureGym 自动化环境构建管线,可直接赋能三类产品/业务:

  • AI 辅助科研平台:面向药企、材料公司的内部研发工具,自动复现《Nature》论文中的实验流程并尝试超越已有 SOTA,减少科学家重复劳动。
  • AI 编程智能体的科研扩展:在 GitHub Copilot、Cursor 等编码助手之上封装科研领域的专用 skill,使其能处理跨学科的科学计算任务。
  • 自动化机器学习平台:作为 MLOps 中的“高级挑战层”,对自研 AutoML 系统进行极限压力测试,评估其方法论迁移能力而非单纯调参能力。

商业价值

核心价值在于降本加速发现

  • 降本:当前科学研究中,论文方法复现与基准测试耗费大量人力。NatureGym 容器化环境将一次完整的“阅读-复现-验证”流程压缩为自动化任务,预计能减少 60% 以上的人工操作。
  • 增收/新增长点:对药企而言,快速验证并改进文献中的分子生成或性质预测方法,可缩短候选分子发现周期,加快专利布局。
  • 体验提升:为科学家提供“一键验证”体验,降低跨学科合作的门槛,让生物学家也能轻松测试物理/化学期刊中的最新模型。

与现有产品/工作流的接口

NatureGym 镜像可直接嵌入容器化 CI/CD 管道

  1. 将 NatureBench 任务包注册为 Airflow/Prefect 的 DAG 节点,在指定 GPU 集群上按需执行。
  2. 通过 Kubernetes 控制器管理多任务并行,利用 NatureGym 的防火墙设计保证数据集不泄露。
  3. 与 MLflow 或 Weights & Biases 对接,记录每次运行的指标与模型产物,便于审计和二次开发。 对于代码助手类产品,可通过 MCP(Model Context Protocol)将 NatureGym 包装为工具函数,让智能体在会话中直接调用实验环境。

具体落地 use case

  • 药物发现 CRO 企业:客户提交一篇 Nature Chemical Biology 论文,系统自动构建环境、运行基线,并尝试用内部化合物库微调模型,输出改进后的分子生成方案,直接生成可申请专利的候选化合物。
  • 金融科技公司:将 Nature Communications 中的时间序列预测论文转化为可执行任务,自动对比经典量化策略与新方法在多个市场数据集上的表现,筛选出具有实盘潜力因子,缩短策略研发周期。

局限

  • **任务范围偏向 Nature 家族论文**:NatureBench 仅从 Nature 及其子刊选取 90 个任务,覆盖学科虽广但均属高影响力期刊,可能过滤掉许多真实科研中常见的低资源、噪声大或非标准化问题。这种采样偏差可能导致基准无法充分评估 agent 在“非明星论文”类任务上的泛化能力,也忽略了科研场景中大量存在的探索性、开放式研究形态。
  • **严格的无搜索协议与实际部署脱节**:评估强制关闭网络搜索,虽然避免了信息泄漏和作弊,但现代 AI agent 在真实科研中常依赖检索文献、代码、数据等外部知识。该设定可能低估 agent 通过信息检索提升方案质量的能力,同时也使得结论难以直接映射到科研助手的实际使用价值。此外,24 小时计算预算限制也可能过度约束了需要长时间探索或超参调优的方法,影响对更强 agent 潜力的判断。
  • **方法论翻译的发现未与 baseline 深度对比**:分析揭示 agent 成功主要源自任务转换(将科学问题映射为监督学习),失败多因选错方法或算力不足,但未与同样将问题建模为监督学习的非 agent baseline(如 AutoML 工具、标准调参流程)进行对比。这让人难以判断 agent 的推理与决策是否带来了超越自动化工具的增益,也无法量化“agent 框架”相对于传统自动化在科学任务上的独特价值。
论文Yuru Wang2026-06-23原文

相关内容