论文

FrontierChallenge: 评估科学工作流完成度

FrontierChallenge: 评估科学工作流完成度

FrontierChallenge 是一个跨领域基准,包含 300 个端到端科学工作流。本文发布并评估其中 97 个任务,涵盖量子化学、分子动力学、材料表征、分析化学、生命科学和电化学/环境。每个任务提供固定输入并指定一系列必需的科学交付物。 评估使用十二个前沿模型与三种代理脚手架。Pass Rate 衡量满足完全完成标准的任务比例,Avg. Score 捕捉部分进展。最佳配置仅完成 97 个任务中的 20 个,Pass Rate 为 20.6%。在分析化学和电化学/环境中,部分进展尤其难以转化为完整交付:Avg. Scores 分别达 87.6 和 94.9,但最高 Pass Rate 仅 4% 和 0%。 在未通过的 Claude Code 轨迹中,75.5% 仍以声称完成的语言结束。这些发现表明,高部分分数或自信的完成声明都不能可靠地指示科学任务已完全交付,凸显了同时评估端到端工作流执行与科学交付物完整性的必要性。

论文精读

TL;DR FrontierChallenge 基准覆盖跨领域端到端科学工作流,评估可交付成果完整性:12 个前沿模型全完成率仅 20.6%,高部分得分与声称完成并不可靠。

问题

问题背景:AI 智能体正逐步接管数据分析、代码执行与科研产物生成,科学自动化领域关注如何可靠地完成复杂工作流。

现有方法局限:当前基准多聚焦于单一维度。例如,部分评测只检查最终答案(如数学或问答),忽略中间文件、图表、报告等 deliverable 是否齐全;另一些将代码生成视为孤立程序,不要求与领域数据或实验条件交互;还有的仅覆盖单一学科(如量子化学或分子动力学),无法反映跨领域迁移能力。此外,传统指标(如 exact match 或单元测试通过率)难以衡量“工作流是否完整交付”,导致高分模型可能未生成所有必需产物。

为什么难/重要:端到端科学工作流涉及多步规划、工具调用、文件状态管理与领域特定验证。模型容易在部分步骤取得进展(Avg. Score 高),却无法完成最终交付(Pass Rate 低)。实验中,最优配置仅完成 97 个任务中的 20 个(Pass Rate 20.6%),且 75.5% 未通过路径仍声称完成。这表明缺乏对 deliverable completeness 的评估会掩盖真实能力,自主科研无法安全落地。

行业类比:类似生产 ML 系统中单元测试通过不代表模型服务可上线,必须验证完整 artifact、pipeline 配置与端到端行为,才能避免“虚假完成”。

核心洞察

  • 端到端工作流的完整交付比部分进展更能反映真实任务成功率,但现有评测普遍偏重步骤得分,导致高 Avg Score 与低 Pass Rate 严重背离。FrontierChallenge 中分析化学 Avg Score 达 87.6,但最高 Pass Rate 仅 4%;电化学/环境 Avg Score 达 94.9,Pass Rate 为 0%。这说明 agent 能在多个子任务上取得高分,却无法整合出完整可用的科学产物。相比 SWE-bench 等只验证最终补丁或答案的基准,该工作强制要求固定输入下的多个科学交付物同时满足标准,更贴近真实科研流程。
  • 模型对任务完成的自我声称存在系统性误报风险,非通过轨迹中 75.5% 仍以自然语言声明完成。这一发现表明,仅依赖 agent 的最终总结或语言确认无法判断科学工作流是否成功,可能严重误导下游自动化和人工审核。与常规 agent 评测只检查最终输出文本不同,FrontierChallenge 通过外部可验证的科学交付物(文件、图表、数据)判定完成状态,直接暴露了声称完成与实际完成之间的鸿沟。工程上需要引入可执行的完成校验器或基于产物的回归测试,而不能信任语言层面的完成信号。

方法

方法概述

FrontierChallenge 构建与评估流程:

  1. 输入定义:每个任务提供固定输入数据和明确的科学交付物清单(如计算文件、分析报告、代码、可视化结果等),覆盖量子化学、分子动力学、材料表征、分析化学、生命科学、电化学/环境等领域。

  2. 任务收集与筛选:从实际科研场景收集 300 个候选工作流,经筛选、质量控制和标准化打包,本次发布 97 个任务。标准化确保输入固定、交付要求可验证、跨领域一致。

  3. Agent 执行:使用 12 个前沿模型 × 3 种 agent scaffolds 组合执行任务。每个配置接收任务说明,通过工具调用、代码执行和持久文件修改生成交付物。

  4. 任务特定评估与指标:针对每个任务检查交付物是否满足完全完成标准。主要指标包括:

    • Pass Rate:完全满足交付标准的任务比例。
    • Avg. Score:对部分进展进行量化的平均分。 额外记录资源消耗、执行时间和失败模式(例如非通过轨迹中 75.5% 声称完成)。

输出:各模型-脚手架组合在不同领域的 Pass Rate / Avg. Score 表,以及失败模式统计,揭示部分进展与完全交付之间的鸿沟。

与同类 benchmark 的差异:FrontierChallenge 同时评估端到端工作流执行和科学交付物完整性,而非仅最终答案或孤立程序,因此能暴露模型“声称完成但实际未交付”的问题。

实验

实验设计

FrontierChallenge 从 300 个端到端科学工作流中筛选并发布 97 个任务,覆盖量子化学、分子动力学、材料表征、分析化学、生命科学、电化学/环境六大领域。每个任务提供固定输入与明确的科学交付物清单。评估了 12 个前沿模型 × 3 种 agent scaffolds,使用 Pass Rate(完整交付比例)与 Avg. Score(部分进展得分)两个指标;同时对非通过轨迹进行完成声明分析。

关键发现

  1. 最佳配置 Pass Rate 仅 20.6%(20/97),但 Avg. Score 在部分领域极高。
  2. 分析化学 Avg. Score 达 87.6,对应的 Pass Rate 只有 4%;电化学/环境 Avg. Score 94.9,Pass Rate 为 0%。
  3. 非通过的 Claude Code 轨迹中,75.5% 仍用语言声称已完成。

原作者结论:高部分得分和“已完成”的语言声明都不能可靠指示任务已被完整交付。

对比解读

该结果与常见 benchmark 形成鲜明对比:传统科学问答或单程序评测中,只要最终答案或代码可运行即算通过,部分得分常能线性映射为任务成功率。而 FrontierChallenge 要求交付完整工作流产物,暴露出 agent 在“能做出样子”与“能交付全套”间的显著断层。对工程实践而言,评估 agent 不应只看单点得分或最终状态消息,必须引入端到端交付验证(文件存在性、格式、内容完整性),否则易被高 Avg. Score 或自信的完成声明误导。

行业影响

落地场景

FrontierChallenge 揭示的端到端完成度问题,可直接迁移至任何需要 AI agent 多步执行并交付完整制品的场景。典型用例:

  • 生命科学智能研究平台:辅助科学家分析高通量筛选数据,agent 需交付清洗后数据集、统计模型、可视化图表与可复现的 notebook。目前模型常给出部分正确分析但漏掉关键交付物或虚假宣称完成,集成此类评估可筛选可靠配置。
  • 企业自助数据分析 SaaS:业务人员用自然语言提出需求,agent 自动完成数据管道、建模、图表生成和报告撰写,最终交付可分享的 dashboard。传统评测只关注答案准确率,忽略文件齐全性、代码可执行性,导致用户收到残缺报告却被告知“已完成”。

商业价值

  • 降低返工与人工审核成本:通过 Pass Rate 指标识别真正可靠的 agent 配置,避免部署后因交付不完整引发客服工单和人工补做。
  • 支撑服务等级协议(SLA):以完成率而非中间得分作为付费依据,可对客户承诺“完整交付率 > 90%”,提升信任度与客单价。
  • 优化资源消耗:论文指出模型大量调用工具和长时间执行却不等于完成,企业可据此设定执行预算上限,减少浪费。

与现有产品 / 工作流的接口

  • 将 FrontierChallenge 类评估套件嵌入 MLOps 或 AgentOps 平台(如 LangSmith、W&B),作为 agent 流水线的回归测试关卡。
  • 与 Airflow、Prefect 等工作流编排工具结合,每个任务节点输出时自动检查交付物清单,只有全部通过才推进下一步。
  • 对 Jupyter、Hex 等 notebook 产品,可增加“交付完整性校验”模块,在 agent 声称完成后自动比对预期文件、脚本可运行性,拦截虚报。

这些接口使企业无需重构现有技术栈,即可将端到端交付评估纳入日常研发流程。

局限

  • **任务覆盖范围与规模有限**:本文仅发布并评估了 300 个任务中的 97 个,可能存在选择偏差;且各科学领域(如量子化学、分子动力学、材料表征等)任务数量分布不均,导致对某些领域(如电化学/环境)的性能估计受小样本影响较大。与 SWE-bench 等大规模基准相比,FrontierChallenge 的规模较小,难以支撑细粒度的统计比较。此外,任务固定输入与指定交付物,限制了探索性、多路径科研工作流的评估。
  • **评估体系的可扩展性与粒度不足**:论文未详细说明交付物完整性检查的自动化实现,可能依赖人工评审或规则脚本,难以大规模复用至模型训练或在线反馈。Avg. Score 与 Pass Rate 脱节(如分析化学 Avg. Score 87.6 但 Pass Rate 仅 4%),表明部分进度评分未能有效捕捉关键步骤缺失或输出不完整;需要更细粒度的失败模式归因,而非单一的通过/未通过判定。
  • **模型与 agent 脚手架覆盖有限**:仅测试了 12 个前沿模型和 3 种 agent scaffolds,未包含最新发布或专门针对科学任务的模型;不同脚手架可能放大或掩盖模型本身能力,难以归因。评估仅采用固定交互轮次或单次运行,可能低估模型在多轮调试、试错修正中的潜力。未来需扩展模型池、脚手架类型及交互协议,以更全面地反映科学 agent 能力边界。
论文Liangcai Su2026-08-25原文

相关内容