跨尺度科学挑战的 AI Agent 基准测试
AI agent 正被越来越多地开发用于加速科学发现,但它们在真实研究环境中的实际能力仍鲜为人知。现有 AI agent 基准测试极少涵盖科研工作所需的复杂性、异构性和扩展推理,而科学任务基准测试往往将研究简化为静态的直接问题,且对交互式评估支持有限。 为填补这一空白,我们引入了 SciAgentArena,一个系统化基准测试,用于评估 AI agent 在跨多个领域真实科研场景中的表现。该基准包含约 200 个任务,具备逐步验证机制,并提供交互式、agent 无关 环境,以评估多种 AI agent。 通过该基准,我们发现当前 agent 在明确指定的数据分析工作流中能有效贡献,尤其是当任务结构和评估标准清晰时。然而,它们的表现在不同科学背景下并不均衡:agent 难以生成真正新颖的见解、维持自主探索,并为开放研究问题制定稳健解决方案。我们进一步总结了 agent 常见的失败模式,并识别了提升其可靠性、自主性和科学推理能力的机遇。 综上,SciAgentArena 为衡量 AI agent 在科学领域的进展以及指导未来 agent 设计提供了实用框架。完整代码、任务和数据集可通过 https://sciagentarena.github.io/ 访问。
论文精读
TL;DR SciAgentArena 构建了首个面向多领域真实科研场景的 AI Agent 交互式基准,系统揭示现有智能体在数据分析上的优势与在开放问题上的自主探索局限。
问题
AI agents 正逐步应用于科学发现,但其在真实科研场景中的有效性与局限性仍缺乏透彻理解。当前,业界急需一个能够系统评估 AI agent 在复杂、多尺度科学挑战中表现的基准。
现有基准的局限
现有工作存在两类明显偏差:
- 通用 agent 基准(如 SWE-bench、AgentBench)聚焦于软件工程或工具使用,极少捕捉科学任务特有的异质性、长时间多步推理以及领域知识的深度整合。评估方式多为端到端成功率,缺乏对中间推理步骤的细粒度验证。
- 科学任务基准(如 ChemCrow、BiologyQA)则常将研究简化为静态、直接的问题(如分类或固定答案 QA),不支持交互式探索、工具调用或逐步假设迭代,无法衡量 agent 的自主性。
这导致当前基准无法回答一个核心问题:AI agent 在真正开放式的科学问题中,能否像人类科学家那样形成新见解、自我驱动探索并交付鲁棒方案?
技术挑战与重要性
科学发现本质上是 开放式过程:需要从多模态数据中识别模式、提出可验证假设、设计实验、解释矛盾结果,并循环迭代。这种工作流要求 agent 具备:
- 新洞察生成能力:不仅是模式识别,更需推断因果或机制。
- 持续性自主探索:在没有明确指令时,能自主规划下一步。
- 跨领域迁移与组合:如融合组学、电子病历与遗传数据。
业界对 AI4Science 的投入日益增加,但缺乏一个公认可信的评估框架来衡量 agent 在这些维度上的进展。SciAgentArena 正是为了填补这一空白,通过约 200 个交互式任务和逐步验证,全面刻画 agent 的长短板。
行业类比
这与 自动驾驶领域的开放道路测试 相似:封闭场地基准无法覆盖长尾场景,而真实、交互且多元的测试环境才是评估系统鲁棒性与自主决策能力的关键。
核心洞察
- SciAgentArena 构建了首个面向真实科研场景的交互式智能体基准,而非常规的静态数据集测试。现有科学基准多将研究简化为直接、静态的问题,缺乏对工具调用、多步推理和逐步验证的支持,难以反映智能体在动态、开放的科学探索中的真实能力。该基准通过约 200 个任务和与智能体无关的交互环境,首次系统性地模拟了从数据获取到假设生成的完整科研流程,使评估更贴近实际科学发现。
- 对多个当前智能体的评测揭示:它们在结构清晰的数据分析流程中表现有效,但在产生新颖洞见、维持自主探索和构建鲁棒的开放式解决方案上明显不足。这一发现不是简单的性能评分,而是指出了智能体在科学推理中“工程执行”与“真正创新”之间的鸿沟。与多数仅关注最终准确率的基准不同,SciAgentArena 通过逐步验证和错误分析,定位了智能体在不同科学场景下的具体失效模式,为提升智能体的可靠性、自主性和科学推理能力提供了可操作的改进方向。
方法
SciAgentArena 围绕 输入 → 关键模块 → 输出 构建评估流程,具体设计如下:
输入
智能体接收自然语言描述的科学任务,例如“分析单细胞数据识别差异表达基因”或“基于电子健康记录预测患者再入院风险”。任务附带必要的数据集访问权限或工具调用接口,智能体需自行决定如何探索、分析和交付结果。
关键模块
多领域任务集合:从计算药物发现、单细胞组学、空间组学、电子健康记录、遗传学及跨领域场景中抽取约 200 个任务,每个任务被分解为多个步骤,每步设有可验证的中间里程碑(如生成中间结果文件、输出特定统计量)。任务类型覆盖明确流程化分析(well-specified workflows)和开放式探索(open-ended research),以考察不同维度的能力。
互动式智能体无关环境:提供一个统一的环境接口,屏蔽领域工具差异。环境支持:
- 工具调用:智能体可通过标准化的 API 访问 Python 解释器、领域特定软件(如 RDKit、Scanpy)及数据查询引擎。
- 逐步验证:环境在每一步后自动比对智能体的输出与预定义的正确解,立刻返回通过/失败信号,避免错误累积。
- 状态记忆:环境维持会话历史,允许智能体修正先前错误或调整策略。
评估协议:主要指标为任务完成率,并细分为严格匹配完成和有效贡献(部分完成);此外,通过人工审查和自动规则诊断常见失败模式(如幻觉引用、循环无效操作、缺乏自我修正)。
输出
评估框架为每个智能体生成:
- 各领域任务的量化得分(成功率、平均步骤完成比)
- 定性错误分析报告(例如“在开放式实验中难以自主生成新假设”或“过于依赖显式指令缺乏探索主动性”)
与同类方法的差异
相比将科学问题简化为单轮 QA 或有限步骤的静态基准(如 SciBench、MLAgentBench),SciAgentArena 强调真实科研工作流的复杂性、多步交互验证与智能体无关性,更贴近科学家实际使用 AI 助手时的探索与迭代过程。
实验
实验设计
SciAgentArena 构建了一个包含约 200 项任务的基准,覆盖 计算药物发现、单细胞组学、空间组学、电子健康记录、遗传学以及跨领域组合任务。每个任务均配备 逐步验证(stepwise verification)与 交互式评估环境,且不绑定特定 agent 框架,可评测多种基于 LLM 的工具调用型 agent。
关键发现
- 当前 agent 在 任务结构清晰、评价标准明确 的数据分析工作流中表现有效,能辅助完成规范化数据处理。
- 但在 生成真正新颖的科学洞察、持续自主探索 及 为开放式问题提出稳健方案 等方面存在显著短板,性能随领域和开放度剧烈波动。
- 常见失败模式包括:错误累积、缺乏全局规划、工具调用失当、无法从环境反馈中自我纠正,暴露出 agent 科学推理深度不足。
与基线对比的深入解读
传统科学任务基准(如 MLAgentBench、SWE-bench 的科学变体)往往将研究简化成静态、单步问题,缺乏对复杂流程和交互式探索的支持。SciAgentArena 通过真实科研场景的多步长程任务,揭示了 LLM 驱动 agent 在自主性、元认知和领域知识融合上的深层缺陷,这些在旧基准中几乎不可见。对比结果说明:仅靠模型规模或提示工程难以突破科学发现所需的高阶推理,必须从 记忆持久化、分层规划、不确定性感知评估 等机制入手,驱动 agent 像科学家一样迭代实验、质疑假设。该基准为未来科学 agent 的可靠性与自主性设计提供了系统化测量工具。
行业影响
落地场景
SciAgentArena 的评测表明,当前 AI 代理在结构化数据分析任务(如虚拟筛选、单细胞组学流程)中表现可靠,但在开放探索中易失败。因此,工业界可将其优先部署于流程明确、评估标准清晰的科研辅助场景:
- 制药与生物技术公司:AI 代理嵌入虚拟筛选pipeline,自动执行分子对接、ADMET预测、结果汇总,辅助计算化学家快速迭代先导化合物。
- 医疗数据分析平台:面向医院的电子健康记录(EHR)队列研究,代理自动完成数据清洗、协变量平衡、初步统计检验与可视化,缩短从数据到初版分析报告的时间。
商业价值
- 降本:自动化重复性分析任务,减少资深科研人员在数据处理上的时间投入(通常占项目总时长的 30-50%),释放人力聚焦于假设生成与结论解读。
- 增收:加速药物发现早期阶段的筛选周期,提升hit-to-lead的成功率,间接降低每个候选药物的平均研发成本;在科研服务SaaS中作为增值功能提供,提升产品单价。
- 体验提升:通过自然语言交互降低非编程背景科学家的使用门槛,使领域专家直接驾驭复杂分析,无需依赖专业的生物信息学支持。
与现有产品/工作流的接口
AI 代理可作为薄交互层集成到现有科学计算基础设施中:
- 工作流调度器:通过 API 挂接到 Galaxy、Nextflow、Snakemake 平台,接收自然语言指令,转换为工作流参数并监控执行。
- 分析工具链:直接调用 RDKit、Scanpy、PyTorch 等库,代理规划子任务序列并拼接结果,类似一个“科学copilot” IDE 插件,兼容 JupyterLab 或 VSCode。
- 可靠性验证:引入 SciAgentArena 基准作为回归测试套件,在更新代理能力或LLM版本时自动评估,确保核心科学任务不退化,形成 CI/CD 中的科学能力关卡。
具体用例
- 跨国 CRO(合同研究组织):为药企客户提供 AI 代理驱动的自动化生物信息学报告服务。客户上传单细胞测序数据,代理自动运行质控、聚类、差异表达分析,输出交互式报告初稿,生信科学家仅需复核与精修,将报告交付时间从两周缩短至两天。
- 企业级 AI 平台:云计算厂商(如 AWS SageMaker、Azure ML)集成科学场景专用代理模板,内置领域知识库与工具链,帮助生命科学团队快速构建可复现的研究分析器,并以 SciAgentArena 同类基准作为服务等级协议(SLA)的性能标尺。
局限
- **任务简化与真实科学差距**:SciAgentArena 虽然旨在模拟真实科研场景,但其任务本质上仍多为步骤明确、结果可验证的数据分析流水线(例如处理组学数据、电子健康记录),较少涉及需要持续试错、实验设计修改或湿实验结果反馈的开放式探索。论文本身指出代理“难以生成真正新颖的洞察、维持自主探索”,但基准中的任务实际上默认了从数据到结论的固定路径,难以衡量代理在科学假设生成与迭代验证中的创造力。静态数据集也无法反映科研中数据的动态演变,限制了评测对“走向科学发现”的有效度量。
- **评估指标的片面性**:基准采用 stepwise verification 作为主要评估方式,侧重代理是否完成预定义子步骤(如调用正确工具、输出合理中间结果),但对科学推理深度、假设原创性、解释合理性等缺乏系统度量。尤其在开放式问题中,成功与否常需专家判断,自动化评估可能过度简化科研产出的质量维度,导致更倾向于奖励遵循预设指南的代理,而非真正具备创造性问题解决能力的代理,从而削弱对“科学推理”能力的真实评价。
- **代理类型与环境的局限性**:评测集中于基于 LLM 的代理,未深入探讨不同架构(如强化学习代理、神经符号代理)的差异,也未充分对比纯 LLM 基线(无工具)。交互式环境虽然 agent-agnostic,但工具集(代码执行、数据查询)相对固定,可能限制需要定制化编程或外部资源检索的代理发挥。此外,任务主要覆盖计算生物学和医学领域,对物理、化学等科学的推广性待验证,通用性较弱,作为通用科学代理评测平台的代表性仍需增强。