LLMs 是否准备好进行科学发现?面向 AI 科学家的能力导向基准
现有科学数据分析基准主要评估 LLM 的代码执行或流程完成能力,忽略了科学分析服务于不同科学主张的类型:假设探索、统计推断、机制解释,每种类型有不同的假设和效度标准。 我们提出 SDABench,一个围绕六种能力(描述性、探索性、推断性、预测性、因果性、机制性)重新组织评估的基准,覆盖五个领域(生物学、化学、环境、地理、物理学)。SDABench 包含 527 个真实数据实例(SDA-Real)和 6000 个合成实例(SDA-Synth),每个实例均有单选题和开放题两种格式,通过自动化流水线构建。 评估 15 个代表性 LLM 后发现:模型在描述性分析上表现良好,但在需要假设选择、潜变量过程建模或机制推理的任务上性能急剧下降。SDABench 还提供了一个五阶段错误分析框架,用于定位 LLM 失败环节:更先进的模型能更可靠地识别相关范围和变量,但仍难以选择合适的分析程序、建模变量关系以及得出有效结论。
论文精读
TL;DR SDABench 按科学分析的六种能力(描述、探索、推断、预测、因果、机制)重新设计基准,评估 LLM 在真实科学数据上的表现,揭示模型在假设选择、潜在建模和机制推理等关键环节仍有显著不足。
问题
问题背景
大语言模型(LLM)在科学研究中的应用正从辅助文献检索走向直接参与数据分析,如何系统评估其科学分析能力成为紧迫议题。现有基准多聚焦于代码生成或工作流完成,却忽视了科学分析的本质——服务于不同类型的科学主张(假设探索、统计推断、机制解释等),每种主张依赖不同的分析逻辑和有效性判据。
现有方法局限
当前主流科学分析基准(如 DS-1000、SWE-bench)存在明显简化:
- 将分析任务等价于 代码执行正确性 或 步骤完整性,不区分分析目标;
- 只衡量最终输出是否匹配参考答案,不拆解中间推理过程;
- 缺乏对 假设选择、变量关系建模、因果推断 等高阶认知能力的考察。 结果导致模型在描述性统计上得分尚可,却在需要自主选择统计模型或推导潜在机制的复杂任务上暴露不足,无法支撑真正的科学发现。
为什么这个问题既难又重要
科学分析的难点在于:它不是固定流程的自动化,而是一个 数据与理论交互 的迭代过程——需理解领域背景、识别变量结构、选择合适的分析方法,并严谨地得出结论。这对 LLM 提出三重挑战:
- 隐含假设识别:分析方法依赖严格的分布或模型假设,模型必须从上下文推断而非显式给出;
- 多步逻辑串联:从数据探索到因果解释,每一步的错误会累积放大;
- 结论有效性校验:需要结合领域知识判断统计显著性与实际意义是否一致。 业界对 AI for Science 投入巨大,但若无法精确诊断模型短板,难以为科学家提供可信辅助。因此,能力导向的分层基准是推动该领域工程化的关键。
行业类比
如同自动驾驶评测从仅看碰撞次数演进到分解感知、规划、控制等子能力,科学分析的 AI 评测也亟需从“结果对错”转向“能力剖面”,才能指引模型迭代方向,避免在低阶任务上过拟合而高阶推理始终薄弱。
核心洞察
- 科学数据分析不应按任务表面形式评估,而应按其试图支撑的科学声明类型来解构。SDABench 首次将基准从“能否跑通代码”转向“能否完成符合特定假设与效度标准的描述、推断、因果、机制等六类分析”,这意味着在工程中部署 AI 科学家时,需要先建模下游的科学论证需求,再反向选择模型与校验流程,而非仅追求端到端执行成功率。
- LLM 的短板并非代码生成能力,而是统计方法的选择与前提假设的判别。SDABench 发现模型从描述性分析跳到推断/因果/机制建模时,性能急剧下降,且高级模型即使能正确定位变量,仍难以合理建模关系并得出有效结论。这提示工程优化不应仅关注代码辅助,还需构建“统计知识图谱”或假设检查模块,让模型显式校验前提条件(如分布假设、混杂结构)后再调用方法。
- 五阶段错误分析框架为模型诊断提供了超越整体得分的工程抓手。SDABench 将错误定位到“范围识别—变量选择—分析程序—关系建模—结论推断”五个环节,显示不同模型在不同阶段失能。对于实际管线,这相当于一套分层评测体系,可以指导开发者针对性地增强模型的特定推理环节,例如强化潜变量建模能力或结论可靠性校验,而非盲目增大模型规模。
方法
SDABench 方法论概览
输入与任务定义:科学分析任务被重新定义为六种能力导向的类型:描述性、探索性、推断性、预测性、因果性、机制性 分析。每种能力对应特定的分析目标与有效性标准,覆盖生物学、化学、环境、地理、物理学五个领域。
自动化实例生成流水线:首先从公开科学数据仓库中收集真实数据集,构建 SDA-Real(527个实例)。每个实例包含一个科学问题,以及包含数据描述、所需分析能力的上下文。同时,通过基于模板和程序化合成的方法,生成 SDA-Synth(6000个实例),以扩充评估覆盖范围和难度分布。每个实例均提供多选题和开放式两种格式,以便评估模型的选择和生成能力。
关键模块:能力与领域映射:流水线自动将原始数据集映射到六种能力标签,并确保领域平衡。这一映射基于预定义的分析类型启发式规则,例如:需要假设检验的归为推断性,需要建模潜在变量的归为机制性。
评估与错误分析:使用15个代表性LLM在SDABench上评估,衡量模型在不同能力和领域上的表现。此外,提出一个五阶段错误分析框架:
- 范围识别:能否正确界定问题所属的科学范围?
- 变量选择:能否识别相关的变量?
- 程序选择:能否选择适当的分析步骤?
- 关系建模:能否正确建模变量间关系?
- 结论提取:能否得出有效结论?
该框架定位模型失败的具体阶段,揭示即使先进模型在步骤3-5上仍存在显著差距。
与同类方法的差异点:SDABench 不同于仅关注代码生成或工作流执行的基准,它直接评估科学推理的核心能力,并通过能力导向的分类和细粒度错误分析,首次系统剖析了LLM在科学发现全流程中的不足。
实验
实验设计
SDABench 在生物学、化学、环境、地理、物理五大领域,系统评估 LLM 的六种科学分析能力:描述性、探索性、推断性、预测性、因果性和机制性分析。基准包含 527 个真实数据实例(SDA-Real)和 6000 个合成实例(SDA-Synth),每个实例都提供多项选择和开放式两种作答形式,由自动化流程生成。评估覆盖 15 个代表性模型(如 GPT-4、Claude 等),并引入五阶段错误分析框架,从范围识别、变量选择到结论得出,逐阶段定位失败原因。
关键发现
- 描述性分析上各模型表现良好,但一旦涉及假设选择、潜在过程建模或机制推理,性能急剧下降。
- 即使是最先进的模型,能较可靠地识别分析范围和关键变量,但在选择恰当的分析流程、建模变量关系、从结果中得出有效结论等环节仍然频繁出错。
- 这表明当前 LLM 缺乏对科学方法论深层逻辑的把握,而非仅仅代码执行能力不足。
基线对比解读
与仅关注代码生成或工作流完成度的传统基准(如 DS-1000、ScienceAgentBench)相比,SDABench 将评估重心转向科学断言的认知过程,从而暴露出 LLM 在“科学家式思维”上的短板。这一差异表明,仅提升工具使用或代码能力并不足以支撑 AI 自主科学发现,未来需要有针对性地增强模型对统计假设、变量关系模型和因果推断的理解与运用。
行业影响
落地场景
SDABench 提出的六项能力基准(描述性、探索性、推断性、预测性、因果、机制分析)直接映射到科学数据分析的典型需求,可嵌入以下产品与业务:
- 药理/生物科技 R&D 平台:自动化实验数据解读、假设生成与机制推理,辅助靶点发现与验证。
- 环境监测与气候建模工具:对多源传感器数据进行推断分析与因果归因,生成可解释的预测与风险报告。
- 工业过程控制与异常检测系统:利用预测与因果分析能力提升根因定位,减少停机时间。
- 金融风险分析:基于时序数据的统计推断与机制建模,增强压力测试与情景分析。
商业价值
SDABench 揭示出当前 LLM 在假设选择、潜在过程建模与机制推理上的显著退化,这为科学 AI 产品的差异化提供了明确方向:
- 降本:通过自动化基础描述性分析,减少对初级数据分析师的依赖,尤其在高通量实验数据初步筛选中。
- 增收:将机制推理与因果分析能力封装为高价值 API 或垂直行业解决方案(如药物联用机制推荐),提升客单价。
- 体验提升:为科学家提供“分析助手”时,能明确区分模型擅长的描述性任务与需要人工干预的推理任务,避免错误传播,提升信任。
与现有工作流的接口
SDABench 自身提供的五阶段错误分析框架可直接转化为质量门控组件:
- 集成路径:作为科学数据分析流水线中的校验层,对 LLM 输出的分析方案进行自动分级评估(范围识别 → 变量选择 → 流程适配 → 关系建模 → 结论验证),对低分结果触发人工审核或回退到传统统计工具。
- 工具链兼容:可对接 Jupyter/Colab 生态、MLflow 等实验管理平台,或以轻量 API 形式嵌入现有 ELN(电子实验记录本)系统。
具体落地 Use Case
- 生物技术公司:基于 SDABench 框架构建“Sci-Analyst Copilot”,研究者上传基因表达数据,系统自动完成差异表达描述性统计,并在尝试推断性分析或因果建模时,根据五阶段错误分析实时提示劣质假设,强制跳出推理链,引导研究者手动修正模型假设后继续。
- 工业物联网平台:对传感器时间序列进行异常检测时,利用因果分析模块区分相关与因果,结合基准中的机制推理短板告警,避免误将相关性当作原因触发错误工单,提升预测性维护的准确率。
局限
- 合成数据生成管道虽可扩展,但合成实例可能偏离真实科学数据分布,尤其在噪声结构、缺失机制及复杂变量依赖上,与真实场景存在 gap,导致模型在 SDA-Synth 上的表现不一定能迁移到实际科学分析任务中,影响基准的生态效度和实用性。
- 五阶段错误分析框架基于 LLM 的外在行为(如能力选择、变量识别),缺乏对模型内部表征和推理机制的探查,难以解释模型在机制推理或潜过程建模中失败的根本原因,限制了其对模型架构和训练策略改进的直接指导价值。
- 覆盖领域和科学能力虽经精心设计,但科学发现任务种类繁多,现有五个领域(生物、化学、环境、地理、物理)可能不适用于其他重要领域(如医学、社会科学),且六个能力维度的划分可能忽略一些重要的科学分析类型,泛化性和全面性仍需进一步验证。