论文

ScientistOne: 迈向通过证据链实现人类级自主研究

ScientistOne: 迈向通过证据链实现人类级自主研究

自主研究智能体能产生有竞争力的解决方案和专业手稿,但其输出存在表面评估无法察觉的可验证性失败:捏造引用、不可复现的分数、方法描述与实现脱节。我们通过三项贡献解决这一问题:第一,证据链 (CoE) ,一个要求每个声明都可追溯到证据来源的可验证性框架;第二,ScientistOne ,一个端到端自主研究系统,在文献综述、方案发现和论文撰写过程中通过构造维护证据链;第三,CoE 审计 ,一种事后审计,其四项完整性检查——分数验证、规范违规、引用验证和方法代码对齐——统一适用于所有系统。 在涵盖五个系统和五项前沿研究任务的 75 篇论文中,每个基线都存在至少一种系统性失败模式:幻觉引用率高达 21%,分数验证通过率低至 42%,方法代码对齐范围在 20% 到 80% 之间。ScientistOne 实现了零幻觉引用 (0/337)、完美分数验证 (12/12) 以及最高方法代码对齐 (14/15),同时在所有五项任务上达到或超越人类专家表现。 ScientistOne 还泛化到涵盖医学影像、细粒度识别、3D 感知和语言建模的六个额外任务,在 Parameter Golf 上达到最优,并在基线完全失败的 MLE-Bench 任务上获得金牌。

论文精读

TL;DR ScientistOne 通过 Chain-of-Evidence 框架,让自主研究每一步声明都可追溯到证据源,实现零虚构引用、完美分数复现与方法代码高度对齐,首次在多项任务上匹配甚至超越人类专家水平。

问题

问题背景

自主研究代理(如 AI Scientist)已能自动完成从文献调研、方案发现到论文撰写的完整科研流程,产出的论文在表面质量上接近人类水准。然而,这类系统暴露出严重的可验证性缺陷:虚构参考文献、不可复现的指标分数、方法描述与代码实现严重不符等问题,这些失败无法通过常规的论文初筛或自动评审发现,严重威胁到科研产出的可信度。

现有方法的局限

当前主流思路是将研究代理视为一个黑箱优化器,仅依据最终结果(如任务得分、审稿评分)来评价其好坏。这种结果导向的评估存在两个根本性局限:

  • 无法检测伪造的证据链:代理可能编造看似合理的引用(本文发现的幻觉引用率高达 21%),或在实验部分报告未实际运行的分数(仅 42% 的论文通过得分验证),评审者若不逐项核对原始代码与日志便无从发现。
  • 主张与实现脱节:论文中描述的方法常常与代码实现不一致(方法-代码对齐度仅为 20%~80%),导致“论文可读,但代码跑不通或结果无法复现”的尴尬局面。现有系统缺乏内建机制来确保每一条科学主张都有对应的可追溯证据,事后审计成本极高且不全面。

为何该问题既困难又重要

科学研究是一个多阶段、多模态证据流(文献、实验日志、代码、指标)的复杂过程,要保证端到端可验证性,意味着系统必须在文献调研、方案实现、论文写作等所有环节都维护一条不可篡改的证据链。这要求在智能体架构层面引入运行时证据追踪与验证,而非事后补丁。技术上挑战巨大:需要准确识别每个主张的证据源头,自动比对代码与文本语义,以及在多次迭代中保持一致性。业界对可复现性的关注持续升温(如 NeurIPS 等会议强制要求代码提交),自主研究代理若不能解决可验证性问题,将迅速丧失学术社区信任,阻碍这一方向的规模化应用。

行业类比

如同自动驾驶不仅需要安全行驶,还需要明确的感知-规划决策链以供事故回溯,自主研究代理同样需要从 claim 到 evidence 的完整追溯链,以确保每一条科学结论都能被严格审查与复现。

核心洞察

  • Chain-of-Evidence 将可验证性作为研究智能体的第一性原理,而非事后补救。现有自主研究系统多关注最终方案性能或论文表面质量,但虚构引用、不可复现分数等问题深藏于流程中,仅靠生成后过滤或提示词约束无法根除。CoE 要求每个声明都必须指向可追溯的证据源(引文、代码、实验日志等),ScientistOne 从文献综述到论文写作各阶段都构造性维护这一链条,使得输出天然具备可审计性。这与依赖模型自我检错或抽样验证的并行工作形成本质差异:前者是架构级保障,后者是统计性修补。
  • CoE 审计通过四项标准化检查(分数验证、规范违反、参考文献验证、方法-代码对齐)揭示了自主研究系统的系统性故障模式,并提供了跨系统可比的完整性基准。在此之前,尽管多个系统宣称接近或达到人类水平,但缺乏衡量其科学严谨性的统一标尺。该审计发现所有基线(如 Sakana、AIR、LLM-SQL 等)均存在至少一类系统性失败——最高 21% 的参考文献为虚构、仅 42% 的论文通过分数复现、方法-代码对齐率低至 20%。这种审计不仅是一次性评测,更可作为后续系统设计与迭代的约束条件,推动领域从‘好看’走向‘可靠’。

方法

整体流程

ScientistOne 以研究任务描述为输入,通过三个阶段顺序生成可验证的研究论文与代码,每个阶段内建证据链维护机制。

关键模块

  1. 文献基础 (Literature Grounding)
    采用多轮调查构建引用图:从 arXiv 检索相关论文,经文献过滤筛选高相关性条目,通过评估协议审计与定向补充,最终合成实验简报。所有外部引用记录来源,作为证据链起点。

  2. 解法发现 (Discovery)
    基于文献基础,使用可扩展求解器(如进化搜索、超参优化)执行自动化实验。搜索按预算分层,每次尝试记录配置与结果,确保评分可复现。输出实验日志与最优配置,并标记是否违反任务规范(如数据泄露)。

  3. 论文撰写与验证 (Paper Writing & Verification)

    • 构思 (Conceive):根据实验简报生成论文大纲;
    • 扎根 (Ground):将每个声明映射到证据源(代码、日志、文献);
    • 批判 (Critic):内部审查方法-代码对齐、引用正确性;
    • 解决 (Resolve):针对问题修正撰写;
    • 撰写 (Compose):生成 LaTeX 文档。
      声明验证器 (Claim Verifier) 实施运行时检查,确保声明与代码输出一致,引用无虚构。论文编译为可提交的 PDF。
  4. CoE 完整性审计 (CoE Audit)
    提供统一的事后审计套件,包含四项检查:

    • I1 分数验证:复现论文报告的关键指标;
    • I2 规范违规:检测是否利用评估器漏洞;
    • I3 引用验证:逐一核实参考文献真实性;
    • I4 方法-代码对齐:检查方法描述与实现是否一致。
      审计结果反馈给验证模块,用于进一步精炼。

输出

最终产出包含可验证的研究论文、可运行代码库、完整证据链图谱及审计报告,各声明均可追溯至原始证据。

差异点:与依赖表面写作质量评估的现有自主研究代理不同,ScientistOne 通过全局证据链与规范性审计,从根本上杜绝幻觉引用与不可复现结果,实现人类水平的研究输出。

实验

实验设计

  • 评估对象:ScientistOne 与四个代表性自主研究基线系统(包括 ADRS、PaperQA2 等),在五个前沿研究任务上各生成多篇论文,总计 75 篇。
  • 评估方法:CoE Audit,包含四项完整性检查:I1 分数验证I2 规范违反检测I3 引用验证I4 方法-代码对齐
  • 泛化测试:扩展到医疗影像、细粒度识别、3D 感知、语言建模等 6 个额外任务,并在 Parameter GolfMLE-Bench 上评估。

关键发现

  • 引用完整性:ScientistOne 实现 0% 虚构引用 (0/337),而基线系统虚构引用率最高达 21%。
  • 分数可复现性:ScientistOne 论文 100% 通过分数验证 (12/12),基线最低仅 42% 通过。
  • 方法-代码对齐:ScientistOne 达到 93.3% (14/15),基线系统在 20%–80% 之间波动。
  • 解决方案性能:ScientistOne 在全部五个前沿任务上匹配或超过人类专家水平,并在 MLE-Bench 任务中获得金牌,基线则完全失败。

基线对比与工程启示

基线系统普遍存在隐蔽的 可验证性崩溃:虚构引用可能来源于模型记忆,分数不一致常源于跨阶段 cherry-pick 或评测代码错误,方法描述与实现分离则导致论文不可复现。ScientistOne 通过在 文献调研、方案发现、论文写作 三阶段中强制维护证据链,从构造上杜绝了这些系统性缺陷。这一设计对构建可信自主科研系统具有重要启示:完整性约束必须内建于 agent 工作流的关键环节,而非仅仅依赖事后检查。

行业影响

落地场景

ScientistOne 为 AI 研发自动化提供了一种可验证的端到端方案,适合需持续迭代模型的企业场景。

  • 电商与内容平台:推荐算法优化时,可自动完成文献调研、方案探索与实验报告生成,加速模型上线。
  • 医疗影像与自动驾驶:在新数据集或安全需求下,自动搜索数据增强、架构改进,并输出代码与论文,确保方法描述与实现严格一致。
  • 金融风控:自动探索时序模型或异常检测新结构,生成可审计的研发记录,降低合规风险。

商业价值

核心价值在于可信的自动化研究带来的降本增效。

  • 降本:消除人工研究员重复实验与文献查阅,将实验周期从周级压缩到天级,节省 2-3 名研究工程师的人力成本。
  • 增效:通过 CoE Audit 四重检查(分数验证、规范违规、参考文献验证、方法-代码对齐),杜绝虚构引用和不可复现结果,提升模型迭代的可靠性,直接支撑业务指标提升。
  • 信任:可验证的论文让技术决策者更快采纳自研方案,缩短从实验到生产的鸿沟。

与现有工作流的接口

ScientistOne 可集成到现有 MLOps 栈中,作为 自动化研究节点

  • 实验平台对接:通过 API 读取 MLflow / Weights & Biases 中的实验记录,启动研究任务,生成带 Chain-of-Evidence 的论文和代码 PR。
  • CI/CD 管道:将 CoE Audit 作为模型上线前的自动检查步骤,确保论文声明、代码实现和实际分数三者对齐,防止带缺陷的模型进入生产。
  • 协作工具:自动提交报告到 Confluence / Notion,关联 GitHub 分支,供团队评审。

具体用例

  1. 电商搜索团队需优化多召回融合模型:ScientistOne 根据最新研究自动提出 Late Fusion 改进方案,生成可复现的代码与论文,CoE Audit 确保实验分数准确且无虚构引用。原本 3 人·2 周的探索工作缩短至 1 天,且产出可直接用于知识沉淀。
  2. 自动驾驶感知团队应对长尾障碍物检测:ScientistOne 自动搜索新检测头与数据增强组合,输出对齐的代码和论文,避免实际部署时方法描述与实现不一致导致的性能回退,显著减少人工校对成本。

局限

  • - **基准覆盖与深度有限**:论文仅在 5 个前沿任务上评估 ScientistOne,且每个任务只覆盖少量数据集和种子;审计指标(如引文验证)仅检查标题/作者存在性,未深入验证内容相关性或引用目的。对跨领域泛化仍缺乏大规模、长周期验证,可能掩盖任务特异性的脆性。
  • - **自动化审查与审计的近似性**:采用自动化评审打分作为论文质量代理,可能高估或低估真实学术价值;CoE 审计虽然系统性,但存在假阴性风险(如方法-代码对齐检查可能漏判部分实现偏差),且审计流程的严格性仍依赖人工监督,尚未完全自动化闭环。
  • - **与真实研究生态的差距**:系统在自主研究中虽达到零幻觉引用和满分评分,但依然受限于预定义任务框架和搜索空间,无法像人类研究者一样提出全新问题或跨领域灵感组合;解决新颖性尚需外部先验,在开放科学发现场景下仍属半自主。
论文Rui Meng2026-05-25原文

相关内容