仅凭分数不能证明发现:审计 AI 研究智能体的 Discovery Certification Protocol
AI 研究智能体通过结合先验知识、公开来源与实验反馈来产出有用的结果。Discovery Certification Protocol(DCP) 将关于这些结果的声明转化为可执行的 recovery 与 feedback 测试: - Gate 1 在密封评测上验证有用改进。 - Gate 2 向匹配的智能体提供已注册的起始信息与观测到的 Web 内容,但扣留目标研究历史。任何达到数值目标的有效方法都会提供 recovery witness,并触发 Core veto。 DCP Core 要求具备充分对照、观测到的 recovery 为零,以及在一次全新注册 episode 上的 recovery 有限样本上界。可选的 Gate 3 从共享 checkpoint 出发,测量真实反馈相对于指定中性策略的平均效应。DCP Evidence 在独立零假设校准与已注册效应幅度之后加入该效应。 两项受控审计在不同模型下,于 SQLite 优化 与 虚拟催化剂控制 中运行完整协议。两者在 96 个 episode 中均产生零次 recovery,上界为 0.0468。每项配对研究都得到 30 次真实 recovery 与 0 次中性 recovery,并通过 60 对零假设研究。更多案例覆盖 Core、recovered 与 audit-incomplete 三类判定。一个确定性的、无 LLM 的验证器可从冻结证据中复现这些判定。DCP 为 AI 研究中的有用结果、替代路径与反馈效应提供了共同的证据语言。
论文精读
TL;DR DCP 将 AI 研究智能体的成果声明转为可执行的恢复与反馈测试,用密封评估、对照审计和有限样本界限区分“高分”与“真发现”,并提供确定性验证器复现决策。
问题
问题背景:AI 研究智能体(Research Agents)结合先验知识、公共资源和实验反馈自动产出优化结果,当前评估主要依赖固定基准上的得分,用于比较和筛选。
现有方法局限:
- 仅凭基准分数无法证明“发现”的真实性,智能体可能通过记忆训练数据、检索已知答案、利用测试集信息泄露获得高分;
- 评测无法审计智能体的搜索历史、提示词和外部内容接触,高分可能来源于未披露的 Web 访问;
- 人类反馈或奖励信号对最终结果的影响常被忽略,导致高估自主研究能力。论文明确指出 “Scores Alone Do Not Prove Discovery”,老办法缺少过程级、可执行的认证证据。
为什么这个问题难/重要:认证发现需要重建信息边界:在给予匹配智能体相同起始信息和观察到的 Web 内容、但隐藏目标研究历史的条件下,测试其能否独立达到数值目标。技术挑战包括 LLM 输出随机性、网络内容动态变化、有限采样下的错误率控制,以及如何设计可执行且确定的验证流程。DCP 通过 Gate 1 密封评估验证有用改进、Gate 2 恢复测试触发 Core veto(要求零恢复并给出有限样本上界)、Gate 3 估计反馈策略效应,最终用无 LLM 的确定性验证器复现决策。该问题对自动科研、模型评测、基准公平性都至关重要,业界需要可信的“发现认证”而非单纯分数。
行业类比:类似大模型安全红队评测中,不能只看攻击成功率,还需审计攻击路径是否独立于测试集信息泄露。
核心洞察
- DCP 将研究发现的验证从分数比较转向可证伪的恢复测试,要求代理在只获得注册起始信息和网页快照、隐藏目标研究历史的条件下独立复现结果,从而区分真发现与训练分布记忆或数据泄露。这弥补了现有基准只评估最终指标、不审计过程完整性的缺口,提供了一种对 AI 研究代理可信度的因果性检验。
- DCP 引入零恢复的有限样本上界作为核心否决条件,并要求所有决策可由确定性无 LLM 验证器从冻结证据复现。该方法把审计本身变成可验证、可复现的证据链,通过独立空假设校准和预注册效应边际,将反馈效应与随机波动区分开,为 AI 研究结果提供了接近临床试验的证据等级。
方法
输入
DCP 的输入是 AI 研究 agent 提出的结果声明,包括声称的数值目标、方法描述、实验上下文和可复现信息。声明对应的研究历史(如完整日志、内部中间步骤)在审计开始时被封存,仅向后续 Gate 暴露受限信息。
关键模块
Gate 1:密封评估验证有用改进
将声明的方法在预先注册的密封评测集上运行,对照基线确认是否达到预期的数值改进。密封设计防止事后修改评测或调参,确保改进不是由数据泄露或选择偏差引起。Gate 2:恢复测试与 Core veto
构造一个恢复挑战:给予匹配 agent 注册的起始信息和观察到的公开 Web 内容,但隐藏目标研究历史。若存在任何有效方法能达到同一数值目标,则触发恢复见证,表明该结果并非唯一发现。Core 决策要求:在足够控制条件下执行固定数量的新鲜注册 episode(如 96 次),观察到零次恢复,并计算有限样本下恢复概率的上置信界(例如 0.0468)。若出现恢复或上界超过阈值,则 Core veto 成立,拒绝“发现”认证。Gate 3(可选):反馈效应估计
从共享检查点出发,比较真实反馈与预先注册的中性策略之间的平均效果差异。该差异需通过独立的 null 校准,并超过注册的效应幅度,才能作为附加证据(DCP Evidence)。
输出
综合各 Gate 结果,DCP 给出明确决策:Core(核心认证通过)、recovered(存在恢复见证)、audit-incomplete(审计不完整)等。所有决策可由一个确定性的、无 LLM 的验证器从冻结证据中复现,保证审计过程可追溯、可复核。
与同类方法的差异
DCP 不依赖单一分数或基准排名,而是将“发现”认证形式化为可执行的恢复与反馈测试,通过预注册、控制条件、有限样本界和确定性验证,审计研究过程的独特性与因果效应,而非仅仅评估最终性能指标。
实验
实验设计
- 两个受控审计: SQLite 优化(
DeepSeek-v4-flash)与虚拟催化剂控制(DeepSeek-v4-pro),分别覆盖 Web 访问与实验反馈场景。 - Gate 1: sealed evaluation 验证有用改进;Gate 2: 匹配 agents,提供注册起始信息与观察到的 Web 内容,隐去目标研究历史,测试恢复(recovery)。
- Core 要求零恢复、充分对照、单次新注册 episode 的有限样本恢复上界。
- 可选 Gate 3: 独立 null 校准 + 注册效应 margin,测量 truthful feedback 相对 neutral policy 的平均效应。
关键发现
- 每个审计 96 episodes 中零恢复,恢复概率上界 0.0468。
- 配对研究: truthful recoveries 30 次, neutral recoveries 0 次,通过 60-pair null 研究。
- 确定性 LLM-free verifier 从 frozen evidence 复现决策。
对比解读
- 与传统基准分数不同,DCP 不对方法排名,而是对“可恢复性”做否决;分数达标但可恢复则 Core 否决。
- 30/0 的 truthful/neutral 对比和 60-pair null 通过说明反馈效应有统计证据,但效应需注册 margin 和独立校准,防止事后挑选。
- 0.0468 是有限样本上界,而非点估计,表明审计在 96 episodes 下置信度有限,但对零恢复声明给出可复现边界。
行业影响
落地场景
DCP 可直接嵌入 AI 研究自动化平台(AutoML、科学发现代理、材料/药物优化系统)作为成果认证层。典型场景:生物医药中的分子生成代理提出新候选分子后,DCP 的 Gate 1/2 验证其在密封评估和恢复测试中的表现;企业服务中的 SQL 优化代理(如论文中的 SQLite-Web 案例)可审计优化建议是否真实改进且可复现。
商业价值
主要带来 降本 和 风控:通过可执行恢复测试和有限样本上界(0.0468),减少虚假发现导致的下游实验浪费和资源错配;增收 体现在加速可靠创新进入生产,例如药物研发中筛选出真正有效的分子,提升专利和产品转化率。DCP 的确定性 LLM-free 验证器还可降低人工审计成本。
与现有产品/工作流的接口
- 可集成到实验管理工具(如 MLflow、Weights & Biases)中,作为自定义评估步骤,注册起始信息、观察内容、效果边界等。
- 与 CI/CD 流水线结合,对 AI 研究代理的每次“发现提交”运行 Gate 1/2/3,失败则阻断合并。
- 提供冻结证据和可复现决策,适配企业审计合规要求;GitHub 项目 Discovery-Certification-Protocol 提供参考实现。
局限
- DCP 协议高度依赖严格的**预注册**(precommitment)与**密封评估**(sealed evaluation)流程,这在实际部署中会带来显著的组织与计算开销,且要求研究结果必须映射到可数值化的目标(如指标分数)。对于开放式、非数值型的科学发现(如定性机制解析、理论猜想),协议难以直接套用,限制了其作为通用审计框架的覆盖面。论文未讨论如何将 DCP 扩展到这些场景,也未给出成本效益分析,这可能阻碍其在真实研究管线中的快速落地。
- 实验仅覆盖 **SQLite 优化**和**虚拟催化剂控制**两个受控领域,样本规模为每类 96 个独立 episode,得到的有限样本上界 `0.0468` 基于特定统计假设。该上界只能保证在高置信水平下恢复概率不超过 4.68%,但相对较宽的置信区间与有限的任务多样性意味着无法排除小概率恢复事件的漏检。若要证明协议在不同研究任务(如自然科学、社会科学)中的稳健性,需要更大规模、更多样化的实证验证。
- **Gate 3** 反馈效应测量为可选模块,要求独立零校准与注册效应边际,大幅增加了审计复杂度;若省略该模块,协议只能证明“恢复不可行”,无法提供关于反馈增益的证据,削弱了认证的完整性。此外,协议对 Web 访问的边界控制依赖于威胁模型假设,真实开放网络环境中代理可能通过未注册渠道获取信息,从而绕过恢复测试的约束,这构成了方法学上的潜在脆弱点。