AI审计顶会论文:99.2%至少存在一处客观错误
AI 用来审计和复现论文,发现绝大多数顶会论文存在错误或无法复现,学术界的可信度正在被 AI 重新检验。
一项研究用 GPT-5 写出的审查系统,系统检查了 AI 顶会已发表论文,发现平均每篇有 4.7 个可验证的错误,99.2% 的论文至少被标记一个问题。更麻烦的是,另一个团队用 AI Agent(能自主跑实验的智能体)复现 ICML 2026 的 168 篇口头报告论文,结果只有 8 篇复现了超过 80% 的结论。代码缺文件、依赖版本损坏、结果对不上都是常事。
正文摘录
2026年国际机器学习大会(ICML)上报告的92篇论文中,有58篇已经无法复现。 然而受精力所限,同行评审审稿人 几乎没有时间 从头下载数据、运行模型或复现实验,以验证论文中的每一个实验结论。 与此同时随着 AI 领域的论文数量爆炸增长,模型越来越复杂,实验规模越来越大,一篇论文背后的代码、数据、参数设置 可能涉及数百个细节 。 7月22日,美国某研究审查公司用 AI Agent 对 ICML 2026 全部168篇口头报告论文进行了系统性的结果复现审计。 最终的结果是:AI Agent 能够成功复现超过四成结论的,只有34篇;而能复现八成以上结论的, 仅有8篇 。 复现失败的原因 包括不限于 代码缺少关键文件、依赖库版本断裂、运行结果与论文不符,还有4篇论文依赖的模型已下线,这意味着实验结果已经永久性地无法被任何人复现。 比如,一篇论文将「仅训练基础模型0.77%的参数」作为核心卖点,但其实际开源的 checkpoint 训练了6.31%的参数, 相差约8倍 。 另一篇论文放了一张基于某评判模型的可靠性表格,但其开源代码中根本不包含该评判模型,也没有任何脚本能够生成表格里的结果。 无独有偶,2026年抱抱脸与 AlphaXiv 联合发起针对 ICML 2026 的「Agent Reproduction Challenge」 挑战赛 ,邀请研究者使用 AI Coding Agent 对 ICML 2026 接收的论文进行自动化复现, 结果同样很不乐观。 2025年底,一项研究开发了基于 GPT-5 的论文检查系统,用于分析已经发表在顶级 AI 会议和期刊上的论文,寻找可以客观验证的问题。研究者非常明确地表示: 最终结果显示,平均每篇论文被检测出4.7个客观错误, 99.2%的论文至少被标记出了一个问题 。