UniPat AI 发布 PaperBenchX:93 个论文复现任务中 GPT-6 Astra 完整复现率仅 13.98%
它把「论文复现」变成可验证的考试:不看你跑出什么数字,只看删档重跑后还能不能生成同样的证据——这也是衡量 AI 能不能当科学家前更基础的一道关。
UniPat AI 发布 PaperBenchX,这是首个多学科端到端论文复现基准:93 篇真实论文、12 个研究方向、10 种领域原生科学软件环境、3168 条专家校验评分项。Agent 交卷后系统删除全部输出、断网重跑,只认重新生成的证据。表现最好的 GPT-6 Astra 完整复现率也只有 13.98%。
正文摘录
上个月,OpenAI 宣布其 AI 模型仅用 88 小时,便攻克了困扰人类百年的千禧年七大顶级数学难题之一——N-S 方程;昨天,又放出 722 篇数学手稿,千禧难题又有仨。 但在 UniPat AI 发布的 PaperBenchX 测评中,面对 93 个真实论文复现任务,表现最强的 GPT-6 Astra,完整复现率却只有 13.98%。 随橙想! 当前模型已经能取得破解千禧年数学难题这样的伟大突破,但很少能完成一次可靠的端到端科学复现。 (正经脸)这引发了一些思考:在广泛的 AI for Science 领域中,我们要以什么标准判断「做对了科学」?本着严谨踏实的科研态度,迈向 AI 数学家乃至 General AI Scientist 的第一步到底是什么?我们又该如何形成一套可验证、可比较的标准,真正衡量 AI 在科学研究上的进步? 他们肯定了大语言模型的数学能力急剧提升,已经能解决数学领域的重大难题,但也提出了更关键的问题: AI 公司把解决数学问题当作基准测试 ,这对数学这门科学、对数学共同体都是有害的。 所以,这不是一封反对 AI 的信,它问的是一个更朴素的问题: 衡量 AI 在科学里的进步,到底该用什么尺子? 信里还有一句分量更重的话:把解决数学问题当作基准测试的错位问题,只是更广泛的错位问题的一部分,这种错位同样影响着其他科学与创意职业,乃至整个社会。 数学至少还有最后一道防线:Lean。证明对不对,机器可以逐步检查,答案的真假有兜底。 可放到其他科学领域里,一个电磁仿真的反射系数、一条能带、一个收敛后的带隙,都没有 Lean。一个和论文对得上的数字,背后可能是错误的物理模型、没收敛的仿真,或者碰巧凑出合理值的无效后处理。