FrontierMath Tier 4 被刷穿,GPT-6 Astra 解出全部题目
专门为最强模型加设的研究级数学测试 Tier 4 用一年多就被刷穿,但 FrontierMath 已转向真正未解决的开问题,Astra 在其中只做出 2/68。
Epoch AI 宣布 FrontierMath Tier 4 饱和:GPT-6 Astra 拿到 97.6%,累积起来每道题都至少被解出过一次。这层 2025 年 7 月才推出的研究级数学防线,起点成绩只有约 5%。
正文摘录
AI 数学的最后一道高墙,塌了!GPT-6 Astra 刷穿 FrontierMath Tier 4 刚刚,最后一道 FrontierMath Tier 4 难题,被 GPT-6 Astra 攻破了。 至此,这套曾经被视作 大模型数学噩梦 的研究级测试,所有题目都已经至少被 AI 成功解出过一次。 Epoch AI 也正式给它下了结论,FrontierMath Tier 4,饱和了。 虽然从上面的图里看,Astra 还没有直接干到 100%,OpenAI 自己公布的成绩也是 97.6%。 但按照 Epoch 的算法,"全部解出"指的是把不同模型、不同时间的尝试累积起来以后,Tier 4 里的每一道题都已经有过成功解答。 (简单理解就是 Astra 可能在某次测试中出错了,但它对的那道题是此前没被解出来的) 如果你关注模型评测的话,就知道 2025 年 7 月 11 日,Tier 4 刚刚推出时,榜上最高成绩只有大约 5%。 现在刚过了一年零 2 个月,这个曾经的"高墙"已经变成了"台阶",最后一道难以被 AI 通过捷径绕道解决的问题也被跨越。 出题人、马凯特大学数学副教授 Jay Pantone 也表示,以往 AI 都会找数值捷径,而这一次,AI 的解法和自己相当接近。 不过,就在最近 GPT-6 Astra 集中向数学界猛攻,三天两头解决千禧年难题之际,Pantone 表示自己已经很难惊讶了! FrontierMath 最早于 2024 年 11 月 7 日发布,而它诞生的目的,本身就是为了避免数学 Benchmark 过快被 AI 刷穿。 当时像 GSM8K、MATH 这样的传统数学 Benchmark 已经越来越难拉开头部模型之间的差距,于是 Epoch AI 联合 60 多位数学家,重新设计了一批此前从未公开过的原创题。