三大AI模型获IMO满分 人类选手满分率不足1%
三个AI模型在IMO 2026中获得满分,标志着通用大模型在高端数学推理上跨越了关键门槛。
2026年国际数学奥林匹克(IMO)中,三个通用大模型(Claude Fable 5、GPT-5.6 Sol、Kimi K3)全部满分完成六道题,而人类过去七年满分率仅0.69%。它们没有经过专项数学训练,解题成本和路径各不相同,展示出通用AI的数学推理能力正在快速逼近顶尖人类水平。
正文摘录
 新智元报道  上海的七月,热浪滚滚。 第67届国际数学奥林匹克正式落幕,中国队以232分斩获桂冠。三名少年拿下42分满分。  现场掌声还未散尽,GitHub 上悄然浮现了另一份亮眼的成绩单。 前 Google 工程师 Deedy Das 甩出一场 AI 横评:7个前沿大模型,全自主单挑 IMO 2026 全部6道题。 - Claude Fable 5 狂揽42分满分。耗时仅仅2.5小时,烧掉51美元。 - GPT-5.6 Sol 的 xhigh 版本同样满分。用时3.8小时,成本更是压到了极低的20美元。 - Kimi K3 紧随其后拿下满分。历经17.4小时鏖战,花费31美元。 - 再算上独立交卷的 AxiomProver ,整整四方势力全部登顶满分。  作为参照,过去七年 IMO,4347名人类选手参赛,只有30人拿过满分——比例0.69%。