Opus 5 借助工具环境 ARC-AGI-3 正确率升至 96.2%
同一模型,允许写代码和试错后 ARC-AGI-3 得分从 30.2% 升至 96.2%,显示复杂脚手架反成束缚。
ARC-AGI-3 是一个要求 AI 在未见过的游戏中现场推理规则的基准测试,人类通关率 100%,此前最强 AI 仅 0.37%。官方测试下 Opus 5 得 30.2%,但允许它借助电脑写代码、反复试错后,正确率飙至 96.2%。模型未变,环境改变让结果天差地别。
正文摘录
 新智元报道  30.2%。 这是 ARC Prize 官方给 Opus 5 打的 ARC-AGI-3 成绩。 排行榜第一,甩开第二名 GPT-5.6 Sol(7.8%)近四倍。  听着还行,对吧? 但就在刚刚,开发者 Jeremy Berman 把一组数字甩到了 X 上,直接把 AI 圈看懵了—— 25 个公开关卡,单次通关 24 关,Opus 5 的正确率从 30.2% 飙升至 96.2%!  每关要是给两次机会,正确率直接飙到 99.3%,25 关几乎一关不漏。 从 30 分到 96 分,模型没换,权重没动,中间就隔了一台电脑。   给它一台电脑 剩下的它自己想办法 Berman 的做法简单到不讲道理。