行业新闻

Opus 5 借助工具环境 ARC-AGI-3 正确率升至 96.2%

同一模型,允许写代码和试错后 ARC-AGI-3 得分从 30.2% 升至 96.2%,显示复杂脚手架反成束缚。

ARC-AGI-3 是一个要求 AI 在未见过的游戏中现场推理规则的基准测试,人类通关率 100%,此前最强 AI 仅 0.37%。官方测试下 Opus 5 得 30.2%,但允许它借助电脑写代码、反复试错后,正确率飙至 96.2%。模型未变,环境改变让结果天差地别。

正文摘录

![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimg23c143ec7d.jpg) 新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimg3b253ef414-102.png) 30.2%。 这是 ARC Prize 官方给 Opus 5 打的 ARC-AGI-3 成绩。 排行榜第一,甩开第二名 GPT-5.6 Sol(7.8%)近四倍。 ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimga25532124c.png) 听着还行,对吧? 但就在刚刚,开发者 Jeremy Berman 把一组数字甩到了 X 上,直接把 AI 圈看懵了—— 25 个公开关卡,单次通关 24 关,Opus 5 的正确率从 30.2% 飙升至 96.2%! ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimg975c596b1e.webp) 每关要是给两次机会,正确率直接飙到 99.3%,25 关几乎一关不漏。 从 30 分到 96 分,模型没换,权重没动,中间就隔了一台电脑。 ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimg2daa9e1938.webp) ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimgdf9d89c9b2-101.png) 给它一台电脑 剩下的它自己想办法 Berman 的做法简单到不讲道理。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-08-14原文

相关内容