行业新闻

Schema 框架在 ARC-AGI-3 上接近满分,以物理学家式推理攻克基准

Schema 框架通过让 LLM 将游戏机制写成可验证程序,几乎打穿 ARC-AGI-3,但争议点在于是否作弊式注入了人类知识。

ARC-AGI-3 是考验 AI 规则发现能力的游戏基准。伯克利团队开发的 Schema 框架不修改模型权重,而是引导模型像物理学家一样观察、提出假说、编写可运行程序并验证,在公开集上达到 98.98% 的正确率。但部分成果依赖人工先验知识,引发讨论。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/7bd1af7c-9f06-4b39-8096-98e2d5ad58da/0(2).jpg) 编辑|Panda 7 月 16 日,伯克利博士后 Haven Feng 的一条推文火了。原因无他,结果很震撼:在 ARC-AGI-3 Public 集上,一套名为 [ schema ] 的智能体框架,与 Claude Opus 4.8、Fable 5 组合后达到 98.98% 的 RHAE;换成 GPT-5.6 Sol 组合,分数也有 95.35% 。 怎么做到的?Feng 的推文表示:「 [schema] 让 LLM 像物理学家一样思考。 」 ![图片](https://mmbiz.qpic.cn/mmbizpng/5L8bhP5dIqFN4q3QsQLgeiadjSUEoS6yugCF5hgLibQQ2kVfbmZ9LicWtQgGqbibr9TtrDCS6iahor6jJANSuVrbcgVyIqDhIsrdI6icmyP5wSzBw/640?wxfmt=png&from=appmsgimgIndex=1) 这条推文很快被转到 55 万次浏览。 要理解这些成果的分量,得先看它站在什么位置上。ARC-AGI-3 今年 3 月上线时,最强的前沿智能体只拿到 0.51%。到 7 月,官方验证过的最好成绩是 GPT-5.6 Sol 在最高推理档下的 7.78%(半私有集),公开集也才 13.33%。一个跑了近半年、被 ARC-AGI 和 Keras 创造者 François Chollet 判断「大约还能撑一年」才会饱和的基准,被几乎打穿了。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-18原文

相关内容