动态

François Chollet评价GPT-6 Astra在ARC上表现:持续交互大幅超人类基线,会自建DSL建模。

Andrew Curran
François Chollet 对 GPT-6 Astra 在 ARC 上的表现评价:\n\n'GPT-6 Astra 代表了交互式推理问题模型能力的阶跃式变化。……实际上,持续交互测试版本在几乎所有级别上的动作效率都显著优于我们的人类基线。当我们检查推理链以了解模型如何运作时,发现它为每个游戏和关卡执行高效、即时的符号化世界建模。它甚至发展出自己的速记DSL来表示游戏内情境——本质上是一种特定于游戏的代数记法。'
François Chollet
GPT-6 Astra 代表了交互式推理问题模型能力的阶跃式变化。它使用我们的标准测试套件在 ARC-AGI-3 上得分 66%,使用持续对话测试套件和自定义压缩后接近 100%,每个游戏成本约为 360 美元。\n\n实际上,
动态Andrew Curran2026-09-04原文

相关内容