动态

Gemini 3.1 Pro在ARC AGI 2上达94.1%,对比Claude Opus

Saroosh Khan
在ARC AGI 2上的更新结果(@arcprize)

我在Google DeepMind的Gemini 3.1 Pro Preview上运行了1月27日的尝试。

在OpenRouter中设置推理为高后,以每任务8.71美元的成本达到了94.1%。

我注意到与Claude Opus 4.6的一些关键差异:
- 更便宜,总体使用更少的token。
- 不完全遵守工具调用,即使在提示按顺序调用工具时也倾向于以文本响应。
- 当模型无法追溯推理轨迹时,API会出错(代码中的重试逻辑处理了这一点)。
- 相比Opus没有回归!Gemini 3.1 Pro解决了之前未解决的11个任务。

总体而言,工具输出轨迹显示出非常深入的理解能力,以及使用代码执行沙箱来理解其方法何时失败并更新假设的能力。

复现代码:
https://kaggle.com/code/sarooshkhan897/arc-ttt-gemini/…

介绍我的方法的博客:
https://sarooshkhan24.substack.com/p/solving-arc-with-test-time-adaptation…

@GregKamradt @fchollet @mikeknoop @OfficialLoganK
动态Saroosh Khan2026-02-19原文

相关内容