用Opus 4.5做了初步实验,尚未运行更大集成
我们之前用Opus 4.5做了一些初步实验,但还没有用它运行更大的集成。
@lahpm1992 @arcprize 我们有一些在ARC-AGI-2 *Public-Eval*上使用Claude Opus 4.5 (Thinking, 32K)的初步结果:
42.92%准确率,每任务$6.98
这与我们使用Poetiq(Gemini-3-b)的Gemini-3结果在精度上相似,但成本大约翻倍。
没有Poetiq,该模型只能达到28.15%准确率,每任务$1.37。