早期实验Claude Opus 4.5,未做大集成
我们之前对Opus 4.5做了一些初步实验,但还没有做更大的集成。
@lahpm1992 @arcprize 我们在ARC-AGI-2 *Public-Eval*上使用Claude Opus 4.5(Thinking, 32K)得到了一些初步结果:
42.92%准确率,每个任务$6.98
这与我们使用Poetiq(Gemini-3-b)得到的Gemini-3结果准确率相似,但成本大约翻倍。
没有Poetiq,该模型在$1.37下得到28.15%。