初步实验Opus 4.5,尚未大规模集成
我们之前用 Opus 4.5 做了一些初步实验,但还没有进行更大规模的集成:
@lahpm1992 @arcprize 我们在 ARC-AGI-2 *公共评估* 上使用 Claude Opus 4.5(思考模式,32K)获得了初步结果:
准确率 42.92%,每个任务成本 $6.98
这与我们使用 Poetiq(Gemini-3-b) 获得的 Gemini-3 结果在准确率上相近,但成本约为其两倍。
不使用 Poetiq,该模型在 $1.37 成本下获得 28.15% 的准确率。