动态

初步实验Opus 4.5,尚未大规模集成

Poetiq
我们之前用 Opus 4.5 做了一些初步实验,但还没有进行更大规模的集成:
Poetiq
@lahpm1992 @arcprize 我们在 ARC-AGI-2 *公共评估* 上使用 Claude Opus 4.5(思考模式,32K)获得了初步结果:

准确率 42.92%,每个任务成本 $6.98

这与我们使用 Poetiq(Gemini-3-b) 获得的 Gemini-3 结果在准确率上相近,但成本约为其两倍。

不使用 Poetiq,该模型在 $1.37 成本下获得 28.15% 的准确率。
动态Poetiq2025-12-23原文

相关内容