动态

用Opus 4.5做了初步实验,尚未运行更大集成

Poetiq
我们之前用Opus 4.5做了一些初步实验,但还没有用它运行更大的集成。
Poetiq
@lahpm1992 @arcprize 我们有一些在ARC-AGI-2 *Public-Eval*上使用Claude Opus 4.5 (Thinking, 32K)的初步结果:

42.92%准确率,每任务$6.98

这与我们使用Poetiq(Gemini-3-b)的Gemini-3结果在精度上相似,但成本大约翻倍。

没有Poetiq,该模型只能达到28.15%准确率,每任务$1.37。
动态Poetiq2025-12-23原文

相关内容