动态

Poetiq团队初步测试Opus 4.5,尚未大规模集成

Poetiq
我们之前用Opus 4.5做了一些初步实验,但还没有用更大的集成运行过:
Poetiq
@lahpm1992 @arcprize 我们在Claude Opus 4.5(思考模式,32K)上取得了ARC-AGI-2 *Public-Eval*的初步结果:42.92%,每个任务$6.98。这在我们用Poetiq(Gemini-3-b)的Gemini-3结果中准确率相似,但成本大约翻倍。没有Poetiq,该模型得分为28.15%,成本$1.37/
动态Poetiq2025-12-23原文

相关内容