Claude Opus 5在写作基准中排名第一
RT @Whats_AI: 来自我们内部写作基准测试的重大消息(早期结果):@AnthropicAI 的 Claude Opus 5 现在在我们的编辑风格写作中排名第一,Elo 得分 2817,超越了 Claude Fable 5 和 Kimi。已经做到了!
这意味着相比其前身 Opus 4.8(如果考虑所有思考变体),在相同的 API 价格下,从第 15 名跃升至第 1 名。
这次推理努力确实重要。在默认努力下它排名第 6。在最大努力下它占据榜首,每个脚本思考超过三分钟。这似乎显而易见,但对于 4.8 并非如此,尽管对于 Fable 来说是这样。
这意味着相比其前身 Opus 4.8(如果考虑所有思考变体),在相同的 API 价格下,从第 15 名跃升至第 1 名。
这次推理努力确实重要。在默认努力下它排名第 6。在最大努力下它占据榜首,每个脚本思考超过三分钟。这似乎显而易见,但对于 4.8 并非如此,尽管对于 Fable 来说是这样。