动态

Claude Opus 4.6在agentic任务中领先GPT-5.2,但成本更高。

Claude Opus 4.6在agentic任务中领先GPT-5.2,但成本更高。
Artificial Analysis
Claude Opus 4.6 在 GDPval-AA 中领先,超越 GPT-5.2,这是我们 agentic 真实世界知识工作任务的基准测试。我们与 @AnthropicAI 合作,在 Claude Opus 4.6 发布前进行了基准测试——在自适应思考模式下,其 Elo 达到 1606,比 GPT-5.2 (xhigh) 高出近 150 分。这意味着与 OpenAI 2025 年 12 月的旗舰产品直接比较时,胜率约为 70%。

使用约 1.6 亿 token 的自适应思考模式完成 GDPval-AA 中的 220 个任务,Claude Opus 4.6 使用的 token 比 Opus 4.5 多 30-60%,但仍远少于 GPT-5.2 (xhigh)。增加的 token 使用量加上高单价(每百万 token $5/$25,与 Opus 4.5 相同),使得 Claude Opus 4.6 成为我们在 GDPval-AA 上测试过的成本最高的模型。

以下是 token 使用量、轮次和成本的细分,以及示例文件输出。

完整的人工分析智能指数基准测试正在进行中——完成后我们将分享 Opus 4.6 性能的完整更新。

GDPval-AA 是我们衡量通用 agentic 性能的主要指标,衡量模型在知识工作任务上的表现,包括准备演示文稿、数据分析到视频编辑。模型通过 Stirrup(我们的开源 agentic 参考框架)在 agentic 循环中使用 shell 访问和网页浏览。

基础 GDPval 数据集由 @OpenAI 于 2025 年 9 月发布,涵盖 9 个不同行业 44 个职业的独立工作任务。它提供了对当前劳动力相关任务类型的洞察,并且由于 OpenAI 团队的专业过滤和策划而具有高度现实性。
动态Artificial Analysis2026-02-05原文

相关内容