动态

GPT-5.5登顶AI指数,成本增加但性能领先

GPT-5.5登顶AI指数,成本增加但性能领先
Artificial Analysis
GPT-5.5 让 OpenAI 重新坐稳 AI 领域第一的位置。OpenAI 的新模型在 Artificial Analysis 智能指数上以 3 分优势领先,打破了与 Anthropic 和 Google 的三方平局。OpenAI 为我们提供了预发布权限,以测试所有五种推理努力级别:极高、高、中、低和非推理。

➤ OpenAI 在五项评测中领先:GPT-5.5(极高)在 Terminal-Bench Hard、GDPval-AA 以及我们新托管的 APEX-Agents-AA 上领先。该模型在 CritPt 和 AA-LCR 中仅落后于其他 OpenAI 模型,并在另外三项评估中仅次于 Gemini 3.1 Pro Preview。最大的提升来自 AA-Omniscience(+14 分,我们的知识和幻觉基准)和 τ²-Bench Telecom(+7 分,一个客服智能体基准)。

➤ 运行智能指数成本增加 20%:每 token 价格从 GPT-5.4 翻倍至每百万输入/输出 token 5/30 美元。然而,约 40% 的 token 使用量减少基本抵消了涨价——导致运行智能指数的净成本增加约 20%。

➤ 努力级别成为平衡智能与成本的明确阶梯:GPT-5.5(中)在智能指数上的得分与 Claude Opus 4.7(最高)相同,但成本仅为后者的四分之一(约 1200 美元 vs 4800 美元)——尽管 Gemini 3.1 Pro Preview 以约 900 美元的成本达到了相同分数。GPT-5.5(低)在智能指数上接近 Claude Opus 4.7(非推理,高),运行成本约一半(约 500 美元 vs 约 1000 美元)。

➤ GDPval-AA 排名第一,Elo 分数 1785:GPT-5.5(极高)领先 Claude Opus 4.7(最高)约 30 分,领先 Gemini 3.1 Pro Preview 约 470 分。GDPval-AA 是 Artificial Analysis 的基准,利用 OpenAI 的 GDPval 数据集评估模型在实际经济价值任务上的表现。

➤ AA-Omniscience 准确率最高,但在幻觉方面落后于前沿模型:我们的私有 AA-Omniscience 基准奖励跨主题的事实知识,但惩罚幻觉。GPT-5.5(极高)准确率最高,达 57%,意味着该模型比任何其他模型更能有效回忆 Omniscience 语料库中的事实。然而,其幻觉率为 86%,而 Opus 4.7(最高)为 36%,Gemini 3.1 Pro Preview 为 50%。这使得它在不知道答案时更倾向于回答问题。相比 GPT-5.4(极高),AA-Omniscience 提升 14 分主要来自知识增长,幻觉改善不大。

祝贺 OpenAI 团队和 @sama 发布新模型。
动态Artificial Analysis2026-04-23原文

相关内容