动态

Gemini 3 Pro在多项基准测试中领先,但定价高昂

Gemini 3 Pro在多项基准测试中领先,但定价高昂
Artificial Analysis
Gemini 3 Pro 是人工智能领域的新领导者。谷歌首次拥有领先的语言模型,Gemini 3 Pro 在我们的 Artificial Analysis Intelligence Index 中首发即比 GPT-5.1 高出 3 分。@GoogleDeepMind 向我们提供了 Gemini 3 Pro Preview 的预发布访问权限。该模型在 Artificial Analysis Intelligence Index 中超越了所有其他模型。它在各项评估中表现出色,在构成 Intelligence Index 的 10 项评估中有 5 项排名第一。尽管智能水平提升,Gemini 3 Pro Preview 相比 Gemini 2.5 Pro 在令牌效率上有所改进,在 Intelligence Index 上使用的令牌数显著少于 Kimi K2 Thinking 和 Grok 4 等其他领先模型。然而,由于其高昂的定价(上下文低于 200K 时每百万输入/输出令牌 $2/$12),Gemini 3 Pro 是运行我们 Intelligence Index 评估成本最高的模型之一。关键要点:📖 领先智能:Gemini 3 Pro Preview 在 Artificial Analysis Intelligence Index 的 10 项评估中有 5 项领先,包括 GPQA Diamond、MMLU-Pro、HLE、LiveCodeBench 和 SciCode。它在 Humanity's Last Exam 上取得 37% 的得分尤其令人印象深刻,比之前的最佳模型提升了超过 10 个百分点。它还在 AA-Omniscience(Artificial Analysis 新的知识和幻觉评估)中领先,在 Omniscience Index(我们的主要指标,对错误答案扣分)和 Omniscience Accuracy(正确率)上均排名第一。鉴于事实回忆与模型大小密切相关,这可能表明 Gemini 3 Pro 比其竞争对手大得多。💻 高级编码和代理能力:Gemini 3 Pro Preview 在 Artificial Analysis Intelligence Index 的三项编码评估中领先两项,包括在 SciCode 上取得令人印象深刻的 56%,比此前最高分提升了超过 10 个百分点。它在代理场景中也很强大,在 Terminal-Bench Hard 和 Tau2-Bench Telecom 上取得了第二高的分数。🖼️ 多模态能力:Gemini 3 Pro Preview 是一个多模态模型,能够接收文本、图像、视频和音频作为输入。它在 MMMU-Pro(一个测试图像输入推理能力的基准)上得分最高。谷歌目前在 MMMU-Pro 排行榜上占据第一、第三和第四位(GPT-5.1 上周才占据第二位)。💲 高级定价:为了衡量成本,我们报告了运行 Artificial Analysis Intelligence Index 的成本,该成本结合了输入和输出令牌价格与令牌效率,以反映真实使用成本。尽管令牌效率相比 Gemini 2.5 Pro 有所提升,但 Gemini 3 Pro Preview 的运行成本更高。其更高的令牌定价(上下文 ≤200K 时每百万输入/输出令牌 $2/$12)导致运行 Artificial Analysis Intelligence Index 的成本相比前代增加了 12%,并且该模型是我们 Intelligence Index 上运行成本最高的模型之一。谷歌还继续对长上下文工作负载定价更高,上下文 ≥200K 时每百万输入/输出令牌收费 $4/$18。⚡ 速度:Gemini 3 Pro Preview 的速度与 Gemini 2.5 Pro 相当,每秒输出 128 个令牌。这使其领先于其他前沿模型,包括 GPT-5.1(高)、Kimi K2 Thinking 和 Grok 4。这可能得益于谷歌的第一方 TPU 加速器。其他细节:Gemini 3 Pro Preview 拥有 100 万令牌的上下文窗口,并支持工具调用、结构化输出和 JSON 模式。请参阅下方进一步分析。
动态Artificial Analysis2025-11-18原文

相关内容