Google Gemini 3.1 Pro Preview在多项基准测试中领先,性价比高
Google再次成为AI领域的领导者:Gemini 3.1 Pro Preview在Artificial Analysis Intelligence Index中领先,比Claude Opus 4.6高出4分,而运行成本不到后者的一半。
@GoogleDeepMind 提前给予我们访问Gemini 3.1 Pro Preview的权限。它在构成Artificial Analysis Intelligence Index的10项评估中领先6项,且相比Gemini 3 Pro Preview在能力上有显著提升,尤其在推理与知识、编码以及减少幻觉方面进步最大。
Gemini 3.1 Pro Preview依然保持较高的token效率,运行Artificial Analysis Intelligence Index仅需约5700万token(比Gemini 3 Pro Preview多100万),低于其他前沿模型在最大推理设置下的消耗,如Opus 4.6(最大)和GPT-5.2(极高)。结合更低的每token定价,Gemini 3.1 Pro Preview在前沿模型中具有成本效益,运行整个Intelligence Index的成本不到Opus 4.6(最大)的一半,但仍约为领先开源模型GLM-5的2倍。
关键要点:
➤ 更低成本下的顶尖智能:Gemini 3.1 Pro Preview在构成Artificial Analysis Intelligence Index的10项评估中领先6项,运行成本不到来自@OpenAI和@AnthropicAI的前沿模型的一半。它在Terminal-Bench Hard(代理编程)、AA-Omniscience(知识与幻觉)、Humanity's Last Exam(推理与知识)、GPQA-Diamond(科学推理)、SciCode(编程)和CritPt(研究级物理学)中取得最高分。CritPt得分尤为突出,在未发表的研究级物理推理问题上获得18%,比次优模型高出5个百分点以上。
➤ 改进的现实世界代理性能,但未领先:Gemini 3.1 Pro Preview在GDPval-AA(我们的代理评估,聚焦现实任务)中有所改进,但尚未成为该领域的领先模型。其ELO分数比Gemini 3 Pro Preview提高100分至1316,但仍落后于Claude Sonnet 4.6、Opus 4.6、GPT-5.2(极高)和GLM-5。
➤ 领先的编程能力:Gemini 3.1 Pro Preview在Artificial Analysis Coding Index中领先,在Terminal-Bench Hard(54%)和SciCode(59%)中均取得最高分。
➤ 减少幻觉:Gemini 3.1 Pro Preview在不知道答案时猜测错误的倾向大幅改善,其AA-Omniscience幻觉率比Gemini 3 Pro Preview降低了38个百分点。
➤ 保持token和成本效率:Gemini 3.1 Pro Preview在成本或token使用没有实质性增加的情况下实现改进。运行Artificial Analysis Intelligence Index仅比Gemini 3 Pro Preview多消耗约2%的token,并保持相同定价(≤20万上下文时为每百万输入/输出token $2/$12)。其运行Artificial Analysis Intelligence Index的成本为892美元,不到Opus 4.6(最大)和GPT-5.2(极高)等前沿模型的一半,但仍约为领先开源模型GLM 5(547美元)的2倍。
➤ Google在多模态领域占据前三:Gemini 3.1 Pro Preview在我们的多模态理解与推理基准MMMU-Pro中排名第一,领先于Gemini 3 Pro Preview和Gemini 3 Flash,巩固了Google在多模态推理领域的领导地位。
➤ 其他模型细节:Gemini 3.1 Pro Preview保留了与其前身相同的100万token上下文窗口,并支持工具调用、结构化输出和JSON模式。
@GoogleDeepMind 提前给予我们访问Gemini 3.1 Pro Preview的权限。它在构成Artificial Analysis Intelligence Index的10项评估中领先6项,且相比Gemini 3 Pro Preview在能力上有显著提升,尤其在推理与知识、编码以及减少幻觉方面进步最大。
Gemini 3.1 Pro Preview依然保持较高的token效率,运行Artificial Analysis Intelligence Index仅需约5700万token(比Gemini 3 Pro Preview多100万),低于其他前沿模型在最大推理设置下的消耗,如Opus 4.6(最大)和GPT-5.2(极高)。结合更低的每token定价,Gemini 3.1 Pro Preview在前沿模型中具有成本效益,运行整个Intelligence Index的成本不到Opus 4.6(最大)的一半,但仍约为领先开源模型GLM-5的2倍。
关键要点:
➤ 更低成本下的顶尖智能:Gemini 3.1 Pro Preview在构成Artificial Analysis Intelligence Index的10项评估中领先6项,运行成本不到来自@OpenAI和@AnthropicAI的前沿模型的一半。它在Terminal-Bench Hard(代理编程)、AA-Omniscience(知识与幻觉)、Humanity's Last Exam(推理与知识)、GPQA-Diamond(科学推理)、SciCode(编程)和CritPt(研究级物理学)中取得最高分。CritPt得分尤为突出,在未发表的研究级物理推理问题上获得18%,比次优模型高出5个百分点以上。
➤ 改进的现实世界代理性能,但未领先:Gemini 3.1 Pro Preview在GDPval-AA(我们的代理评估,聚焦现实任务)中有所改进,但尚未成为该领域的领先模型。其ELO分数比Gemini 3 Pro Preview提高100分至1316,但仍落后于Claude Sonnet 4.6、Opus 4.6、GPT-5.2(极高)和GLM-5。
➤ 领先的编程能力:Gemini 3.1 Pro Preview在Artificial Analysis Coding Index中领先,在Terminal-Bench Hard(54%)和SciCode(59%)中均取得最高分。
➤ 减少幻觉:Gemini 3.1 Pro Preview在不知道答案时猜测错误的倾向大幅改善,其AA-Omniscience幻觉率比Gemini 3 Pro Preview降低了38个百分点。
➤ 保持token和成本效率:Gemini 3.1 Pro Preview在成本或token使用没有实质性增加的情况下实现改进。运行Artificial Analysis Intelligence Index仅比Gemini 3 Pro Preview多消耗约2%的token,并保持相同定价(≤20万上下文时为每百万输入/输出token $2/$12)。其运行Artificial Analysis Intelligence Index的成本为892美元,不到Opus 4.6(最大)和GPT-5.2(极高)等前沿模型的一半,但仍约为领先开源模型GLM 5(547美元)的2倍。
➤ Google在多模态领域占据前三:Gemini 3.1 Pro Preview在我们的多模态理解与推理基准MMMU-Pro中排名第一,领先于Gemini 3 Pro Preview和Gemini 3 Flash,巩固了Google在多模态推理领域的领导地位。
➤ 其他模型细节:Gemini 3.1 Pro Preview保留了与其前身相同的100万token上下文窗口,并支持工具调用、结构化输出和JSON模式。