动态

Gemini 4 Argon 发布:智能指数追平 GPT-6 Astra,每任务成本仅 60%,幻觉率最低

Gemini 4 Argon 发布:智能指数追平 GPT-6 Astra,每任务成本仅 60%,幻觉率最低
Demis Hassabis
Google 的新模型 Gemini 4 Argon 在 Artificial Analysis 智能指数上追平 GPT-6 Astra,在折扣价格下每任务成本仅为其 60%。Google 重新回到智能水平前三的实验室之列

Gemini 4 Argon 是 @GoogleDeepMind 七个多月来首个高于 Flash 级别的自研模型。在 high reasoning(可用的最高档)下,它在 Artificial Analysis 智能指数上得分 53,与 GPT-6 Astra(max,53)持平,领先 GPT-6.1 Sol(max,52)1 分,提升主要来自更低的幻觉率和更强的 agentic 能力。

按当前 50% 的价格折扣,且缓存折扣提高到 95%,Gemini 4 Argon 在智能指数上每任务成本为 $1.99,是 GPT-6 Astra(max)的 60%,但为 GPT-6.1 Sol(max)的 2.7 倍。折扣结束后,这一数字将升至 $3.98(约为 GPT-6 Astra(max)的 1.2 倍)。

Gemini 4 Argon 目前正面向选定用户逐步开放,尚未公开发布。50% 折扣属于初期推广。Google 尚未确认推广结束日期

Gemini 4 Argon 在 high reasoning 下的关键基准测试结果:

➤ Google 重回智能水平前三的实验室:Gemini 4 Argon(high)在 Artificial Analysis 智能指数上得分 53,与 GPT-6 Astra(max,53)持平,领先 GPT-6.1 Sol(max,52)1 分。这比 Google 上一个非 Flash 模型 Gemini 3.1 Pro Preview(30)高出 23 分,比 Gemini 3.8 Flash(high)高出 12 分

➤ 50% 的首发折扣让 Gemini 4 Argon 在每任务成本上具备竞争力:按当前折扣价,Gemini 4 Argon(high)在智能指数上每任务成本为 $1.99,在智能水平相当的情况下仅为 GPT-6 Astra(max,$3.26)的 60%。这种成本效率来自更低的 token 单价,而非更少的 token 用量——Gemini 4 Argon 平均每任务输出 62k tokens,而 GPT-6 Astra(max)为 27k。Google 尚未确认推广结束日期,但按标准定价,每任务成本将升至 $3.98

➤ 更强的 agentic 表现:这历来是 Gemini 模型的弱项,Gemini 4 Argon 在各项 agentic 评测中均有改善。它在 AutomationBench-AA 上以 77.5% 排名第一,领先 Claude Sonnet 5.5(max,71.3%)6 个百分点。在 Terminal Bench 4 上,Gemini 4 Argon 达到 57%,相比 Gemini 3.1 Pro Preview 提升 53 个百分点,仅次于 Claude Sonnet 5.5(max,64%)、Claude Opus 5.5(max,60%)和 GPT-6 Astra(59%)。在 AA-Briefcase 上,它达到 1494 Elo。这得益于 65% 的 rubric 通过率,是我们记录到的最高值,但 Analytical Quality(1576 Elo)和 Presentation Quality(1308 Elo)较低

➤ 领先模型中最低的幻觉率:在 AA-Omniscience 上,Gemini 4 Argon 的幻觉率为 15%,是所有在智能指数上得分 45+ 的模型中最低的,而 GPT-6 Astra(max)为 51%,GPT-6.1 Sol(max)为 54%。这意味着 Argon 在不知道答案时更倾向于承认,而不是胡乱猜测。在准确率方面,Gemini 4 Argon 得分 50%,比 Gemini 3.1 Pro Preview 下降 5 个百分点,比 GPT-6 Astra(max,63%)低 13 个百分点。由于准确率略低,其 AA-Omniscience 总分 42 仍与 GPT-6 Astra(43)和 GPT-6.1 Sol(42)基本持平

关键模型详情:

➤ 上下文窗口:1M tokens

➤ 多模态:支持文本、图像、视频和语音输入,输出文本

➤ 定价:标准定价为每 100 万 input/output tokens 收费 $4/$20,目前打 5 折为 $2/$10。缓存输入 tokens 享受 95% 折扣(折扣价下每 100 万 $0.10),高于 Gemini 3.8 Flash 的 90%

➤ Long Decode Continuation:我们用 Long Decode Continuation 测试了 Gemini 4 Argon,这是 Gemini API 的一项新功能,可暂停长响应并在后续调用中续写。这让推理可以输出最多 1M tokens 而不会请求超时
动态Demis Hassabis2026-10-01原文

相关内容