动态

Gemini 3.0 Flash测试得分优异,接近GPT-5.2。

Gemini 3.0 Flash测试得分优异,接近GPT-5.2。
NomoreID
Gemini 3.0 Flash 在我的一个 vibe 测试(韩国 Sator Square 测试,KSST)中取得了非常令人印象深刻的 161.8/190 分,在我目前测试过的所有模型中排名第二或第三。

这略高于 Gemini 3.0 Pro,差异在误差范围内。

以下是一些我认为值得注意的观察:

1. Gemini 3.0 Flash (Low) 似乎具有令牌效率。即使在 Low 设置下,它也获得了 158.6/190 分,属于顶尖水平。这是一个出色的结果,仅用了 2,394 个总令牌(推理 + 输出),与其他顶级模型相比非常有竞争力。

2. 尽管 Low 推理设置仍然产生了强劲的分数,但它偶尔在某些定量评估指标上出现错误。然而,在 High 设置下,它在所有定量指标上都取得了满分,零错误。这一表现只有 GPT-5.2 High 能够匹敌。

3. Gemini 3.0 Flash (High) 相比 Gemini 2.5 Flash (reasoning) 提升了惊人的 60 分 (!)。

总体而言,结果远超我的预期,我对其印象深刻,并期待探索将其用于生产环境。

感谢 @GoogleDeepMind 的出色工作。
动态NomoreID2025-12-17原文

相关内容