Gemini 3.0 Flash测试得分优异,接近GPT-5.2。
Gemini 3.0 Flash 在我的一个 vibe 测试(韩国 Sator Square 测试,KSST)中取得了非常令人印象深刻的 161.8/190 分,在我目前测试过的所有模型中排名第二或第三。
这略高于 Gemini 3.0 Pro,差异在误差范围内。
以下是一些我认为值得注意的观察:
1. Gemini 3.0 Flash (Low) 似乎具有令牌效率。即使在 Low 设置下,它也获得了 158.6/190 分,属于顶尖水平。这是一个出色的结果,仅用了 2,394 个总令牌(推理 + 输出),与其他顶级模型相比非常有竞争力。
2. 尽管 Low 推理设置仍然产生了强劲的分数,但它偶尔在某些定量评估指标上出现错误。然而,在 High 设置下,它在所有定量指标上都取得了满分,零错误。这一表现只有 GPT-5.2 High 能够匹敌。
3. Gemini 3.0 Flash (High) 相比 Gemini 2.5 Flash (reasoning) 提升了惊人的 60 分 (!)。
总体而言,结果远超我的预期,我对其印象深刻,并期待探索将其用于生产环境。
感谢 @GoogleDeepMind 的出色工作。
这略高于 Gemini 3.0 Pro,差异在误差范围内。
以下是一些我认为值得注意的观察:
1. Gemini 3.0 Flash (Low) 似乎具有令牌效率。即使在 Low 设置下,它也获得了 158.6/190 分,属于顶尖水平。这是一个出色的结果,仅用了 2,394 个总令牌(推理 + 输出),与其他顶级模型相比非常有竞争力。
2. 尽管 Low 推理设置仍然产生了强劲的分数,但它偶尔在某些定量评估指标上出现错误。然而,在 High 设置下,它在所有定量指标上都取得了满分,零错误。这一表现只有 GPT-5.2 High 能够匹敌。
3. Gemini 3.0 Flash (High) 相比 Gemini 2.5 Flash (reasoning) 提升了惊人的 60 分 (!)。
总体而言,结果远超我的预期,我对其印象深刻,并期待探索将其用于生产环境。
感谢 @GoogleDeepMind 的出色工作。