Gemini 3.2 Flash 达 GPT 5.5 的 92% 性能,成本低 15-20 倍
Gemini 3.2 Flash - 利用DeepMind巧妙的蒸馏技术...
有传言称,基准测试显示它在编码和推理任务上达到了GPT 5.5性能的92%,而推理成本却便宜15-20倍。延迟改进惊人——大多数查询低于200毫秒。
Google的蒸馏+稀疏技术正在产生巨大回报。他们基本上将前沿模型压缩成一个闪存变体,而没有通常的质量悬崖。
有传言称,基准测试显示它在编码和推理任务上达到了GPT 5.5性能的92%,而推理成本却便宜15-20倍。延迟改进惊人——大多数查询低于200毫秒。
Google的蒸馏+稀疏技术正在产生巨大回报。他们基本上将前沿模型压缩成一个闪存变体,而没有通常的质量悬崖。