行业新闻

Sakana AI 发布 Fugu 系统:跑分靠调用 GPT-5.5 与 Opus 4.8,非自身模型能力

Sakana AI 发布 Fugu 系统:跑分靠调用 GPT-5.5 与 Opus 4.8,非自身模型能力

Fugu 通过调度 GPT-5.5 和 Opus 等模型取得高分,但质量未超越被调模型,本质是租来的胜利。

Sakana AI 的 Fugu Ultra 号称在多项基准测试中超越 GPT-5.5、Opus 4.8 等前沿模型,但真相是它作为一个“多智能体编排系统”,底层动态调用这些模型协同答题,跑分实为“租来的胜利”。社区实测发现,虽然速度更快、成本更低,但生成质量仍不及被调用的 Fable 5。

正文摘录

![](https://aiera.com.cn/wp-content/uploads/2026/06/aieraimg9a3654227e.png) 新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/06/aieraimg3b253ef414-259.png) 【新智元导读】 都当它是碾压 GPT、Opus 的新模型,它的真实身份却是个调度层。它打败的那几个,正是它雇来答题的那几个。 6 月 12 日,美国一纸出口管制令,逼 Anthropic 把最强的两款模型 Fable 5 和 Mythos 从全球下架。 10 天后,位于日本东京的 Sakana AI 放出新产品 Fugu 和旗舰版 Fugu Ultra,称自己已经与 Fable、Mythos 并肩,可以带给用户前沿大模型的能力,又不必担出口管制的风险。 在 Sakana AI 官网贴出的一张跑分表里,fugu-ultra 几乎一路飘红:GPQA-D 95.5、LiveCodeBench 93.2、TerminalBench 82.1,多项跑分冲到全场最高。 被它甩在身后的,是 Gemini 3.1 Pro、GPT 5.5、Opus 4.8 (max) 这些当下最前沿的模型。 ![](https://aiera.com.cn/wp-content/uploads/2026/06/aieraimga4a3274906.png) Sakana 官方跑分图,红色为 Fugu/Fugu Ultra,灰色为基线模型。fugu-ultra 在 GPQA-D(95.5)、LiveCodeBench(93.2)等多项登顶,但 SWE-bench Pro 一栏,被不在它调用池里的 Fable 5 以 80.0 反超。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-06-28原文

相关内容