Kimi K3 在 DeepSWE 评测中表现接近 Claude Fable 5,成本仅三分之一
Kimi K3 在 DeepSWE 上以接近 Claude Fable 5 的质量和三分之一成本展现了高性价比,尤其多次尝试时表现更优。
在软件工程基准测试 DeepSWE 上,开源模型 Kimi K3 的单次通过率(68.5%)略低于 Claude Fable 5(69.9%),但允许多次尝试后反超(pass@4 89.4% vs 88.5%)。Kimi K3 每次任务成本仅 4.65 美元,约为 Fable 5 的三分之一,每美元解决任务数多 2.8 倍。不过 Fable 5 更稳定,四次全对的任务数更多(58 vs 45)。
正文摘录
Key Takeaways Kimi K3 在质量上与 Claude Fable 5 持平,每个已解决问题成本仅为后者的三分之一,而且作为开放模型,团队可完全掌控部署。 - Kimi K3 与 Claude Fable 5 在 DeepSWE 的 pass@1 上非常接近:Fable 以 69.9% 领先,Kimi 为 68.5%,差距仅 1.4 个百分点。 - 给模型更多尝试次数后,Kimi K3 反超。它在 pass@2(82.0 vs 80.2)和 pass@4(89.4% vs 88.5%)上胜出。 - Kimi K3 便宜得多:每个 rollout 成本 4.65 美元对比 13.41 美元,每美元解决的 task 数量是前者的 2.8 倍。 - Claude Fable 5 更可靠:它四次尝试全部解决的 task 更多(58 个 vs 45 个)。 在我们对 Kimi K3 和 Claude Fable 5 在 DeepSWE 上的比较中(该基准测试跨多种任务类型和编程语言评估模型的软件工程能力),本月最有趣的模型并非排行榜榜首那个,而是 Kimi K3 —— 这个新的开源权重模型,仅落后 Claude Fable 5 1.4 个百分点,价格却只有三分之一。 Kimi K3 于 2026 年 7 月 16 日登上 DeepSWE,以最大 effort 模式进行了 452 次 graded rollout:113 个来自活跃开源仓库的真实长周期功能需求,每个试验 4 次,由隐藏的测试套件以 pass/fail 评分。我们将所有结果与 Claude Fable 5 在其最佳设置(xhigh)下进行了对比,xhigh 是 Anthropic 最强配置,也是此前的基准测试领先者。