动态

Kimi K3在AA-Briefcase基准测试中仅次于Fable 5,但成本高且耗时

Kimi K3在AA-Briefcase基准测试中仅次于Fable 5,但成本高且耗时
Kimi.ai
RT @ArtificialAnlys: Kimi K3在我们的agentic知识工作基准AA-Briefcase上仅次于Fable 5,但运行成本高于Opus 4.8,平均每个任务接近一小时。

上周@Kimi_Moonshot发布了Kimi K3,一个2.8T参数模型,在Artificial Analysis Intelligence Index上得分为57,与Opus 4.8和GPT-5.5等模型相当。在AA-Briefcase上,Kimi K3的Elo得分为1543,比Kimi K2.6提高了727分,是记录的第二高得分,仅次于Claude Fable 5(1574)。

AA-Briefcase是我们新的专有agentic知识工作基准,在完全私有的真实任务数据集上测试模型,涵盖数千个复杂输入文件。任务需要生成电子表格、演示文稿和UI模型等交付物,性能基于正确性、分析质量和呈现质量合并为单一AA-Briefcase Elo。

Kimi K3在AA-Briefcase上的关键结果:

➤ 仅次于Fable 5:Kimi K3的AA-Briefcase Elo为1543,总体第二高,领先GPT-5.6 Sol(最大1501)、Claude Sonnet 5(最大1388)和Claude Opus 4.8(最大1347)。较上一代Kimi K2.6(816)提高了727分,仅落后于Fable 5。

➤ 客观和分析性能强,呈现相对较弱:Kimi K3的rubric通过率为51%,仅次于Claude Fable 5(56%),领先Claude Sonnet 5(最大42.3%)和GPT-5.6 Sol(最大41.8%)。分析质量Elo为1754,与Claude Fable 5(1744)相当。呈现质量相对较弱,呈现Elo为1471,低于GPT-5.6 Sol(最大1660)和Claude Opus 4.8(最大1492)。

➤ 每个任务成本增加约10倍:Kimi K3平均每个任务成本为10.57美元,较Kimi K2.6增加了约10倍,使其成为AA-Briefcase上运行成本最高的模型之一。这是由于模型token定价、输出token增加和相对较高的轮次使用,平均每个任务83轮,而Claude Fable 5为67轮,GPT-5.6 Sol(最大)为50轮。Kimi K3定价为每百万输入/输出token $3/$15,缓存token享受90%折扣。

➤ 每个任务平均接近一小时:Kimi K3在AA-Briefcase上的平均任务时间为56.4分钟。这是由于轮次多、输出token使用量大以及使用第一方Kimi API速度较慢。
动态Kimi.ai2026-07-22原文

相关内容