动态

Kimi K3模型发布,性能接近顶级,计划开源

Kimi K3模型发布,性能接近顶级,计划开源
Kimi.ai
RT @ArtificialAnlys: Kimi K3 在 Artificial Analysis 智能指数上得分为57。其智能水平与 Opus 4.8 和 GPT-5.5 相当,但落后于 Fable 5 和 GPT-5.6 Sol。Moonshot AI 表示计划发布该 2.8T 参数模型的权重,这将使其成为领先的开源权重模型。

关键结果:

➤ 强大的智能体任务性能:@Kimi_Moonshot 的 Kimi K3 在 GDPval v2 上达到了 1668 的 Elo 评分。相比 K2.6 的 1190 有显著提升,超过了 GLM-5.2 (1514)、GPT-5.5 (1494) 和 Claude Opus 4.8 (1600)。然而,仍落后于 Claude Fable 5 (1760)。Kimi K3 还以 53% 的得分在 AutomationBench-AA(我们实现的 Zapier 智能体 SaaS 工作流评估)上排名第一。

➤ 在 AA-Briefcase(智能体知识工作)上表现第二:在我们私有的长周期知识工作评估中,Kimi K3 总体 Elo 达到 1547,比 Kimi K2.6 高出 732 分,仅次于 Claude Fable 5。它表现全面:其评分标准和分析质量几乎达到 Claude Fable 5 的水平,而 GPT-5.6 Sol 在演示质量上继续领先。

➤ 权重发布后将引领开源权重模型:Moonshot AI 尚未发布权重,但已表示计划这样做。一旦可用,Kimi K3 将明显领先其他开源权重模型,包括 GLM-5.2 (51) 和 DeepSeek v4 Pro (44)。然而,其 2.8T 参数规模远大于其他开源权重模型(如 GLM-5.2 的 753B 参数和 DeepSeek V4 Pro 的 1.6T),以及 Kimi K2 到 K2.6 模型(1T 参数)。

➤ 每任务成本 ($0.94) 与 GPT-5.6 Sol ($1.04) 相近,约为 Opus 4.8 ($1.80) 的一半,高于开源权重同行:Moonshot AI 对 K3 的定价显著高于其 K2 定价(K3 的输出 token 价格为 $15/1M tokens,而 K2.6 为 $4)。这使得该模型在每任务成本上比 Opus 4.8 便宜,与 GPT-5.6 Sol ($1.04) 相近,但比开源权重同行 GLM-5.2 ($0.32) 和 DeepSeek V4 Pro ($0.04) 贵。

➤ 在更高智能的同时提升了 token 效率:Kimi K3 在 Artificial Analysis 智能指数上的 token 使用量显著减少,输出 token 比 K2.6 少 21%。新模型完成全部九项评估约使用 1.32 亿输出 token,而 K2.6 约为 1.66 亿,同时获得了更高分数。

➤ 原生多模态能力:Kimi K3 与 K2.6 一样,支持原生图像和文本多模态输入。如果权重发布,Kimi K3 将成为领先的具有多模态输入能力的开源权重模型之一。

其他模型详情:

上下文窗口:1M

规模:2.8T 总参数

定价:第一方 API 定价为每 1M 输入/输出 token $3.00/$15.00,缓存输入享受 90% 折扣至每 1M token $0.30。

模态:原生多模态输入支持文本和图像,输出仍仅为文本。

可访问性:发布时可通过 Moonshot 的第一方 API 访问。模型权重尚未发布,但 Moonshot AI 已表示计划这样做。
动态Kimi.ai2026-07-17原文

相关内容