论文

Kimi K3: Open Frontier Intelligence

Kimi K3: Open Frontier Intelligence

我们提出 Kimi K3,一个 2.8T 参数 Mixture-of-Experts 模型,具有 104B 激活参数、原生视觉能力和 百万 token 上下文窗口。 Kimi K3 建立在 Kimi Delta Attention 和 Attention Residuals 之上,改善了序列长度和模型深度的信息流动;结合 Stable LatentMoE(每 token 有效激活 896 个路由专家中的 16 个)以及改进的训练和数据配方,整体扩展效率相比 Kimi K2 提升约 2.5 倍。后训练阶段重点在通用、智能体和编程领域进行强化学习,并支持多种推理努力级别,从而实现组合泛化和稳健的长期执行。 在 2.8T 规模下,Kimi K3 获得基础设施多方面支持:用于 KDA 的算法-系统协同设计、完全平衡的专家并行训练及高效内存管理、百万 token 智能体强化学习(持续 rollouts 和沙箱状态),以及部署创新。大量评估显示,Kimi K3 在长期编程、智能体、知识、推理和视觉任务上达到前沿水平。尽管整体性能仍落后于最强大的专有模型 Claude Fable 5 和 GPT-5.6 Sol,但 Kimi K3 持续优于我们测试套件中的其他开放和专有模型。我们发布完整的 Kimi K3 模型权重,以促进未来研究并加速前沿智能的广泛部署与采用。

论文精读

TL;DR Kimi K3 是 2.8T 参数的 MoE 模型,通过 Delta Attention 与 Stable LatentMoE 将扩展效率提升约 2.5 倍,结合多领域强化学习后训练,在编程、智能体等任务达到前沿水平,并开放权重。

问题

问题背景

当前大语言模型(LLM)研究聚焦于万亿级参数规模、原生多模态、超长上下文窗口与更强的推理和决策能力。如何高效扩展模型容量,同时在长程编码、智能体任务和复杂推理场景中保持鲁棒表现,是推动前沿智能开放化的关键课题。

现有方法局限

传统Dense模型在扩展时面临计算与显存的平方级增长,成本难以承受。标准混合专家(MoE)虽解耦参数与计算量,但常出现专家负载不均、训练不稳定、通信开销大等问题。长上下文处理中,常规注意力机制容易丢失远端信息,且难以在强化学习框架下高效维护百万级token的agent轨迹与状态。后训练阶段,多数模型缺乏对多推理深度、跨领域(通用、编码、智能体)的统一强化学习策略,造成知识迁移和长程规划能力不足。

为什么这个问题难/重要

将模型扩展至2.8T参数、1M上下文并维持训练稳定与推理效率,需要深度的算法-系统协同设计:例如全新的注意力结构(KDA)、精准的专家并行负载均衡和内存管理。在百万级token的智能体强化学习中实现持久化rollout与沙盒状态同步,对基础设施和训练配方构成严峻挑战。实现约2.5倍的扩展效率提升是开源模型追赶闭源前沿的关键一步,直接关系到未来AI能否可靠执行长期、多步骤的复杂任务。

行业类比

这类似乎为大型软件工程构建一个能长期维护代码仓库的AI助手:不仅要理解新写入的代码,还需持续关联历史架构,在多步重构中保持决策连贯性——这正是长程agent任务的核心障碍。

核心洞察

  • **Stable LatentMoE 与极小专家激活率** 通过从 896 个路由专家中仅激活 16 个,在 2.8T 参数规模下实现了计算与容量的精细解耦。相比于稠密模型或传统 MoE(如 Kimi K2)每 token 需动用大量专家,这种稀疏设计使扩展效率提升约 2.5 倍,且配合训练配方的改进,直接降低了前沿模型训练所需的总吞吐与能耗。对大规模训练系统的启示在于:专家容量不必随总参数线性增长,关键在于稳定路由和负载均衡的协同优化,这为用有限预算训练超大规模模型提供了新范式。
  • **Kimi Delta Attention 与 Attention Residuals 的深度-长度联合设计** 将长上下文信息流和模型深度中的梯度传播统一为注意力机制的变体,而非简单堆叠 Transformer 层或引入外部记忆。百万 token 窗口与算法-系统 co-design 结合,使得长程 agentic RL(强化学习)能在持久 rollout 及沙盒状态下进行,而不损失训练吞吐。这使得模型在长时程编码、agentic 任务中的稳健执行能力显著超越其他开源模型,逼近最强闭源系统,同时证明了通过注意力架构创新突破上下文长度瓶颈的工程可行性。
  • **多域、多推理努力的强化学习策略** 通过在通用、agentic、编码等不同领域,以及多种推理计算量水平上进行后训练,实现了组合泛化和长期稳定执行。这区别于仅优化单一基准或采用固定长度 CoT 的方法,它迫使模型学会在不同复杂度任务间动态分配思考强度,从而在知识、推理、视觉任务中均获得前沿水平表现。该策略对工程落地的意义在于,它提供了一种统一的 RL 训练框架,使单一模型能够胜任从快速回答到深度推理的多样化场景,为平衡服务延迟与输出质量提供了参考。

方法

输入与架构概述

Kimi K3 是一款 2.8 万亿参数 的 Mixture-of-Experts (MoE) 模型,每次前向仅激活 1040 亿 参数,原生支持图像与文本的多模态输入,并将上下文窗口扩展至 100 万 token。其设计重点在于改善长序列中的信息流动与训练稳定性。

关键模块:Kimi Delta Attention 与 Attention Residuals

为缓解长上下文建模中注意力机制的衰减问题,模型提出 Kimi Delta Attention (KDA)。该机制通过计算相邻层间注意力输出的差分,放大跨层变化量,从而使远距离依赖的传递更高效,避免传统自注意力在极长序列上的信息丢失。同时引入 Attention Residuals,在注意力子层间嵌入额外残差连接,强化跨深度梯度传播,提升深层表示质量与训练稳定性。

MoE 路由:Stable LatentMoE

在 MoE 层,Kimi K3 采用 Stable LatentMoE 策略。每个 token 从 896 个路由专家中激活 16 个,选择过程在低维潜在空间完成,并结合负载均衡损失与辅助稳定约束,有效防止专家坍塌。这一设计与精炼的训练数据配方相配合,带来约 2.5 倍 的整体扩展效率提升(相较于前代 Kimi K2)。

后训练与强化学习

后训练阶段引入覆盖 通用、智能体、编码 三大领域的 强化学习 (RL),并支持多种 推理努力级别(reasoning effort levels),使模型能根据任务复杂度动态调整计算预算。借助持久化 rollout 与沙箱状态快照,实现了百万 token 级别的智能体长时域训练,显著增强组合泛化性与鲁棒执行能力。

与同类方法的差异

不同于常规 MoE 模型仅依赖静态 top‑k 门控,Kimi K3 将 KDA 与 Attention Residuals 的结构化改进同 潜在路由 Stable LatentMoE 深度协同,在超长上下文建模与训练稳定性之间取得更好平衡,并通过后训练阶段的 多努力级别 RL 实现更高效的推理成本控制。

实验

实验设计

Kimi K3 的评测覆盖 长程编码、智能体、知识、推理、视觉 五大领域,均在百万 token 上下文窗口下进行。后训练阶段引入了 通用、智能体、编码 三个领域的强化学习,并设置了多种推理努力级别,以检验模型的组合泛化与稳健长程执行能力。对比基线包括开源模型及其他闭源模型,以及当前最强的闭源模型 Claude Fable 5 与 GPT-5.6 Sol。

关键发现

K3 在所有评测领域均达到前沿水平,且一致优于其他开源与闭源基线。但与顶尖闭源模型相比,其整体性能仍有差距,表明扩展法则的边际收益仍在延续,但架构与数据差异可能造成短期的性能鸿沟。值得注意的是,K3 的扩展效率相较上一代 K2 提升了约 2.5 倍,这得益于 KDA 注意力、KAR 残差连接与 Stable LatentMoE 等架构创新。后训练的多阶段 RL 使模型在复杂智能体与编码任务中展现出更强的任务分解与持续规划能力。

对比解读

K3 的突出点在于其在开放模型中的表率表现,成功将参数效率与长程记忆结合,缩小了与最顶尖闭源模型的差距。然而,Claude Fable 5 与 GPT-5.6 Sol 在部分高难度推理与知识密集型任务上仍保持优势,可能归因于其更大的高质量数据工程投入、精调的奖励建模或更庞大的强化学习预算。K3 的弱项则提示:在追求极致性能时,后训练的对齐与推理优化需要同样重量级的资源匹配,而不仅仅是模型规模的扩大。

行业影响

落地场景

Kimi K3 的 1M 超长上下文、原生视觉能力与多领域强化学习使其适用于:

  • 长周期自主智能体:在代码库级维护、自动化 DevOps 中,可直接处理完整代码仓库与历史日志,生成跨文件的修复方案或自动化 Pipeline,例如对微服务架构的持续集成故障进行端到端诊断。
  • 多模态知识工作台:结合视觉与长文本,在法律、医疗、金融领域可解析扫描件、财报图表与千万级字数的合同/病历,生成结构化摘要与合规检查,服务于企业知识管理或审计场景。
  • 交互式代码助手:在编程教育或技术客服中,模型可基于全量文档与用户环境快照提供多轮调试建议,减少人工介入。

商业价值

  • 降本:Stable LatentMoE(每 token 仅激活 16/896 专家)和 Kimi Delta Attention(KDA)使训练与推理效率相比前代提升约 2.5 倍,大幅降低单次调用成本,为大规模 SaaS 部署提供可能。
  • 增收:在电商推荐、内容平台个性化中,长上下文可融入用户长期行为序列,提升转化率与用户时长。例如,基于完整浏览历史与商品视觉信息生成实时穿搭推荐,带动客单价提升。
  • 体验升级:原生视觉与多级推理能力使产品交互更自然。在自动驾驶数据标注平台中,模型可解析长序列点云与视频,生成更准确的长时序场景描述,减少人工校验工作量,提升标注一致性。

与现有产品/工作流的接口

模型以 开源权重 发布,可通过 Transformers 或 vLLM 部署为自托管推理服务,与企业内部工具链集成:

  • LLM Agent 框架(LangChain、AutoGPT 等)可直接调用 Kimi K3 的 tool_use 能力,将长上下文记忆与工具并行调用结合,用于客服工单自动填单或供应链异常检测。
  • 检索增强生成(RAG)管道:其 1M 窗口允许直接在 Prompt 中放入完整知识库,简化分块与检索逻辑;结合 Attention Residuals,可保留更准确的上下文引用,适用于法律条文对比或医学文献循证。
  • 多模态数据管道:利用原生视觉能力,可将 PDF/图片 OCR 与理解合为一体,在文档数字化流水线中减少独立视觉模型的调用,降低延迟与维护成本。

具体场景

  1. 医疗影像与病历联合分析:放射科医生上传 CT 序列与电子病历,模型一次性处理数百页病史与影像,识别病灶演变并输出结构化报告,辅助远程会诊。
  2. 电商直播实时选品建议:基于主播实时画面与历史销售数据(百万级商品记录),模型在数秒内推荐接下来展示的商品组合,并生成推销话术,提升直播转化率。

局限

  • - **整体性能仍落后于顶级闭源模型**:论文明确承认 Kimi K3 在综合评测中不及 **Claude Fable 5** 与 **GPT-5.6 Sol**,尤其在部分长程推理和高度依赖世界知识的任务上仍有差距。这一差距可能源自闭源模型更激进的 RL 对齐策略、更大规模的私有训练数据以及针对特定评估的优化。对于追求绝对前沿性能的工程团队,Kimi K3 尚无法全面替代最强闭源方案。
  • - **视觉能力仅为原生集成,尚未在多模态基准中达到顶尖**:虽然模型具备原生视觉输入处理能力,但论文未提供与专精多模态模型(如 **GPT-4o**、**Gemini** 系列)的充分头部对比。这可能意味着视觉编码器的设计或模态对齐训练仍有提升空间,在复杂视觉推理、细粒度图像理解等任务上未必能匹敌专用视觉语言模型。
  • - **推理部署的门槛较高**:2.8T 参数的 **MoE** 架构需要复杂的弹性专家并行策略与先进的内存管理,即使开源权重,社区复现与部署仍需大规模 GPU 集群(如多个节点的 **H100** 互联)。这对资源有限的团队可能并不友好,且在单机或多机低带宽环境下,长上下文服务时延与吞吐可能难以达到实用水平。
论文Kimi Team2026-07-27原文

相关内容