Kimi K3 开源,2.8万亿参数规模是 GPT-2 的 22580 倍
七年模型参数膨胀22580倍,Kimi K3开源揭晓MoE架构演进与不变的核心。
月之暗面开源近3万亿参数的MoE模型Kimi K3(混合专家架构,2.8万亿参数,支持100万token上下文),博主用48小时拆解从GPT-2到K3的7年技术谱系,发现规模暴涨22580倍,但核心Transformer架构未变。
正文摘录
 最近,月之暗面 kimi 正式开源 Kimi K3 完整模型权重,Kimi K3 是一款总参数量达 2.8 万亿、上下文窗口达 100 万 token 的 MoE 大模型,更是全球首个落地的近 3 万亿参数级开源大模型,引起业界热议。 其中一个博主 ali@waterloointern 意识到,其实从 2019 年 OpenAI 发布的参数量约 1.24 亿的 GPT-2,到 2026 年 2.8 万亿参数量的 Kimi K3, 只有短短七年的时间,但两个模型规模相差 22580 倍! 简单换算, 相当于把大约 22580 个 GPT-2 Small 装进一个 Kimi K3 。 这引起了他的好奇:「但这一切,真的只是规模变大了吗?」 对此,ali 称自己花了约 48 小时阅读 Kimi K3 的建模代码和 8 篇论文,最终理清了从 2019 年 GPT-2 到 Kimi K3 的完整技术谱系。「我将带你回顾我们是如何一步步走到今天,以及从 GPT-2 到 Kimi K3,模型究竟发生了多少变化?又有哪些东西其实始终没有改变?我们会沿着这条技术演进路线,梳理最终通向 Kimi K3 的几次关键架构升级。