动态

IFM 发布 K2-Horizon-36B-A4B,新架构 MoVA 将 MoE 稀疏性引入注意力

IFM 发布 K2-Horizon-36B-A4B,新架构 MoVA 将 MoE 稀疏性引入注意力
Victor M
RT @IFM_AI:K2-Horizon-36B-A4B 在 Artificial Analysis Intelligence Index 上得分 25,与总参数量超过其 20 倍的模型不相上下,而每个 token 只激活 4B 参数。

这些能力来自我们全新的架构 MoVA(Mixture-of-Value Attention),它把基于 MoE 的稀疏性引入到多头注意力中 value 向量的计算里。

它为 LLM 的稀疏性扩展开辟了第二条轴,超越了 FFN 模块中的 MoE。更重要的是,MoVA 具备以下优势:

• 简单,且与高效注意力算法兼容,例如 flash attention、GQA 和稀疏注意力
• 与标准 GQA 相比,不增加额外的 KV cache 开销

K2-Horizon-36B-A4B 可在以下地址获取:https://t.co/lH2BYBdU0a
动态Victor M2026-09-21原文

相关内容