动态

MiMo-V3 新架构 HySparse2 发布,同时优化 prefill、KV cache 与长上下文检索

MiMo-V3 新架构 HySparse2 发布,同时优化 prefill、KV cache 与长上下文检索
Fuli Luo
MiMo-V3 即将采用全新架构。其核心 HySparse2 今天发布。

更少的 prefill、更小的 KV cache、更强的长上下文检索——这三件事我们同时做到了。

与 MiMo-V2.6 的 Hybrid SWA 架构相比:
• 在 1M tokens 时,prefill FLOPs 降低 5.02 倍
• 在 1M tokens 时,KV cache 缩小 4.5 倍
• MRCRv2 与 RULER-v2 分数更高,同时 AgentPPL 和 LongPPL 更低

为什么要构建新架构?
Agentic 推理是一种非常不同的负载。每一轮中,一个简短的动作可能返回一段需要 prefill 的长观察结果,而上下文还在持续增长。这让 prefill 成本、KV-cache 大小和检索准确率同时处在关键路径上。

HySparse2 通过两级 KV 共享同时解决这三个问题:
• KV Bridging:沿用 YOCO 的思路,cross-decoder 中的 full-attention 层从 self-decoder 的隐藏状态构建 K/V。
• KV Reuse:在每个 hybrid block 内,稀疏层复用前一个 full-attention 层的 KV cache 和选择索引。

另外还有两处改动:用 token 级选择替代 block 级选择,用最近 token 的强制窗口替代独立的 SWA 分支,从而让局部 token 与全局 token 共享同一个 KV cache。由于现在所有 cross-decoder KV cache 都来自 self-decoder,只要 self-decoder 完成,prefill 就可以停止。

论文:https://t.co/REeEdd5pL7
动态Fuli Luo2026-09-23原文

相关内容