动态

MiMo-V2.5系列API降价背后的推理优化

Fuli Luo
MiMo-V2.5系列API价格降低背后的推理优化

阅读完整技术博客:https://t.co/B5tp4tdnim

V2.5模型系列,包括MiMo-V2.5和MiMo-V2.5-Pro,基于混合滑动窗口注意力(Hybrid SWA)架构,将KVCache存储压缩到全注意力的约1/7。然而,架构优势很少能直接转化为生产服务的可衡量收益。为了实现这些收益,我们重新设计了KVCache管理、分层缓存和前缀缓存树;解决了SWA KVCache处理中的关键挑战;并优化了调度以及Prefill/Decode流水线。

经过真实生产流量验证,这些优化使有效KVCache容量提升了近5倍,服务器端缓存命中率在主流测试框架中平均达到93%-95%。结合MoE配置调优和多模态推理优化,它们实现了更高效的长上下文推理,并构成了近期API降价的部分基础。
动态Fuli Luo2026-05-30原文

相关内容