MiMo API降价高达99%,基于KV缓存优化与模型架构创新
关于MiMo API价格降低的背后:最深的价格削减,高达99%,是针对Input(缓存命中)。核心原因是我们推理框架现在支持SWA的分层KV缓存优化。生产推理引擎测试显示,此优化将缓存令牌容量提升了5倍,相当于缓存成本降低80%。结合混合模型中多个Full Attention模块之间的缓存读取重叠,实际成本进一步降低。
Input(缓存未命中)和Output的价格也降低了60%-80%。这主要得益于模型架构带来的极端1:7 Full:SWA稀疏比(70层MiMo-V2.5-Pro的预填充计算大致相当于10层GQA模型)。这使我们的原始推理成本远低于行业平均水平,自然在定价中留有2-3倍的利润空间。这次价格调整只是反映了我们将这些结构性成本效率直接传递给开发者的决定。
以这些新降低的API价格运营,我们的生产推理引擎几乎满负荷运行,我们仍然可以基本达到盈亏平衡。我们之前建议LLM公司不要“盲目降价”正是因为很少有模型架构和推理优化能让API成本不亏损。如果出现更多节省计算和KV缓存的架构,以及更好的推理基础设施来降低API成本,这将形成行业极好的良性循环。
更重要的是,负担得起的高性能模型API将推动真实、持续且大规模的推理需求。这种上游需求拉动整个AI基础设施链的发展——包括芯片、服务器、光模块、PCB、液冷、电源、储能和数据中心——成为AI硬件系统重估的战略支点。长期来看,这为训练和推理流程注入了更可负担和可访问的计算,加速了全球AGI在多个区域和技术路线上并行演进。
更多技术细节,我们稍后将发布详细的博文。
Input(缓存未命中)和Output的价格也降低了60%-80%。这主要得益于模型架构带来的极端1:7 Full:SWA稀疏比(70层MiMo-V2.5-Pro的预填充计算大致相当于10层GQA模型)。这使我们的原始推理成本远低于行业平均水平,自然在定价中留有2-3倍的利润空间。这次价格调整只是反映了我们将这些结构性成本效率直接传递给开发者的决定。
以这些新降低的API价格运营,我们的生产推理引擎几乎满负荷运行,我们仍然可以基本达到盈亏平衡。我们之前建议LLM公司不要“盲目降价”正是因为很少有模型架构和推理优化能让API成本不亏损。如果出现更多节省计算和KV缓存的架构,以及更好的推理基础设施来降低API成本,这将形成行业极好的良性循环。
更重要的是,负担得起的高性能模型API将推动真实、持续且大规模的推理需求。这种上游需求拉动整个AI基础设施链的发展——包括芯片、服务器、光模块、PCB、液冷、电源、储能和数据中心——成为AI硬件系统重估的战略支点。长期来看,这为训练和推理流程注入了更可负担和可访问的计算,加速了全球AGI在多个区域和技术路线上并行演进。
更多技术细节,我们稍后将发布详细的博文。