行业新闻

AI SSD 转向推理数据层:KV Cache 成为一级资源

推理状态成为一级资源,存储进入 Token 生成主链路。Mooncake 与 CMX 标志 AI 基础设施新阶段。

大模型推理正从“堆算力”转向协同计算、网络、内存与存储。月之暗面 Mooncake 与 NVIDIA CMX 均把 KV Cache(推理过程中的键值缓存)纳入分布式调度,SSD 不再只是模型启动前的文件来源,而成为影响 TTFT(首 token 延迟)与吞吐的实时数据层。

正文摘录

过去两年,AI 基础设施领域的竞争主要围绕 GPU 数量、芯片算力、HBM 带宽和高速网络展开。 然而,随着大模型进入长上下文、复杂推理和多智能体阶段,决定一套系统最终能产出多少有效 Token 的因素正变得日益复杂。 GPU 依然是算力底座,但其实际利用率越来越取决于模型权重、KV Cache 和 MoE 专家能否在正确的时间到达正确的计算节点。 AI 基础设施(AI Infra)由此正从“堆叠计算资源”进入“协同计算、网络、内存与存储数据路径”的新阶段。 月之暗面的 Mooncake 项目与 NVIDIA 推出的 CMX,构成了这一变化的两个代表性信号。 月之暗面从大规模推理软件架构出发,将分散在集群中的 CPU、DRAM、SSD 和 NIC 组织为可调度的 KV Cache 资源池; NVIDIA 则进一步在 Vera Rubin 基础设施中建立了专门的 Pod 级 Flash 上下文层。 推理状态正在成为 AI 基础设施中的一级资源,存储也开始进入 Token 生成的实时主链路。 Mooncake 最重要的产业意义,并不只是为 Kimi 构建了一套新的推理服务系统,更在于改变了大规模模型基础设施对“数据”的组织方式。 传统推理节点往往把 GPU、CPU、DRAM 和本地 SSD 视为一台服务器内部的固定资源,KV Cache 主要跟随请求和 GPU 实例存在;一旦缓存被驱逐或请求发生迁移,已经完成的 Prefill 计算便可能失去复用价值。 Moonshot AI 与清华大学发表于 USENIX FAST '25 的 Mooncake 采用以 KV Cache 为中心的分离式架构,将 Prefill 与 Decode 部署在不同资源池中,并把 GPU 集群中未被充分利用的 CPU、DRAM、SSD 和 NIC 组织成分布式 KV Cache 池。

阅读原文(qbitai.com)→

行业新闻思邈2026-08-07原文

相关内容