动态

跨数据中心Prefill/Decode分离,KV cache优化降低token成本

跨数据中心Prefill/Decode分离,KV cache优化降低token成本
Kimi.ai
我们将Prefill/Decode分离扩展到单个集群之外:跨数据中心+异构硬件,解锁显著降低每token成本的潜力。这之前被KV缓存传输开销所阻碍。关键推动力是我们的混合模型(Kimi Linear),它减少了KV缓存大小,使得跨数据中心PD变得可行。在20倍规模放大的Kimi Linear模型上验证:吞吐量1.54倍,P90 TTFT降低64%→直接转化为更低的token成本。更多详情见Prefill-as-a-Service:https://arxiv.org/html/2604.15039v1...
动态Kimi.ai2026-04-18原文

相关内容