无问芯穹PDD架构:广域网跨集群推理延迟降低51.5%
无问芯穹用三级架构PDD解决了跨集群推理中KV Cache传输延迟问题,大幅降低首字等待时间和成本。
无问芯穹在WAIC上发布跨集群异构推理架构PDD,通过在Prefill与Decode间插入本地RelayDecode实例,仅传Token ID并本地重算KV Cache,将首Token延迟降低51.5%,单Token成本降低37.5%。
正文摘录
“接力跑”盘活全国算力,PD 分离终于破局:延迟砍半、成本直降近 40%! - 来源:量子位 在刚刚落幕的 2026 WAIC 世界人工智能大会上,无问芯穹首次公布了其在大模型推理系统架构中的新突破—— 跨集群异构推理架构 PDD。 技术报告地址:https://github.com/infinigence/pdd 该架构以高性价比的广域网以太网串联多地已建成的同构数据中心,并将传统的 PD 分离链路 “P-D” 创新解构为 “P-RLD-MD” 的三级分离式推理架构。 在让 “偏科” 的硬件能够只刷自己最擅长的题的同时,更突破性解决了以太网环境下 KV Cache 的传输延迟痛点。 实测数据显示,该架构在实现了首 Token 延迟降低 51.5% 的同时,单 Token 成本可降低 37.5% 。 这不仅意味着用户端速度体验得到了显著提升,更实现了全域异构算力的最大化调度,让分散各处的存量集群资源能够充分释放产业价值。 今天,无问芯穹推理团队将首次分享这一架构的设计推演全貌,深度还原技术创新背后的思考路径与攻坚细节。 行业共识在于:LLM 的推理存在 Prefill(预填充,计算密集型)和 Decode(解码,访存密集型)两个特性迥异的阶段。 理论上的最理想的解法是 “异构分离” 路线:让算力强的卡负责 Prefill,让显存带宽高的卡负责 Decode。 要在同一个集群里构建大规模异构算力资源,不仅采购成本极其高昂,且一旦模型架构变了,这些固定配比的硬件就会很容易出现部分闲置的情况。 为什么不把分布在各地的、已经建好的同构集群,用低成本的广域网以太网连起来,做跨集群的异构分离式推理呢? 这一想法看似水到渠成,但一旦将其落到具体工程实践中,便立刻撞上了一堵“叹息之墙”—— KV Cache 的跨集群传输带宽和延迟瓶颈 。