行业新闻

无问芯穹发布跨集群异构PD分离架构,推理效率提升

无问芯穹PDD架构通过跨集群PD分离,大幅降低推理延迟和成本,为智能体时代的Token生产提供高效基础设施。

大模型推理有两个阶段:Prefill(计算密集)和Decode(访存密集)。无问芯穹的跨集群异构PD分离架构(PDD)把二者解耦到不同集群,通过中继解码层减少跨数据中心传输延迟,首Token延迟降低51.5%,单Token成本降低37.5%,解决了智能体时代推理系统的乘法级延迟问题。

正文摘录

跨集群异构 PD 分离 WAIC 首发,专访无问芯穹李秀红:Token 工厂「超级管线」的落地路径 编辑|Panda 一次 Agent 任务,用户等的从来不是「一句话」。智能体是「一问、多轮、带着上文反复回来」。执行过程中,每一轮几秒钟的延迟,乘上工具调用带来的几十轮交互,最终会在整个工作流上累积成十几分钟的劣化。在智能体时代,推理系统面对的不再是一道加法题,而是一道乘法题。 与此同时,能用来做这道乘法题的算力却仅以线性的速度增长。因此,供需之间的缺口是结构性的,不会随着某一轮扩产而消失。 就在这道缺口最紧张的地方,无问芯穹给出了自己的答案。在 7 月 20 日 2026 年世界人工智能大会上,无问芯穹联合创始人兼 CEO 夏立雪首次公布了无问芯穹 「前店后厂一中心」的 Agentic Infra 战略布局。 ![图片](https://mmbiz.qpic.cn/szmmbizjpg/5L8bhP5dIqGnicokf9sgia1PcKgyPnSBzZQaQh7kDR4yJKP5iabIpVEE4Hxv424voY0J3y9j9H42RJzJ5UUXPnvJuib05ibDkH2IdlhKdAhUUTnI/640?wxfmt=jpeg&from=appmsgimgIndex=1) 该战略基于 「规模」 与 「效率」 两大锚点,涵盖三大核心板块: - 「算力集散中心」:即 Agentic Infra 自主式基础设施平台,核心目标是最大化智能资源规模,把散落的、异构的算力资源统一汇聚、弹性调度、按需利用,为模型与应用层筑牢充足、稳定、可扩展的算力底座。当前已在全国部署触达超 37,000P 算力、覆盖 16 种主流芯片,盘活了广域分散的异质算力。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-20原文

相关内容