行业新闻

华为发布昇腾 960 系列:4096 卡超节点与 NPO 光互联路线

华为把 AI 算力竞赛从「做一颗好芯片」改成「做一整套系统」:芯片继续迭代,靠 4096 卡超节点、NPO 光互联和 CANN 生态补上制程差距。

华为披露昇腾 960DT 提前三个季度就绪,单芯片支持 2 PFLOPS FP8 算力;基于它的 960 超节点可扩展到 4096 张 NPU 卡、8 EFLOPS FP8 算力。华为计划 950 到 980 保持一年一代,并把竞争从单芯片扩展到光互联、超节点和软件生态。

正文摘录

昇腾 960DT 研发进度比原计划 提前三个季度 ,单芯片算力实现倍增,960DT 支持 2 PFLOPS FP8、4 PFLOPS FP4,HBM 容量最高 288GB、带宽 9.6TB/s。 对应的昇腾 960 超节点做到 4096 张 NPU 卡,最高 8EFLOPS FP8 算力、超过 1PB HBM 容量。 2028 年昇腾 970、2029 年昇腾 980,未来几年保持 "一年一代" 的演进节奏。 从今年开始,950、960、970、980 连续几代,未来几年我们坚持一年一代,走入了快速演进的节奏。这也是国内半导体制造、封装的上下游配套全部打通之后才实现的。 围绕 960,华为把 NPO 光互联、超节点、CANN 生态和韬定律一起摆上台面,给出的答案很明确:AI 算力竞争已经越来越像一场系统工程。 按照华为披露,960DT 比原计划提前三个季度准备就绪,960PR 版本也将继续提前。 "芯片从立项到产品化往往要三年,我们任何一次发布,都是产品已经在实验室反复测试、有准确交付时间之后才做。" 从 950、960 到后续的 970、980,华为接下来几年计划保持一年一代快速演进的节奏。 AI 大模型的训练和推理规模正在迅速扩大,单颗芯片再强,也很难独自承担万亿、十万亿参数模型的计算需求。 910C 是 384 卡,950 做到 1024 卡,960 进一步扩到 4096 卡,并通过跨物理节点的统一内存编址,让多颗 NPU 互联起来更接近一台逻辑计算机。 汪涛提到,华为从仿真训练里看到,在同样十万卡集群下,4096 卡超节点组成的集群相对传统八卡服务器组成的集群,MFU 可提升 2.75 倍。 MFU 可以简单理解为大模型真正吃到多少理论算力,集群越大,通信、同步、故障越容易把峰值性能吃掉。

阅读原文(qbitai.com)→

行业新闻梦瑶2026-09-19原文

相关内容