DeepSeek 开源昇腾算子与通信库,联合华为共建芯片软件生态
DeepSeek 把原本面向 GPU 的自研加速库整体搬到华为昇腾芯片上,国产算力平台缺的那层软件配套补上了一块。
DeepSeek 把面向华为昇腾(华为自研 AI 芯片)的底层组件开源,包括 TileLang 编译工具、DeepGEMM/FlashMLA 等高性能算子库(算子即模型里的基本计算单元),以及 DeepEP 分布式通信库(负责多张卡之间传数据),与早前面向 GPU 开源的组件一一对应。华为提供 Ascend C 编程接口与 UBL128 超节点组网支撑。
正文摘录
9月30日,DeepSeek 正式开源面向昇腾算力平台的基础设施组件,涵盖 TileLang 高级语言编译工具、高性能计算库与分布式通信库,与此前面向 GPU 平台开源的组件一一对应。DeepSeek 团队面向华为昇腾平台开源发布基础设施加速库,对中国 AI 软件生态具有里程碑意义,为算力平台提供了新的选择。 本次开源,DeepSeek 发布了 DeepGEMM、FlashMLA、TileKernel、DeepSelect 等高性能昇腾算子库组件和 DeepEP 分布式通信库。昇腾提供了稳定、开放的 Ascend C API 接口,使能用户对访存路径及计算流水线进行深度调优,完成高性能算子开发。同时依托开放 Ascend C 编程接口与 PTO ISA 底层指令体系,支持了 DeepSeek 的 TileLang 编程开源工作。昇腾生态兼顾不同开发范式,既支持资深开发者进行精细的手工调优,也支持 TileLang 等高级语言的编译对接。 华为向 DeepSeek 团队提供了联合定义的昇腾超节点 SuperPoD Flex 和 UBL128 组网方案,可实现 128 卡 3.2Tbps 单层交换 Scale-up 网络和 256K 卡两层交换 Scale-out 网络,可以支持超低时延推理和前沿基座模型的大规模训练的需求。基于全互联的 UBL128 超节点,昇腾提供了 ASC-COMM 高性能自定义通信编程库,支撑用户通信算子与通算融合算子高性能编程。DeepSeek 团队开发了高性能 DeepEP 通信库,涵盖 EP / CP / PP / FSDP 等模式下的通信算子,为更大模型向更大集群扩展提供支持,互联带宽实测达到 Dispatch 375 GB/s、Combine 347 GB/s 的通信性能,接近硬件上限。