论文

SLAI T-Rex: 在 Ascend SuperPOD 上对 DeepSeek-V4 系列进行全参数后训练

SLAI T-Rex: 在 Ascend SuperPOD 上对 DeepSeek-V4 系列进行全参数后训练

万亿参数规模 MoE 模型的全参数后训练为大规模分布式训练带来了严峻的系统级挑战,包括严重的内存压力、不可重叠的通信开销以及低效的内核执行。现有的大规模 LLM 训练系统大多基于 GPU 集群,本报告则展示了在 Ascend NPU SuperPOD 上的端到端优化实践。 以 DeepSeek-V4 模型系列为目标负载,我们开发了一个层次化优化框架,涵盖模型级并行、计算-通信编排以及底层内核执行。该框架在保持训练稳定性的同时,实现了 34.22% 的 MFU,相比开源基线方案提升了 2.93 倍。在此优化基础设施之上,我们进一步为复杂的运筹学(OR)任务构建了 CPT 和 SFT 工作流,将集成框架称为 SLAI T-Rex。 使用 DeepSeek-V4-Flash,我们开发了面向 OR 的 CPT 和 SFT 数据管道,结合收集的领域资源和求解器验证的合成优化文档,最终生成包含 10K 高质量 SFT 样本 的数据集,覆盖 四个任务类别 和 三种问题表示。该专用模型在零样本评测中取得了平均 71.81% 的 Pass@1 分数,超越 GPT-5.4-Mini 和基础 DeepSeek-V4-Flash 模型分别 3.98 和 11.27 个百分点。总体而言,本工作展示了从 Ascend 基础设施上的高效万亿参数模型后训练到面向求解器数学建模的领域专用 Flash 模型的全栈路径,推动了复杂推理的前沿模型系统。

论文精读

TL;DR 在 Ascend NPU 超级集群上完成 DeepSeek-V4 系列万亿参数 MoE 的全参数后训练,通过分层系统优化将 MFU 提升至 34.22%(2.93 倍于开源基线),并面向运筹学任务微调出性能超越 GPT-5.4-Mini 的领域模型。

问题

问题背景

万亿参数规模的 MoE(Mixture-of-Experts)模型已成为大语言模型能力跃迁的核心范式,但其全参数后训练(full-parameter post-training) 在大规模分布式集群上仍是工程实现的高难度课题。业界普遍关注如何在非 GPU 体系(如昇腾 NPU)上实现高效、稳定的万亿模型训练,以构建异构算力下的前沿模型系统。

现有方法局限

当前主流的大规模 LLM 训练系统几乎全部基于 GPU 集群 构建,其优化策略(如 NVLink 互联、CUDA 生态下的融合算子)在 昇腾 NPU SuperPOD 上无法直接迁移。开源基线的并行策略通常采用粗粒度的模型与数据并行,导致:

  • 内存压力巨大:万亿 MoE 的专家参数与优化器状态带来显存墙,分布式中未充分重叠的通信造成内存峰值过高;
  • 通信开销严重:All-to-All 专家路由等稀疏通信模式与计算过度串行,MFU(Model FLOPs Utilization)低于 15%
  • 算子执行低效:昇腾硬件原生的矩阵乘与注意力算子在默认配置下难以发挥 FLOPS 潜力。

这些限制使得非 GPU 集群上的万亿模型训练长期停留在概念验证阶段,无法支撑真实业务的后训练流水线。

为什么这个问题难且重要

万亿 MoE 全参数训练 并非简单的“更大模型”缩放,它耦合了 模型级并行设计计算-通信编排底层算子实现 三层挑战:

  1. 异构算力适配:昇腾达芬奇架构的计算特性与 CUDA 差异很大,必须重新设计并行切分与通信拓扑;
  2. 负载不均衡:MoE 的稀疏专家激活导致动态计算量与通信量波动,简单静态调度会引发严重流水线气泡;
  3. 数值稳定性:万亿参数在后训练中极易出现 loss spike,优化器状态维护需要分布式容错机制。

随着全球自研加速器(如 Ascend、Trainium 等)的普及,在非 GPU 体系上突破大规模训练是筑牢 AI 基础设施的关键节点。这项工作直接关系到企业能否在自主硬件上完成从预训练到后训练的完整闭环。

行业类比

该挑战类似于移动端推理引擎将 Int8 量化从 CUDA 迁移到 DSP/NPU 指令集——不仅要“算出正确结果”,更要重构一套使硬件利用率逼近理论峰值的系统软件栈,否则徒有硬件参数而无法落地。

核心洞察

  • **在非 GPU 架构上实现千亿参数全参数训练的端到端优化**:本工作在华为昇腾 NPU SuperPOD 上对 DeepSeek-V4 系列(千亿 MoE)完成全参数后训练,达到 34.22% MFU,是开源基线的 2.93 倍。这打破了大规模 LLM 训练系统仅围绕 GPU 构建的惯例,为 Ascend NPU 生态提供了从模型并行策略、计算-通信重叠到底层算子调优的全栈优化参考,证明非 CUDA 架构同样能支撑前沿模型的高效训练,对硬件多样化部署有直接工程启示。
  • **分层协同的并行与执行优化带来系统级效率飞跃**:通过模型级并行、计算-通信编排和低层算子执行的三层协同设计,解决了万亿参数 MoE 训练中内存压力、通信开销和算子效率的瓶颈。相比直接套用开源配置,这一框架将 MFU 提升近 3 倍且保持训练稳定,表明跨架构的分布式训练瓶颈具有共性——通过系统化的分层优化而非单点修补,可大幅提升资源利用率,为其他大规模训练系统提供可复用的设计范式。

方法

输入:万亿参数规模的 Mixture-of-Experts (MoE) 模型 DeepSeek-V4 家族,部署环境为 Ascend NPU SuperPOD。目标是对大模型进行全参数后训练,并面向运筹学(OR)任务定制微调。

关键模块:提出 SLAI T-Rex 分层优化框架,从三个层次协同解决训练挑战:

  1. 模型级并行策略:针对 MoE 的稀疏计算与巨大参数量,组合数据并行、张量并行、流水线并行及专家并行,合理切分模型以缓解显存压力并平衡负载。
  2. 计算-通信编排:通过异步执行与精细调度,将通信开销隐藏于计算过程中,解决非重叠通信瓶颈,提升整体吞吐。
  3. 低层次 Kernel 优化:针对 Ascend NPU 硬件特性定制关键算子,最大化计算效率。

基于优化后的训练基础设施,进一步构建继续预训练(CPT)和监督微调(SFT)流程:收集运筹学领域资源,结合求解器验证的合成优化文档,生成 10K 条高质量 SFT 样本,覆盖四类任务和三种问题表示形式。

输出:训练系统达到 34.22% MFU,相对开源基线提升 2.93×,且训练稳定。微调后的 DeepSeek-V4-Flash 在 OR 任务上平均 zero-shot Pass@1 为 71.81%,超出 GPT-5.4-Mini(+3.98pp)与基座模型(+11.27pp)。

差异点:区别于主流基于 GPU 集群的万亿 MoE 模型后训练方案,本工作在 Ascend NPU 上实现了从系统级优化到领域微调的端到端实践,验证了非 GPU 架构在大规模全参数训练中的可行性。

实验

实验设计

  • 训练流程:在 Ascend NPU SuperPOD 上对 DeepSeek-V4 系列(含 DeepSeek-V4-Flash)进行全参数后训练,分两阶段:
    1. 继续预训练(CPT):注入运筹学(OR)领域语料,让模型适应专业术语与推理模式。
    2. 监督微调(SFT):使用 10K 高质量样本(覆盖 4 类 OR 任务、3 种问题表示),样本由领域资源与求解器验证的合成优化文档结合生成。
  • 系统优化:设计了层次化优化框架,包括模型级并行策略、计算-通信编排及底层 kernel 调优,以突破万亿参数 MoE 模型的内存、通信与执行效率瓶颈。

关键发现

  • 优化后的系统达到 34.22% MFU,相对开源基线提升 2.93 倍,同时保持训练稳定,证明 Ascend 平台可通过全栈优化支撑千亿参数模型的端到端高效后训练。
  • 面向 OR 的专用模型在零样本 Pass@1 上取得 71.81% 的平均分,显著超越 DeepSeek-V4-Flash 基础模型(+11.27 个百分点)及 GPT-5.4-Mini(+3.98 个百分点),表明领域合成数据与全参数微调能有效激发复杂数学建模的推理能力。

与基线对比的深度解读

  • 通信与 kernel 执行的低效是万亿参数模型训练的主要瓶颈;本工作通过 计算-通信重叠NPU 亲和的 kernel 实现,MFU 提升近 3 倍,揭示了异地架构下软硬件协同设计的价值——不是简单移植 GPU 方案,而是从 并行策略到指令级调优 的全面重构。
  • 模型能力上,OR 后训练带来的增益(相对基础模型 >11 pp)远大于通用模型间的差异,说明 任务特化后训练 是提升垂直领域推理能力的有效路径,且对非 GPU 基础设施同样适用。
  • 该实践为多元化计算平台上的千亿模型训练提供了可复现的工程范本:从 数据合成系统优化 再到 评估,全链路经验证明 Ascend 生态可融入前沿大模型工作流。

行业影响

落地场景

全参数后训练优化实践可应用于需要大规模分布式训练的场景,尤其适用于非 GPU 集群(如 Ascend NPU)上的万亿参数 MoE 模型训练。具体业务场景包括:

  • 运筹优化服务:物流路径规划、生产排程、投资组合优化等,可直接集成领域专用模型提供决策支持。
  • 决策辅助 SaaS:企业资源管理(ERP)中的智能排产、供应链优化模块,通过调用模型提升自动化决策质量。
  • 科研辅助平台:数学建模与复杂推理任务,为零样本求解提供高性能基础。

商业价值

  • 降本:利用 Ascend NPU 替代高价 GPU 集群,显著降低万亿参数模型后训练成本;MFU 提升 2.93 倍意味着单位算力产出更高,减少训练时间和资源浪费。
  • 增收与体验提升:领域专用模型(如运筹优化)在零样本设定下准确率高达 71.81%,超越通用模型(GPT-5.4-Mini 等),可直接提升产品核心指标,形成差异化竞争力,带来更高的客户付费意愿。
  • 生态拓展:在非 GPU 硬件上实现可比性能,可吸引有自研或替代性硬件需求的客户,拓展市场空间。

与现有产品/工作流的接口

该框架提供了端到端的训练优化方案,易于集成进现有 MLOps 流程:

  • 硬件适配层:通过 Ascend SuperPOD 与现有分布式训练框架(如 PyTorch、DeepSpeed)对接,只需替换底层通信和算子实现,即可复用上层训练脚本。
  • 数据管道:构建的 OR 领域数据管道(收集领域资源 + 求解器验证)可作为模块,嵌入数据标注与处理平台,自动化生成 SFT 样本。
  • 模型部署:训练后的 Flash 模型兼容标准推理引擎(如 vLLM),可直接部署于现有推理服务,无需额外改造。

具体落地用例

  1. 电商物流调度:某电商平台需实时优化订单分配与路径规划,现有规则引擎难以应对波动。集成 SLAI T-Rex 训练的运筹模型,可零样本生成高质量调度方案,降低配送成本 10% 以上,同时提升用户时效体验。
  2. 工业制造排程:半导体工厂使用复杂数学建模优化机台利用,传统求解器耗时数小时。部署专用模型后,毫秒级输出近似最优解,支持在线重调度,减少设备闲置,提升产线吞吐量。

该工作证明了从 Ascend 基础设施高效后训练万亿参数模型到领域专用 Flash 模型的全栈可行性,为异构算力下的 AI 工业化提供了新范式。

局限

  • **硬件平台锁定与可移植性受限**:全文的所有系统优化(分层并行、计算-通信编排、低层 kernel 加速)均基于 Ascend NPU 集群与 SuperPOD 架构设计和验证,未与 GPU 生态(如 Megatron、DeepSpeed)在同等规模下做量化对比。缺乏跨平台优化策略的讨论,使得该方案能否平滑迁移到其他加速器(如 TPU、GPU)仍存疑,对非 Ascend 用户的参考价值有限。
  • **全参数后训练的成本与可复现性挑战**:万亿参数 MoE 的全参数后训练对硬件规模、显存和通信带宽的要求极高,文中虽给出 34.22% MFU 和 2.93 倍加速比,但未报告峰值显存占用、checkpoint 存储开销及训练总成本,这削弱了在其他硬件资源受限场景下的可复现性和工程实践指导意义。
  • **领域数据集规模有限且泛化性未知**:运筹学 SFT 数据仅 10K 条,覆盖四类任务和三种问题表示,虽然零样本 Pass@1 表现优异,但未在更大规模或更多样化的运筹学基准(如 NL4Opt、DIMACS 等)上评估跨领域迁移能力,也未与基于专门数学求解器(如 Gurobi、SCIP)的 hybrid 方法系统对比,领域专长模型的实用性边界尚不清晰。
论文Dongfang Li2026-07-22原文

相关内容