行业新闻

科大讯飞星火 X2.5 发布:万卡国产 910B 集群完成训练,模型反哺 NPU 算子优化

国产万卡集群不只看卡数,还要看算子、通信和故障恢复能否配套;讯飞这次把训练全流程跑在 910B 上,并让模型参与底层算子优化。

科大讯飞发布星火 X2.5,采用 MoE 架构(混合专家,每次只激活部分参数以降低计算量),293B 总参数、30B 激活参数,重点提升代码与智能体能力。其预训练和后训练全部在万卡级国产 910B 集群上完成,线上推理也用国产平台。团队围绕算子效率、长序列并行、通信压缩和故障恢复做了定向优化,机器有效训练时长超过 97%。更值得注意的是,随着代码能力增强,星火 X2.5 开始参与 NPU(神经网络处理器,此处指国产 AI 加速卡)算子优化,模型反向优化底层算力。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/0367de5a-ebdd-4a48-ae45-c3943543040a/011(2).jpg) 编辑|Clio 最近几个月,国产 AI 算力开始密集跨过一个新的数量级。 7 月,全国产十万卡 AI 超集群落成;9 月初,无锡国产万卡级智算中心一期 2000 张摩尔线程 MTT S5000 GPU 智算卡已全部投入运行,集群算力需求基本达到满载;国产卡正在进一步向万卡乃至十万卡级训练基础设施迈进。 ![图片](https://mmbiz.qpic.cn/mmbizpng/5L8bhP5dIqGa9zRYkibBeMNywwGJibVibRe5QAcibgezFofnaAzTvz4MRs81Hc69xpTjrIbTicEKA92icCTeW88UHKD93pcknT71RXsNI8rq9My7U/640?wxfmt=png&from=appmsgimgIndex=1) 无锡(惠山)国产智算中心机房内 集群规模越来越大,新的问题也随之而来:这些芯片究竟能发挥出多少实际训练能力? 大模型训练里,卡数增加的同时,系统复杂度也会跟着上升。一块芯片上的算子效率差异,放到数万块芯片上会不断被放大;小规模训练里不太显眼的通信等待,到了万卡集群会变得很可观;节点数量增加、训练周期拉长之后,软硬件故障也会更频繁地进入日常运维。 因此,评价一套算力系统,除了看芯片数量和单卡性能,还要看算子、通信、并行调度、故障恢复以及软件栈之间能不能配合起来。 最近一个新发布的模型引起了我们的注意。 9 月 7 日,科大讯飞正式发布星火 X2.5。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-11原文

相关内容