行业新闻

人大高瓴与蚂蚁发布 LLaDA MoE v2,首次刻画扩散语言模型扩展定律

这项研究首次给出扩散语言模型与混合专家结合的扩展定律,并据此训练出更高效的 LLaDA MoE v2,让该路线从经验驱动走向规律驱动。

扩散语言模型(一种通过掩码去噪而非逐词预测来生成文本的模型)正成为大模型的重要路线。人大与蚂蚁团队首次系统研究其混合专家(MoE,一种只激活部分参数以节省算力的架构)扩展规律,并据此训练了 LLaDA MoE v2。该模型仅用同规模自回归模型约 65% 的训练数据,就在多项基准上逼近 Qwen3 水平,把这类模型的扩展从试错转向定律指引。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/0f4c54a3-21ac-4f90-9269-23a2f3455ba8/025(2).jpg) ![图片](/r/blog/3b1171a9ab1a71831b108a9c6abb610eb7a556fe22170b8ca9ef0ccda97f7834.png) 本文介绍的工作由中国人民大学高瓴人工智能学院李崇轩、文继荣教授团队与蚂蚁集团共同完成。朱峰琪是中国人民大学高瓴人工智能学院的博士生(蚂蚁集团实习生),导师为李崇轩副教授。 扩散语言模型的快速发展,正成为大语言模型领域备受关注的技术方向:凭借双向上下文建模与多词元并行解码的独特优势,这一新兴范式已从前沿学术探索逐步成长为大语言模型的重要技术路线之一,受到学术界与产业界的持续关注。随着模型规模与训练算力不断增大,如何高效地扩大规模成为亟待回答的问题 —— 最优超参数如何随算力调整、有限算力在模型与数据间如何分配、稀疏专家架构如何随规模演进,都需要扩展定律给出科学的答案。 在自回归模型上,扩展定律已相当成熟,支撑了一代又一代大模型的训练;然而,离散扩散语言模型采用掩码去噪目标,监督信号仅落在被掩码的位置,每个预测又都基于受损序列而非因果前缀,自回归的扩展经验无法直接照搬。混合专家架构作为大模型扩容的主流选择,与扩散建模结合后的扩展规律仍缺乏系统刻画,大规模扩散语言模型的训练仍在很大程度上依赖经验与试错。 为此,高瓴人工智能学院李崇轩、文继荣团队与蚂蚁集团 首次系统刻画了混合专家扩散语言模型的扩展定律,并据此从头训练了 30B-A3B 的新一代扩散语言模型 LLaDA MoE v2 。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-11原文

相关内容