剪枝与蒸馏 Mixture-of-Experts 为稠密语言模型
Mixture-of-Experts (MoE) 是当前前沿语言模型的主导架构,但其需要将所有专家参数加载到内存,限制了在内存受限场景下的部署。现有压缩方法虽然减少了专家数量,但输出仍然是 MoE 模型,存在同样的问题。 本文提出首个系统性框架,将训练好的 MoE 模型转换为标准稠密架构:首先对专家进行评分、选择和分组,然后将选出的专家拼接成稠密前馈网络(FFN),并通过知识蒸馏从 MoE 教师模型进行精炼。我们在 Qwen3-30B-A3B 上评估了 7 种评分方法、5 种分组方法和 2 种幅度缩放方法,共 350 种配置。 实验发现,评分方法影响最大,我们提出的多样性感知评分(diversity-aware scoring)在 Qwen3-30B-A3B、DeepSeek-V2-Lite 和 GPT-OSS-20B 上均持续优于先前方法。在参数数量匹配的受控对比中,MoE-to-dense 在约 4B token 蒸馏后平均下游准确率比 dense-to-dense 剪枝高 +6.3 个百分点,且训练速度提升 1.6 倍。
论文精读
TL;DR 首个系统性框架将 MoE 转化为稠密模型:通过多样性感知专家评分、选择与拼接,辅以知识蒸馏,同等参数量下性能优于稠密剪枝 +6.3pp,训练速度 1.6x。
问题
问题背景
Mixture-of-Experts (MoE) 已成为前沿大语言模型(如 Qwen3、DeepSeek-V2、GPT-OSS)的主流架构,通过稀疏激活部分专家参数在训练和推理时获得计算效率优势。然而,MoE 模型要求所有专家参数常驻内存,限制了在内存受限设备(如边缘端、消费级 GPU)上的部署。
现有方法局限
当前 MoE 压缩主要采用专家剪枝或专家合并,但这些方法输出仍为 MoE 模型,未能根除多专家架构带来的内存开销。例如,剪枝后仍需维护剩余专家的独立前馈网络(FFN)与路由器,合并方法则常因不同专家表征差异导致性能损失。另一方面,传统密集模型剪枝直接减少 FFN 维度,但无法利用 MoE 中专家级的知识多样性与稀疏性,参数利用率低下。
技术挑战与重要性
将 MoE 转化为标准密集架构面临三大核心挑战:
- 专家筛选:如何从众多专家中选出信息量大、互补性强的子集?现有基于频率或概率的评分方法往往忽视专家冗余,导致选出的专家高度相似。
- 专家融合:选定专家后,如何组合其权重以构成单个密集 FFN?简单的拼接或平均会丢失原 MoE 路由过程中的条件计算能力。
- 知识恢复:架构转换后如何弥补精度损失?需要高效的知识蒸馏策略,从 MoE 教师网络中迁移知识。
该问题至关重要,因为工业界大量部署 MoE 模型,而内存敏感场景迫切需要体积更小、推理更快的密集替代模型。论文提出的框架首次系统性解决 MoE-to-dense 转换,在同等参数量下比传统密集剪枝提升 6.3 个百分点的下游精度,且训练墙钟速度快 1.6 倍,为模型压缩部署提供了全新范式。
行业类比:类似将多核处理器专用指令集程序移植到单核通用嵌入式芯片——需要精心选择功能模块,重组执行逻辑,并通过仿真回放确保输出一致性。
核心洞察
- **多样性感知的专家评分(如 D-Optimal 选择)是 MoE 到密集转换的关键**:传统方法基于专家激活频率或条件概率选择 top-k 专家,容易保留功能高度重叠的冗余专家,导致密集网络容量浪费。该工作首次将子集选择中的 D-Optimal 设计引入专家筛选,最大化所选专家激活矩阵的行列式(log-det),在理论上保证选择子集能够最小化线性回归参数估计的方差,从而保留尽可能多样的知识。实验表明,这种多样性感知评分在 Qwen、DeepSeek 等多个模型上一致优于频率、概率等基线,且纯剪枝模式(不合并专家)配合该评分效果最佳,揭示了过去依赖合并的压缩方案可能因丢失多样性而次优。
- **端到端 MoE-to-dense 框架提供了比 dense-to-dense 剪枝更优的部署捷径**:以往压缩 MoE 的方法(如专家剪枝、合并)仍输出稀疏激活的 MoE 模型,未解除内存需加载全部参数的瓶颈。本研究首次系统化地将完整 MoE 转换为标准密集 FFN 架构,使用知识蒸馏微调,在等参数条件下下游准确率比 dense-to-dense 剪枝高 6.3 个百分点,且蒸馏训练 wall-clock 速度快 1.6 倍。这赋予了 AI 工程一种实用范式:训练阶段使用大容量 MoE 充分学习,随后通过专家筛选与蒸馏得到高质量密集模型,直接适配内存受限的推理环境,无需重新设计稀疏推理引擎。
方法
方法概览
本方法将预训练 MoE 语言模型中的 MoE 层转换为标准 dense FFN,得到可直接部署的稠密模型。整体流程分为评分与选择 → 分组与拼接 → 缩放初始化 → 知识蒸馏四个阶段。
1. 专家评分与选择
给定一个 MoE 模型,使用少量校准数据前向传播,为每个专家计算一个多样性感知的分数。论文系统对比了 7 种评分方法,包括基于频率的 SF/PP/PS、条件概率 CP/ACP,以及提出的一种基于 D‑Optimal 设计 的评分策略。D‑Optimal 评分通过行列式点过程(DPP)衡量专家激活向量的多样性与信息量,能同时兼顾专家重要性与互补性,避免选择冗余专家。根据评分从全部专家中选择 top‑K 个。
2. 专家分组与参数拼接
选中专家后,需将其多个小 FFN 合并为一个大的稠密层。分组策略决定专家权重的拼接方式,包括纯剪枝(不改变权重)、轮询、权重聚类、路由器聚类等。最终,所有被选专家的上投影矩阵 ((W_{up})) 在中间维度拼接为一个大矩阵,下投影矩阵 ((W_{down})) 在对应维度拼接,形成单个 dense FFN。该步骤将 MoE 的并行专家转换为顺序的大前馈网络。
3. 下投影缩放
直接拼接会改变输出量级,因为多个专家的输出被简单叠加或求和。为解决此问题,对拼接后的下投影权重进行幅度缩放,包括 Uniform 缩放(如除以选中专家数)和 Proportional 缩放(根据教师路由权重加权),使初始化更接近教师输出分布,降低后续蒸馏的难度。
4. 知识蒸馏与扩展教师路由
将转换后的 dense 模型作为学生,以原 MoE 为教师进行知识蒸馏。损失函数结合语言建模损失和教师‑学生输出分布 KL 散度。为进一步提升效果,引入扩展教师路由:蒸馏时不仅利用教师最终输出,还保留 MoE 的门控信号作为软监督,帮助学生模拟专家的混合行为。蒸馏阶段使用约 4B token 进行训练,即可大幅恢复精度。
输出:标准 dense 模型
最终获得一个参数匹配的稠密模型,消除了 MoE 需加载全部专家参数的内存瓶颈。在等价参数量的控制对比下,MoE‑to‑dense 比传统的 dense‑to‑dense pruning 平均下游任务精度高出 +6.3 个百分点,训练墙钟时间加速 1.6×。
与同类方法的差异
以往工作只减少专家数量或合并专家,输出仍为 MoE 结构,无法克服内存限制;本框架首次将 MoE 完全转换为标准 dense 架构,并通过多样性感知评分和蒸馏实现对教师知识的有效继承,显著优于直接对 dense 模型剪枝的重建方式。
实验
实验设计
论文以 Qwen3-30B-A3B 为主模型,系统评估了将 MoE 转化为密集架构的完整流程。实验涵盖 7 种专家评分方法(频率、条件概率、激活加权条件概率、D-Optimal 选择等)、5 种专家分组策略(轮询、权重聚类、路由聚类、锚点、输出聚类)以及 2 种下投影幅度缩放,共产生 350 组配置。蒸馏阶段使用 扩展教师路由(expanded teacher routing)与标准知识蒸馏,并在 DeepSeek-V2-Lite 和 GPT-OSS-20B 上验证跨模型泛化性。基线包括纯剪枝、合并策略以及密集到密集的剪枝(dense-to-dense pruning)。
关键发现
- 评分方法主导性能:提出的 多样性感知评分(D-Optimal,diversity-aware scoring) 在多数设置中显著优于频率或条件概率类方法,尤其在选择专家数较少时优势更明显。
- 分组影响有限:当仅保留少量专家时,不同分组策略差异很小;当专家数增多后,多样性感知评分仍保持优势,且纯剪枝(pure pruning)优于合并(merging)。
- 效率与效果双赢:在同等参数规模下,MoE-to-dense 相比 dense-to-dense pruning 平均下游准确率 +6.3 个百分点,同时蒸馏训练墙钟速度 快 1.6 倍。
- 扩展教师路由对性能提升不明显,但知识蒸馏的损失函数组合(KL 散度 + 语言建模损失)至关重要。
- 定量与定性分析显示,多样性评分能避免选择高度重叠的专家,缓解灾难性遗忘与知识错误;在不同专家池大小与模型架构上结论一致。
与基线对比的深度解读
传统 MoE 压缩方法(如直接剪枝部分专家或合并专家)仍输出一个 MoE 模型,无法解决内存受限部署的根本问题。本文首次将 MoE 转换为标准密集 FFN 堆叠,从 子集选择视角 把专家参数视为候选特征,通过 D-Optimal 设计确保选出的专家集合最大程度代表原 MoE 的激活模式。与密集剪枝相比,MoE-to-dense 利用教师模型更丰富的表示作为初始化起点,知识蒸馏过程不仅恢复性能,还继承了对齐的决策边界,因此能在更少训练开销下获得更高准确率。这一结果对需要将大模型压缩至边缘设备或内存有限环境的工程实践具有重要意义:无需从头预训练密集模型,可直接从现有 MoE 检查点迁移,大幅降低适配成本。
行业影响
落地场景
MoE-to-dense 转换 可直接服务于所有需低延迟、低内存部署大语言模型的场景,如对话式 AI 客服、端侧设备推理(手机、IoT)、实时推荐系统和多租户推理平台。该技术能将前沿 MoE 模型(如 DeepSeek-V2-Lite、Qwen3)压缩为参数效率更高的稠密架构,避免加载全部专家参数,从而在资源受限环境中保持高性能。
商业价值
主要价值线是降本增效。推理阶段内存占用大幅降低(如 30B 总参数 MoE 中仅激活 3B 参数的模型,转换为等参数量稠密模型后,无需管理专家路由开销),直接减少 GPU 或 CPU 的硬件成本与能耗。同时,蒸馏后的稠密模型推理吞吐更高,延迟更低,可提升用户交互体验,尤其在高并发服务中能支撑更多 QPS。与纯稠密剪枝相比,该方法在相同参数量下下游准确率平均提升 6.3 个百分点,相当于用更低成本获得同等甚至更优的模型质量。
与现有产品 / 工作流的接口
该方法可作为模型优化管道的一个标准化步骤,输入为任意训练的 MoE 模型,输出为可直接部署的稠密 FFN 模型。集成方式简洁:
- 在 MLOps 流程中,增加 MoE-to-dense 转换阶段,包括专家评分、选择、分组和知识蒸馏,可使用配套开源工具 moe-to-dense。
- 蒸馏后的稠密模型完全兼容现有推理引擎(如 vLLM、TensorRT-LLM),无需定制化的 MoE 路由内核,简化部署栈。
- 支持与 modularity-aware 预训练兼容,可无缝接入已有模型生产流程。
具体落地用例
对话式 AI 客服(电商 / 企业服务)
使用 MoE 教师模型生成高质量响应,通过本文方法蒸馏出稠密学生模型,部署在廉价 GPU 服务器甚至 CPU 环境,显著降低单次对话成本,同时保持响应准确率,缓解高并发下的排队延迟。
端侧实时翻译 / 输入法联想(消费电子)
将云端的 MoE 翻译模型转换为参数量小且推理快的稠密模型,直接运行在手机芯片上,实现离线、低功耗的实时翻译或智能输入,提升隐私保护和用户体验,无需依赖网络。
局限
- **转换过程依赖原始 MoE 教师模型进行知识蒸馏**,这意味着需要额外存储和加载完整的教师参数,在极大规模模型下蒸馏成本依然较高。论文仅验证了 4B 级别的蒸馏预算,对于更大规模的模型(如百亿、千亿参数),蒸馏所需的数据量和训练时间可能成为瓶颈,且教师模型的前向传播开销不可忽略。此外,当教师模型本身因许可证或隐私原因无法访问时,该方法无法直接应用。
- **转换后的密集模型失去了 MoE 的稀疏激活特性**,虽然降低了内存占用,但每次前向计算都需要激活全部 FFN 参数,实际推理延迟可能不降反升。论文主要关注内存约束场景,未系统评估推理速度与吞吐量的变化,对于延迟敏感或计算受限的部署环境,该方法的实用价值需要进一步论证。此外,专家分组与拼接可能导致 FFN 层内出现大量冗余连接,影响硬件效率。
- **多样性感知评分依赖激活统计与 D-Optimal 准则**,需要从校准数据中提取专家激活分布,并将其作为特征进行子集选择。这引入了对校准数据分布的敏感性:当部署域与校准域存在较大差异时,评分准则可能退化为贪心选择,影响最终模型泛化性。论文在多个模型上验证了评分方法的稳健性,但未探索严重分布偏移下的失效模式,也未提出在线或自适应的校准策略。