论文

用于混合专家模型的置信自适应SwiGLU

用于混合专家模型的置信自适应SwiGLU

SwiGLU 已成为现代 Transformer MLP 中的标准门控激活函数,但其门控锐度——即门控函数的平滑性和选择性——在训练过程中通常是固定的。 本文提出 Confidence-Aware SwiGLU (κ-SwiGLU),这是一种针对 Mixture-of-Experts (MoE) 模型的变体,能够根据令牌级路由置信度调整专家门控锐度。具体地,κ-SwiGLU 将 SiLU 门控锐度系数参数化为路由器 logit 的可学习函数,使得每个专家门控单元能在平滑-广泛激活与锐利-选择性激活之间插值。 我们在 FineWeb-Edu 数据集上评估了 κ-SwiGLU,覆盖 8 到 28 层的 MoE Transformer 模型。实验表明,κ-SwiGLU 在几乎所有设置下均提升了平均 CORE 性能,同时仅增加极少量参数和微小计算开销。 结果证明,置信感知的门控锐度是改进 MoE MLP 的一种有效机制。代码已开源:https://github.com/askerlee/kappa-swiglu。

论文精读

TL;DR 在 MoE 模型中,κ‑SwiGLU 根据 token 的路由置信度动态调节 SiLU 门控锐度,以微小开销提升 CORE 指标,为自适应门控提供新路径。

问题

问题背景

Mixture-of-Experts (MoE) Transformer 架构中,SwiGLU 已成为标准的多层感知机 (MLP) 激活方案,其门控机制决定了每个 token 激活哪些专家。当前研究热点聚焦于如何让路由更高效、负载更均衡,以及如何从 token 级动态调整容量分配。

现有方法局限

传统 SwiGLU 的门控锐度(即 SiLU 函数的温度系数)在整个训练过程中保持固定,这带来两难:

  • 平滑门控(低锐度)会激活大量专家,虽有利于梯度流动,但导致计算冗余和负载均衡挑战;
  • 尖锐门控(高锐度)仅激活极少专家,虽高效却容易使路由陷入局部最优,降低专家利用率并引入训练不稳定。 固定的 sharpness 无法感知每个 token 的路由置信度,模型只能在全局层面折中,限制了表达能力和容量利用效率。

为什么这个问题难且重要

路由信心在不同 token 上差异巨大:常见模式可被少数专家精准处理,而罕见或模糊 token 则需要更广泛的专家参与。手动调节 sharpness 超参无法适应这种动态变化,且会显著增加调参负担。技术上,需要一种轻量、可微分、端到端学习的机制来解耦门控锐度与路由决策,同时不引入显著计算开销。业界高度关注 MoE 的路由稳定性与训练效率(如 DeepSeekSwitch Transformer 等工作),自适应门控锐度能从更细粒度提升模型容量利用,是提升大规模 MoE 性能的前沿方向。

行业类比

类似推荐系统中根据用户画像置信度动态调整召回路数:对兴趣明确的用户锐化召回,对冷启动用户扩大候选集,通过置信度自适应平衡效率与精度。

核心洞察

  • **动态路由置信度注入激活门控**:κ-SwiGLU 首次将 MoE 的 token 级路由置信度与 SiLU 门控锐度直接耦合,使每个 token 的激活行为自适应路由器的确定程度。与现有工作中固定门控锐度的 SwiGLU 不同,该设计允许模型在路由置信度高时锐化专家选择以提升专注性,在置信度低时保持平滑激活以增强鲁棒性,实现了更精细的 token-to-expert 交互。
  • **低成本实现门控锐度条件化**:κ-SwiGLU 仅需为每个 expert 添加一个可学习的门控锐度系数,即构建 router logit 到锐度的小型映射,参数和计算开销极小。相比当前 MoE 改进多聚焦于路由策略或负载均衡,该方法从激活函数层面引入动态性,与现有技术正交,可即插即用融入标准 SwiGLU MLP,为模型性能带来稳定提升。

方法

方法概述

κ-SwiGLU 的核心是让 MoE 专家门控锐度token 级路由置信度 联动,从而动态塑造激活选择性。

输入 → 关键模块 → 输出

  1. 路由置信度获取
    MoE 层中,每个 token 先经过 Router 产生一组专家 logit(未归一化分数)。这些 logit 既用于 top-k 分配,也被视为该 token 对每个专家的“路由置信度”——logit 越高,表明路由器越确信该专家应被激活。

  2. 置信度驱动锐度映射
    对于第 i 个专家,引入一个 可学习函数 κ_i(logit_i),将路由器 logit 映射为门控锐度系数 κ。通常实现为一个单层线性变换(参数极少),使得 κ 随 logit 自适应变化:

    • 高路由置信度 → κ 较大 → SiLU 门控更陡峭(sharp gating),专家激活更具选择性;
    • 低路由置信度 → κ 较小 → SiLU 门控更平滑(smooth gating),允许更广泛的激活,避免过度压制。
  3. κ-SwiGLU 门控计算
    在标准的 SwiGLU 门控中,SiLU 激活形式为 x · σ(x)。κ-SwiGLU 将其扩展为 x · σ(κ·x),用 κ 缩放 Sigmoid 输入,从而直接控制门控的“软硬度”。每个专家的门控输出经此调整后,再与专家前馈网络的激活相乘。

  4. 最终输出
    与常规 MoE 一致,各专家的输出根据路由权重加权求和(top-k 或 top-1);但此时每个专家的贡献已通过 置信度自适应门控 进行了调制。该设计使得 路由信心强的专家可以更“利落”地激活,而信心较弱的专家则保持温和参与,平衡了利用率与稳定性。

训练与正则化

κ 的参数与主模型一同优化。为防止锐度系数失控(过大导致近似硬选择,过小退化为线性),作者在损失中加入了 κ 参数的正则化项(如 L2 惩罚),确保其保持在合理区间。整体参数开销可忽略不计(每个专家仅增加少量乘性权重),计算开销仅略增。

与同类方法的差异

传统 SwiGLU 的门控锐度全局固定,而现有 MoE 门控改进(如负载均衡损失、top-p 路由)均未触及 激活函数形状的动态自适应。κ-SwiGLU 首次将路由置信度信号直接注入到门控平滑性中,通过可学习的锐度映射实现“每个 token 每个专家”的细粒度激活调控,避免了单纯依靠离散路由或辅助损失的局限性。

实验

实验设计

论文在 FineWeb-Edu 数据集上训练了 8 到 28 层Mixture-of-Experts (MoE) Transformer 语言模型,将标准 SwiGLU 激活替换为提出的 κ-SwiGLU。核心对比基线是固定 gate sharpness 的 SwiGLU,同时通过消融实验考察了 confidence-induced gate bias 的形式(如 router logit 直接偏置 vs. 可学习系数)以及 κ 参数的训练策略。评估指标采用 mean CORE,并记录了额外参数量和计算开销。

关键发现

  • 性能提升:在 8 至 28 层 MoE 模型上,κ-SwiGLU 均一致地提升了 mean CORE 表现,证明 confidence-aware gate sharpness(根据 token 级 routing confidence 动态调节专家门控的选择性)是有效的设计。
  • 计算与内存开销极小:新增的可学习参数(每个 expert gate 的 κ 系数)数量可忽略不计,前向传播的额外计算量只带来微小延迟,不会成为工程瓶颈。
  • 自适应门控的重要性:消融显示,让 gate sharpness 随 router logit(作为 routing confidence 代理)自适应变化,比固定 sharpness 或仅加偏置更优。

与基线的深度对比

标准 SwiGLU 的 gate sharpness(由 SiLU 函数固定形状决定)在整个训练过程中保持不变,导致 expert gate 对 token 的选择性僵化:路由高置信度的 token 与低置信度的 token 被同等程度地激活或抑制。κ-SwiGLU 通过引入一个基于 router logit 的可学习函数,允许每个专家的门控在 平滑、广激活尖锐、高选择性 之间连续插值。这相当于 MoE 中每个专家可以依据“自己是否被强烈选中”来调节信息流的锐度——当 router 对某个 expert 输出高 logit 时,gate 更尖锐,强化专长;低 logit 时 gate 更平滑,保留更多信息可能。这种机制自然提升了 路由不确定性下的容错能力,并有助于缓解 负载均衡 压力(更高的激活率可防止 expert 闲置)。对比近期其他动态 MoE 设计(如 adaptive top-k、entropy-based gating),κ-SwiGLU 仅修改 MLP 内部激活,与现有 MoE 结构正交,易于集成,且不增加路由计算或通信开销,具有良好的工程实用性。

行业影响

落地场景

κ-SwiGLU 可直接用于所有采用 MoE 架构的 Transformer 模型,覆盖大语言模型(LLM)推理服务、推荐系统、多模态理解与生成等业务。对于需要动态分配算力的场景(如在线推理中的 token 级路由),该方法能在几乎不增加延迟和参数量的前提下提升门控质量,适合部署在推理引擎、模型训练流水线或自研 MoE 模型中。

商业价值

κ-SwiGLU 通过提升门控信噪比来改善模型性能,在不显著增加硬件成本的情况下提升 CORE 指标,这意味着服务提供商能以相同算力提供更高质量的生成结果,从而降低单位 token 的推理成本,或通过模型性能增长驱动用户留存与付费转化。同时,其极小的参数量增幅(<0.1%)和可忽略的额外 FLOPs 使其能以极低风险集成到现有训练管线,避免重新训练或大幅调整超参,加速实验到上线的周期。

与现有产品 / 工作流的接口

该方法作为 SwiGLU 激活函数的即插即用替代,可直接嵌入 PyTorch 或 JAX 训练栈中。开源代码(kappa-swiglu)提供了清晰的 κ-SwiGLU 模块,只需替换现有 MLP 中的门控单元即可与 DeepSpeed、Megatron 等 MoE 训练框架兼容。与主流路由器(如 Top-K 路由、Learnable Routing)配合时,只需将路由器 logits 传入门控偏差计算,无需改变拓扑或优化器,因而可无缝接入现有 CI/CD 流程和模型监控体系。

具体落地用例

  • 电商推荐大模型:在商品理解与用户行为序列建模的 MoE 层中引入 κ-SwiGLU,根据 token(用户交互项)的路由置信度动态调整专家激活,提升长尾商品表征质量,改善召回与排序指标,同时推理开销几乎不变。
  • 内容平台审核模型:视频、文本多模态 MoE 模型在内容安全识别中常面临恶意变体逃逸,使用 κ-SwiGLU 让模型对不确定的输入自适应地激活更多专家,增强对模糊或对抗样本的判别力,从而降低误放率。

局限

  • **κ-SwiGLU** 仅在 FineWeb-Edu 数据集和最多 28 层的 MoE Transformer 上验证,未在更大规模(如千亿参数)或更多样任务(如对话、推理)上测试,可扩展性和通用性存疑。
  • 方法引入了 κ 参数的正则化项,虽然论文声称开销小,但实际训练中可能需额外调参(比如正则化系数 λ),且 κ 的优化使用了与主网络不同的学习率和调度器(附录 B 提到),工程落地时可能增加调试成本。
  • 对比基线主要限于标准 SwiGLU 和简单变体(如固定温度),缺少与近期其他 MoE gate 设计(例如 HyperRouter、Expert Choice Routing、P-cos)的直接比较,难以判断相对于该方向最新工作的实际增益。
论文Shaohua Li2026-05-30原文

相关内容