MoE 强化学习中的专家空间探索
强化学习 已成为大语言模型后训练的核心环节。近期针对 Mixture-of-Experts (MoE) 模型的 RL 研究,主要聚焦于提升优化稳定性与训练效率,而将专家选择 视为固定组件。由于路由决定了诱导输出分布的稀疏计算路径,专家选择本身可作为 rollout 多样性的额外来源。实证分析发现,扰动专家路由能有效改变模型输出并提升 rollout 多样性,效果类似提高解码温度;但直接扰动会激活不合适的专家,显著降低 rollout 质量。 为此,作者提出 Expert-Space Exploration Reinforcement Learning (ESRL),一个显式探索 MoE 专家路由空间的架构感知框架。ESRL 保留高置信度专家 作为锚点,并将随机路由限制在合理的候选池内,从而保留可靠的计算路径;扰动强度根据 router entropy 自适应调整以避免过度扰动。为缓解扰动带来的路由不匹配,ESRL 记录 rollout 期间使用的专家路径,并在策略优化时重放。 实验表明,ESRL 在 top-K、top-1 与 shared-expert 路由的多种 MoE 主干上,以及数学、科学、代码任务中均取得最佳性能,且无需额外采样或计算开销。在 Qwen3-30B-A3B 上,ESRL 优于所有对比方法,平均 Pass@1 与 Pass@8 分别较 GRPO 提升 3.2 与 4.5 个百分点。对专家利用率与训练动态的进一步分析,揭示了利用 MoE 特有路由结构如何使 RL 训练受益。
论文精读
TL;DR ESRL 通过探索 MoE 专家路由空间增强 rollout 多样性,保留高置信度锚点专家并自适应扰动,配合路径重放,在数学、科学、代码基准上显著提升 GRPO 的 Pass@1/Pass@8,且无额外采样开销。
问题
问题背景:强化学习(RL)已成为大语言模型后训练的核心手段,而 Mixture-of-Experts (MoE) 架构因其稀疏激活特性,在 RL 场景下更需关注计算效率与优化稳定性。
现有方法局限:当前 MoE-RL 方法(如 GRPO 等)在 rollout 阶段仅通过调整解码温度、top-p 等 token 级采样策略提高多样性,将专家路由视为固定组件。这忽略了路由空间作为额外探索维度的潜力。直接对专家路由施加随机扰动虽能增加输出多样性,但会激活不合适的专家,导致 rollout 质量显著下降,并引入训练与推理不一致的风险。
为什么难/重要:专家路由是离散且 token-dependent 的,扰动强度难以控制:过小则多样性不足,过大则破坏模型已有能力。此外,扰动后的路由路径需要在策略优化阶段被正确回放,否则会加剧 off-policy 偏差。由于 MoE 模型已广泛用于数学、代码等推理任务,提升其 RL 训练性能对业界有直接价值。
行业类比:类比于在推理服务中,除了调整采样温度,还可以动态选择不同计算子网络来增加回答多样性,但需保证不偏离可信路径。
核心洞察
- 将 MoE 的专家路由视作与 token 采样并列的探索维度,通过扰动路由增加 rollout 多样性,是 ESRL 的核心视角。与传统仅依赖解码温度或采样策略的多样性控制不同,ESRL 发现路由扰动可类比于提升温度,但会带来激活不当专家的风险。为此,它采用锚定高置信度专家和基于路由熵的自适应噪声,将探索限制在合理路由空间内,从而在保持生成质量的同时提升多样性。这为利用稀疏架构结构增强 RL 探索提供了新思路。
- ESRL 的 rollout routing replay 机制解决了 MoE 策略梯度优化中的路由不一致问题。由于扰动后的路由在训练时可能被重新计算,导致 rollout 和优化阶段的专家路径不匹配,ESRL 记录 rollout 时的专家路径并在策略优化时回放,确保梯度更新与实际生成轨迹对齐。这一设计对 MoE+RL 的稳定性至关重要,且无需额外采样或计算成本,在数学、科学、代码任务上提升 Pass@1 和 Pass@8(Qwen3-30B-A3B 分别 +3.2 和 +4.5),为工程实践提供可复用的架构感知优化方案。
方法
输入与问题背景
ESRL 面向 MoE-LLM 的强化学习 post-training。现有 MoE RL 方法(如 GRPO)大多将 expert selection 视为固定组件,仅优化稳定性或效率。但路由决定每条 token 的稀疏计算路径,直接影响输出分布,是除 token 采样外额外的 rollout 多样性来源。直接扰动路由虽能增加多样性,但可能激活不合适专家,导致 rollout 质量下降。
关键模块
ESRL 引入三个协同机制,将专家路由空间转化为可控的探索维度:
- Anchored Expert Sampling:保留 router 输出的高置信度专家作为锚点,仅从剩余的 plausible 专家池中随机采样替换部分低置信度专家。这样既改变路由模式,又避免激活明显不合适的专家。
- Adaptive Noise Adjustment:根据 router entropy 动态调整扰动强度。熵高表示路由不确定性大,此时降低噪声防止过度扰动;熵低时允许更大探索。噪声从 Gumbel 或 Gaussian 分布中采样,加到 router logits 上。
- Rollout Routing Replay:为消除训练与推理间因路由扰动引起的 mismatch,ESRL 记录 rollout 阶段实际采样的 expert paths,并在 policy optimization 时用相同路径重放计算 log-prob,保证优化目标与采样路径一致。
输出与效果
ESRL 在不增加采样或计算成本的前提下,提升 rollout 多样性与质量。在 Qwen3-30B-A3B 上,相比 GRPO,Pass@1 和 Pass@8 平均分别提升 3.2 和 4.5 个百分点,并在 top-K、top-1、shared-expert 等多种 MoE 架构及数学、科学、代码任务中取得最优。
与同类方法差异
不同于将 expert selection 固定的既有 MoE RL 工作,ESRL 显式利用路由结构作为可探索维度,并通过锚定与熵自适应避免探索引入的质量下降,是架构感知的 RL 探索新范式。
实验
实验设计
ESRL 在多种 MoE 架构(top-K、top-1、shared-expert routing)上验证,覆盖数学、科学、代码三类任务。基准包括 AIME 2024、MinervaMath、GPQA Diamond、MMLU-Pro、LiveCodeBench 等。对比基线包括 GRPO 以及现有 MoE-RL 方法。关键设置:ESRL 保持高置信专家为锚点,仅对候选池做随机扰动,并根据 router entropy 自适应调整噪声强度;同时记录 rollout 实际路由路径并在策略优化时回放。
关键发现
- 在 Qwen3-30B-A3B 上,ESRL 平均 Pass@1 较 GRPO 提升 3.2 个百分点,Pass@8 提升 4.5 个百分点,为所有对比方法中最佳。
- 该优势在不同 MoE 路由机制(top-K / top-1 / shared-expert)上一致,说明方法具有架构通用性。
- 分析显示,ESRL 有效提升 rollout 多样性,同时避免直接扰动带来的专家误激活和质量下降;专家利用率和负载平衡也得到改善。
与基线的深度对比
GRPO 在 MoE 模型上通常将所有专家视为固定组件,探索仅来自 token 级采样。ESRL 引入了专家空间探索 这一额外维度,与 token 级温度采样正交,可在不增加采样预算或计算开销的前提下扩大 rollout 多样性。相较直接对路由施加噪声(可能导致训练-推理不一致),ESRL 的锚定采样和路径回放确保策略优化与 rollout 路由一致,从而更稳定提升数学推理和代码生成等任务的 Pass@K 指标。
行业影响
落地场景
ESRL 适合所有使用 MoE 架构 LLM 做 RL 后训练的产品,尤其是对 推理准确率 要求高的场景:
- 代码助手:提升代码生成与调试能力,
Pass@1提升直接改善用户体验与采纳率。 - 数学/科学教育产品:自动解题与步骤推理更可靠,减少错误引导。
- 企业级知识问答:处理复杂逻辑与多跳推理,降低人工复核成本。
商业价值
- 降本:无需额外采样或计算预算,在相同推理成本下提升 Pass@1,减少重复调用与用户等待。
- 体验提升:输出质量更稳定,首次回答可用率提高,直接降低用户流失。
与现有工作流集成
ESRL 可作为 GRPO 等 RL 算法的即插即用增强:
- 仅在 rollout 阶段加入路由扰动与路径记录,优化阶段回放路径,改动小。
- 不改变 MoE 推理结构,推理阶段无额外开销,可直接嵌入现有训练流水线。
具体 use case:
- 某电商平台的智能客服需要处理优惠计算、规格对比等复杂问题,用 ESRL 微调客服 MoE 模型可显著提升复杂问题解决率,降低人工转接率。
- 某代码托管平台的 AI 代码审查服务,通过 ESRL 增强模型对复杂代码逻辑的理解,减少误报,提升开发者信任度。
局限
- **适用范围局限于 MoE 架构**。ESRL 的核心机制依赖路由器的稀疏专家选择,对 Dense 模型无法应用。虽然实验覆盖了 top-K / top-1 / shared-expert 等主流路由,但未涉及更复杂的路由策略(如 Soft MoE、Hash Routing 等),方法的通用性有待进一步验证。此外,所有实验均在 GRPO 框架下进行,尚未与 PPO、REINFORCE 等其它 RL 算法结合,其增益是否具有跨算法一致性仍需探索。
- **依赖路由器质量与超参数调节**。锚定专家比例、噪声尺度、熵自适应参数等需要针对不同模型和任务进行调整,论文未系统性分析这些超参数的敏感性。当路由器本身训练不充分或置信度估计偏差较大时,熵自适应扰动可能失效,导致探索质量下降。此外,扰动引入的随机性可能在某些需要精确输出的任务(如严格代码生成)中引入额外风险,尽管已有锚定机制缓解,但未能完全消除。
- **路径重放带来额外存储开销**。为了在策略优化时重放 rollout 使用的专家路径,需要为每条样本存储逐 token 的专家索引。对于长序列和大批量训练,这会增加显存或内存消耗,尤其在大规模 MoE 模型上可能抵消部分效率优势。论文未提供该存储开销的量化分析和优化方案,也未讨论在多机多卡场景下的通信负担。