论文

为 Agentic 强化学习结构化 MoE 专家选择

为 Agentic 强化学习结构化 MoE 专家选择

长时程 LLM agent 通常用稀疏 MoE 模型实现,但 agentic 行为与 MoE 结构的协同设计仍未被充分探索。本文系统研究了 agentic 后训练与 MoE expert selection 之间的联系。在现成 MoE 模型中,专家选择呈现出一种与 agentic 轨迹自然对齐的专门化结构:当 agent 在不同轮次执行语义相似的操作(如 READ、UPDATE)时,expert routing 的重叠程度高于执行不同操作的轮次。 然而,标准 RL 算法忽略了这种专门化,使训练过程中的 MoE routing 不受控制,经验上限制了任务性能与推理效率。为此,作者提出了面向 agentic 任务的分层路由控制框架:显式鼓励 turn-level 的专家选择对齐 agentic 操作,同时正则化 token-level 专家选择以维持局部一致性。 为缓解上述方法在后训练中出现的稳定性问题,作者进一步引入 entropy-gated control 机制。整体路由控制框架在所有评测基准上均取得超过 10 个点的成功率提升。 这些结果表明,agentic 轨迹结构为在 RL 后训练中优化 MoE 容量 提供了有效信号。

论文精读

TL;DR 该工作发现 MoE 专家选择天然对齐 agent 操作轨迹,但标准 RL 会让 routing 失控;通过层级路由控制(操作对齐 + 局部一致 + 熵门控)将成功率提升超 10 个点。

问题

问题背景

近年来,基于 LLM 的长程 agent 在复杂任务中日益依赖稀疏 MoE 架构以降低推理成本,但 agentic RL post-training 与 MoE 专家路由的协同设计仍缺少系统性研究。

现有方法局限

  • 标准 RL 算法在优化 agent 策略时,对 MoE 路由不施加任何约束,导致专家选择在训练中自由漂移,无法保持与任务步骤(如 READ、UPDATE)的语义对齐,实测中造成成功率下降和推理开销上升。
  • 现有路由控制手段多局限于静态负载均衡或基于 token 的局部正则,未利用 agentic 轨迹中 turn 级别的操作结构,因此难以兼顾全局专业化与局部一致性。
  • 直接引入路由正则又容易引发训练不稳定:梯度流被注入到路由器后,优化目标冲突可能导致熵崩溃或路由模式震荡。

为什么这个问题难 / 重要

  • 技术挑战:长程任务中每一步的专家选择既受当前操作约束,又需保持相邻 token 的局部平滑,同时还要避免过度抑制探索;这种分层控制与强化学习优化的耦合极难平衡。
  • 业界关注度:MoE 是大模型高效推理的主流方案,agent 是下一波应用核心,找到两者协同优化的路径对降低部署成本、提升任务可靠性具有直接工程价值。

行业类比

类似于在云原生环境中为不同类型的微服务工作负载动态调度异构加速器,既要按请求类型隔离计算资源,又要保持整体集群利用率最优。

核心洞察

  • - 在现成 MoE 模型中,专家选择已经自然形成了与 agentic 操作类型对齐的专业化结构(例如 READ 与 UPDATE 回合间的专家路由重叠更高),这为 RL 后训练提供了可用的先验信号,而此前工作往往忽视这一点。 - 与单纯关注路由负载均衡或从零学习路由的方法不同,本文通过量化相同操作回合与不同操作回合间的专家重叠差异,系统证明了操作感知的专家专业化在先验中就已存在,并可直接作为引导信号,从而减少 RL 训练中路由漂移导致的性能损失和推理低效。
  • - 分层路由控制框架将 agentic 轨迹的时序结构纳入 MoE 路由优化:回合级鼓励专家选择与操作类型对齐,token 级约束局部路由一致性,区别于仅使用 token 级正则化或全局熵约束的现有路由控制方法。 - 标准 RL 算法在更新策略时会同时破坏路由器原有的操作对齐结构,导致专家使用混乱;本文的分层设计同时捕获高层操作语义和低层序列平滑性,在多个 benchmark 上实现超过 10 点的成功率提升,并改善了推理时的专家命中率。
  • - 熵门控控制机制根据路由不确定性动态调节正则化强度,解决了 RL 联合训练中固定正则化权重导致的不稳定问题。 - 在在线 RL 环境中,策略变化会引起路由熵剧烈波动,静态正则化容易造成梯度冲突或控制不足;该机制通过熵值门控自适应启用或减弱控制项,是针对 RL + MoE 联合训练不稳定性的首个实用方案,与主要面向监督微调或预训练的路由正则化形成差异。

方法

方法核心:层次化路由控制框架

输入:Agentic RL 训练中的交互轨迹(每轮包含用户指令、工具调用、环境反馈等)以及预先定义的操作标签(如 READ、UPDATE、NAVIGATE)。这些轨迹是 MoE 模型在长程任务中产生的多轮 token 序列。

关键模块(按处理顺序):

  1. Turn-Level 操作感知控制:将每个 turn 的专家选择分布与对应的操作标签对齐。具体地,鼓励同一操作类型下的 turn 之间专家路由重叠度更高,不同操作类型之间重叠度更低。实现上,通过最小化一个对比损失(如余弦相似度或交叉熵),使路由分布向操作原型靠拢。

  2. Token-Level 局部一致性控制:在每个 turn 内部,正则化相邻 token 的专家选择,降低不必要的专家切换频率。这通过惩罚相邻位置路由分布的差异(如 Jaccard 距离或 KL 散度)实现,保持局部 routing 稳定,避免频繁抖动。

  3. 熵门控控制:为了解决上述两项正则化在 RL 后训练中引起的训练不稳定(例如梯度冲突、策略坍缩),引入熵门控机制。该模块监测每层 router 输出的熵值,当熵过低(表示专家选择过于集中,可能失去探索能力)或过高(表示路由过于分散,与操作标签脱节)时,动态调整正则化强度或暂时关闭部分控制项,维持训练平衡。

输出:经过控制的 MoE 专家路由分布,使得不同 agentic 操作对应不同的专家子集,且每个 turn 内部路由连续稳定。

与同类方法的差异:现有 MoE 路由控制主要关注负载均衡或通用稀疏性,忽视了 agentic 轨迹中操作语义提供的强监督信号;本方法首次将操作标签显式嵌入 RL 后训练过程,通过层次化(turn 级与 token 级)正则化同时优化任务成功率和推理效率。

实验

实验设计

实验在 AppWorld 和 AutomationBench 两个长时程智能体基准上评估。所用模型为现成的稀疏 MoE 大语言模型,通过智能体强化学习(agentic RL)进行后训练。对比方法包括:

  • 标准 RL 基线(无路由控制)
  • 几种变体路由正则化(如 field consensus、adjacent-distribution agreement、outlier regularization、routing reward/clipping、load-balancing loss)
  • 本文提出的分层路由控制框架(turn-level operation-aware control + token-level local consistency control + entropy-gated control)

此外进行了大量消融实验,分析各组件贡献、turn 标签影响、熵损失、token 级控制阈值等。

关键发现

  1. 现成 MoE 模型已存在与智能体操作对齐的专家选择结构:路由在语义相似操作(如 READ、UPDATE)之间重叠更高。
  2. 标准 RL 会破坏这种专业化:不加控制的路由在训练中变得不受控,导致任务成功率和推理效率下降。
  3. 分层路由控制有效:显式鼓励 turn 级选择对齐智能体操作,同时正则化 token 级选择保持局部一致性,并引入熵门控机制解决训练不稳定问题。
  4. 最终结果:在所有评估基准上,成功率提升超过 10 个百分点,且路由一致性提高,推理效率改善。

与基线对比的深层解读

标准 RL 基线在优化策略时可能大幅改变专家路由分布,打破原有的操作对齐结构,导致部分专家过载、推理时计算浪费。相比之下,本文的控制框架将智能体轨迹的结构信息(操作类型)作为先验引入路由优化,相当于给 MoE 容量分配施加了领域相关的归纳偏置。消融实验表明,单独使用 turn-level 或 token-level 控制均无法取得最佳效果,两者协同才能稳定提升性能。熵门控机制进一步避免了早期训练中的路由塌缩,保证了 RL 训练的稳定性。整体而言,该方法验证了智能体行为与 MoE 结构协同设计的必要性,为后续高效长时程智能体训练提供了新思路。

行业影响

落地场景

该方法直接适用于基于稀疏 MoE 架构的长 horizon LLM Agent 产品,如客服 / 电商导购、多步工具调用 DevOps、金融合同审查、教育陪练等场景。凡是用 MoE 部署 agent、需要多轮工具操作(READ / WRITE / UPDATE)的业务都能受益,尤其适合需要同时优化吞吐和任务成功率的云上多租户 Agent 服务。

商业价值

论文结果显示所有 benchmark 成功率提升超过 10 点,且推理效率因专家选择更稳定而改善。对 SaaS Agent 而言,同等 GPU 容量可服务更多并发请求,单位任务成本下降;成功率提升直接降低返工 / 人工接管成本。例如客服自动化中,减少一轮人工介入即可显著节省运营支出。体验上,专家路由与 agent 行为对齐减少长任务中的路由漂移,输出更可预期。

与现有 stack 集成

可作为额外正则化项插入现有 RLHF / agentic RL 训练框架:turn-level operation-aware control 需要轨迹中的 operation labels(可从工具调用或语义聚类获得);token-level 与 entropy-gated control 实现为路由器输出上的可微损失。推理侧无需改架构,只要求训练时记录路由分布。对已有 MoE 基座(如 Mixtral、Qwen MoE)可后训练微调,无需重新预训练。

具体用例:

  • 电商客服 Agent:处理退款 / 改地址等步骤时,约束 READ / UPDATE 对应的专家选择,降低错误工具调用,提升自动解决率。
  • 企业代码助手:长 repo 理解与多文件编辑中,将专家与文件读取 / 符号修改对齐,减少 token 路由抖动,提高生成一致性,降低 GPU 消耗。

局限

  • **依赖人工定义的 operation labels**:方法需要预先定义 agentic operation(如 `READ`、`UPDATE`)并构建分组 rubrics(论文 C.6),这限制了方法在新任务或环境上的直接迁移性。实际部署中,为每个新任务手工编写 rubrics 成本较高,且不同标注者的分组标准可能不一致,影响训练稳定性。与无需额外标签的通用 MoE 路由控制(如 load balancing loss)相比,本方法的可用性有所降低。未来可探索自动发现 operation 语义或使用无监督聚类替代人工标注。
  • **仅在有限基准上评估**:实验集中在 `AppWorld` 和 `AutomationBench` 两个 agentic 基准,任务类型偏向软件操作和自动化流程。对于开放域对话、多模态 agent 或其他 MoE 模型(如不同专家数量、不同预训练分布)的效果未知。此外,论文未报告在非 agentic 通用任务上的性能是否退化,可能存在 trade-off。需要更广泛的任务和模型验证来确认方法的通用性。
  • **超参数敏感性较高**:方法引入了多个正则化项(turn-level、token-level、entropy gate)及相应超参数(如阈值、权重),虽然提出了 entropy-gated 机制缓解训练不稳定,但论文未能充分展示对超参数选择的鲁棒性。从附录 E 的消融实验看,不同组件和阈值对最终性能影响较大,实际调参成本不容忽视。与简单端到端 RL 微调相比,需要更多工程投入。
论文Bolian Li2026-10-05原文

相关内容