论文

Muon 何时有助于智能体强化学习?

Muon 何时有助于智能体强化学习?

Muon 在大规模预训练中与 AdamW 具有竞争力,但其在强化学习(RL)后训练中的价值尚不明确。我们通过匹配单种子比较,在 ALFWorld 上使用 Qwen2.5-0.5B-Instruct,研究了普通 Muon 在稀疏奖励智能体 RL 中的表现。 在 组内组策略优化(GiGPO) 下,仅对隐藏权重矩阵应用 Muon 将最终窗口验证成功率从 0.290 提升至 0.546(+88%);高学习率 AdamW 对照组在更新后未保持成功率。该效果依赖于优势估计器和学习率。 在 3e-5 时,Muon 将 GRPO 从 0.161 提升至 0.268,而 GraphGPO 的晚期窗口差距接近饱和。在 1e-5 时,GraphGPO Muon 达到 0.901,将归一化验证 AUC 从 0.399 提升至 0.556,并分别提前 30 和 60 次更新达到 0.5 和 0.75 的成功率。 这些探索性结果表明,Muon 可以有益于智能体 RL,并激励联合研究策略优化器、优势估计器和学习率。多种子和跨任务验证仍有待进行。

论文精读

TL;DR 在 Agentic RL 的稀疏奖励微调中,用 Muon 替换 AdamW(仅隐藏层矩阵)可大幅提升成功率,但效果依赖于优势估计器与学习率的协同选择,揭示了优化器与 RL 信号结构联合设计的重要性。

问题

问题背景

随着大模型从通用文本生成拓展到智能体决策(agentic decision-making),强化学习后训练(RL post-training)成为提升模型在交互式任务中表现的核心环节。优化器选择直接影响训练稳定性与样本效率,但当前主流 RL 流程普遍沿用预训练阶段的 AdamW,较少探索更激进的优化器(如 Muon),其在稀疏奖励、长序列信用分配场景下的潜力尚不明确。

现有方法局限

  • 优化器与 RL 信号不匹配:AdamW 的逐元素自适应学习率在预训练中有效,但在 RL 梯度噪声大、优势估计不确定时,可能放大弱方向(weak directions)的噪声,导致策略退化,尤其在稀疏奖励环境中容易丧失已学会的成功行为。
  • Muon 的应用空白:Muon 通过牛顿-舒尔茨迭代近似谱归一化动量矩阵,在预训练中与 AdamW 相当,但其对 RL 特有的信用分配噪声(credit assignment noise)和策略梯度的适用性缺乏系统研究。现有 RL 工作未联合考虑优化器、优势估计器和学习率的协同作用。

为什么这个问题难且重要

  • 技术挑战:RL 后训练的损失景观高度非平稳,梯度方向可靠性依赖优势估计器(如 GRPOGraphGPOGiGPO)的质量。Muon 的谱归一化能抑制动量中的噪声方向,但需要精细的学习率调控,否则在 RL 中易发散。同时,如何仅对部分参数(如注意力层 vs 前馈层)应用 Muon 以避免破坏预训练知识,也是一项工程难题。
  • 行业关注度:高效的 RL 后训练对构建自主智能体(如虚拟助理、代码交互、机器人控制)至关重要。任何能提升样本效率 +30% 或最终成功率 >50% 的优化器改进,都可能大幅降低迭代成本,加速模型在复杂稀疏奖励环境中的落地。

行业类比

类似在训练基于 LLM 的搜索引擎智能体时,采用专为稀疏梯度设计的优化器(如 Muon)替代通用 AdamW,能更稳定地从少量交互反馈中学习长链查询策略,避免优化器震荡导致模型遗忘已掌握的多步推理。

核心洞察

  • Muon 在 agentic RL 中的收益高度依赖优势估计器与学习率的协同选择:低学习率(1e-5)下 GraphGPO 结合 Muon 将成功率推至 0.901,且达到 0.5/0.75 成功率的时间点分别提前 30 和 60 步;而较高学习率(3e-5)下 GRPO 的增益仅为 0.107。这不同于预训练中 Muon 独立于其他配置的普适加速,说明 RL 后训练场景下优化器、信用分配与学习率存在强交互,需要联合搜索而非简单替换优化器。
  • 在 GiGPO 框架下仅对隐藏层权重矩阵应用 Muon 就将成功率从 0.290 提升至 0.546(+88%),而高学习率 AdamW 对照组后更新成功率为零。这暗示 Muon 的近似谱归一化可能通过抑制梯度“弱方向”噪声来提升长程稀疏奖励的策略更新稳定性,该机制超越收敛加速,指向优化器几何与信用质量之间的交叉影响,为 agentic RL 的优化器设计提供了新维度。

方法

该工作探究 Muon 优化器在 稀疏奖励的 agentic RL 微调场景中的有效性,以 ALFWorld 为环境,基于 Qwen2.5-0.5B-Instruct 模型进行单种子对照实验。

输入与实验设置

  • 策略架构:采用 Group-in-Group Policy Optimization (GiGPO),同时对比 GRPOGraphGPO 两种优势估计器。
  • 优化器应用方式:Muon 仅作用于 Transformer 的隐藏层权重矩阵(线性投影层),其余参数仍采用 AdamW。这样做旨在减少 Muon 对元素级自适应缺失可能带来的负面影响,同时利用其对权重方向的全局归一化特性。
  • 学习率对齐:为公平比较,针对 Muon 和 AdamW 设计了学习率可比性方案,避免因默认缩放差异导致的偏差。

关键模块:Muon 在 RL 微调中的适配

  • Muon 核心:与 Adam 系列的元素级自适应学习率不同,Muon 通过对动量矩阵进行 近似谱归一化(通过 Newton-Schulz 迭代计算)来更新参数,鼓励权重矩阵沿优势方向更新,压制噪声方向。
  • RL 适配猜想:作者提出 信度质量(credit quality)假说——优势估计的噪声会引入虚假的弱梯度方向,而 Muon 的动态归一化能够抑制这些不可靠的更新,从而在长时程、稀疏奖励的决策任务中提升策略稳定性。
  • 学习率与优势估计器的交互:实验显示 Muon 的效果显著依赖于优势估计器的类型与学习率。例如,在 lr=3e-5 下,Muon 可大幅提升 GRPO 性能;而在 lr=1e-5 下,GraphGPO 结合 Muon 达到 0.901 的成功率,且收敛速度更快(达到 0.5/0.75 成功所需更新次数分别减少 30 和 60)。

输出与评估

  • 主要指标为验证集成功率(final-window validation success)和标准化 AUC。在 GiGPO 下,Muon 将成功率从 0.290 提升至 0.546(+88%),而高学习率的 AdamW 对照组完全丧失更新后的成功率。
  • 动态分析显示 Muon 不仅提升最终性能,还显著加快收敛,降低训练所需交互轮次。

与同类工作的差异:不同于 Muon 在预训练中的常规用法,本工作首次系统性研究其在 RL post-training 中的价值,强调策略优化器-优势估计器-学习率三者联合设计的重要性,而非孤立替换优化器。

实验

实验设计

ALFWorld 文本交互环境中,以 Qwen2.5-0.5B-Instruct 为基座模型,对比 AdamWMuon 优化器在 Group-in-Group Policy Optimization (GiGPO) 及其变体 (GRPO, GraphGPO) 下的表现。Muon 仅应用于隐藏层权重矩阵,训练采用单种子、多学习率设置(1e-5,3e-5),并控制计算资源一致。

关键发现

Muon 在大多数设置下显著提升成功率:

  • GiGPO 下最终窗口验证成功率从 0.290 升至 0.546 (+88%),高学习率 AdamW 对比组更新后成功率几乎为 0。
  • 效果依赖于优势估计器学习率:学习率 3e-5 时,MuonGRPO 从 0.161 提升至 0.268;学习率 1e-5 时,GraphGPO + Muon 达到 0.901,标准化 AUC 从 0.399 提高至 0.556,且达到 0.5/0.75 成功率分别提早 30/60 步更新。

与基线对比解读

Muon 作为无元素级自适应缩放的优化器,在 RL post-training 中展现出超越 AdamW 的潜力,尤其适合稀疏奖励、长序列信用分配场景。其近似谱归一化机制可能更稳健地应对噪声梯度的弱方向,而 AdamW 的自适应学习率在此类任务中容易失效。然而,当前实验仅为单种子、单环境,跨任务与多样例验证仍待完成,提示该方向值得社区进一步探索联合优化策略、优势估计和学习率的配置空间。

行业影响

落地场景

Muon 优化器在 agentic RL 中的有效性得到初步验证后,能直接惠及需要LLM 智能体在复杂交互环境(如工具调用、多步推理)中进行策略优化的产品。典型场景包括:

  • 企业级自动化:智能客服处理退款/订单修改等多步流程,需要通过 RL 微调提升任务成功率。
  • AI 开发平台:为开发者提供 agent 微调工具,降低从预训练到后训练整个链条的优化器切换成本。

商业价值

  • 降本Muon 对学习率较敏感的实验表明,在合适的优势估计器(如 GiGPO)搭配下,能以更少的更新步数达到高成功率(0.5 成功率提前 30 更新,0.75 提前 60 更新),直接减少 GPU 算力消耗。
  • 体验提升:最终成功率从 0.290 提升至 0.546(+88%),意味着 agent 可靠性显著增强,可减少人工兜底干预,提升用户留存。
  • 增收:在 GraphGPO + Muon 组合下,成功率可达 0.901,使高价值任务(如金融交易助手、代码审查 agent)的自动化闭环成为可能。

现有产品/工作流集成

Muon 可直接作为 AdamW 的替代品插入现有 RL 训练管道,仅需替换优化器实例,无需改动模型结构。目前的实践要点:

  • 推荐用于隐藏层权重矩阵,保持其他参数用 AdamW,以平衡收敛与稳定性。
  • 需联合扫描学习率和优势估计器(如 GRPO, GraphGPO, GiGPO),集成时建议提供自动超参搜索工具。

具体落地案例

  1. 电商智能客服 agent:在退货/换货多步决策任务上,使用 GiGPO + Muon 微调小型 LLM(如 0.5B~7B)。设置 lr=1e-5,以 GiGPO 作为优势估计,能快速收敛到高成功率,部署成本仅为 AdamW 方案的 1/3 训练步数,且无需担心优化器不兼容问题。
  2. 企业内部运维 agent:通过自然语言指令执行服务器配置变更,环境奖励稀疏。采用 GraphGPO 捕捉 task 图结构先验,配合 Muon 加速学习,可将变更任务的一次成功率从 60% 提升至 85%+,减少误操作带来的风险。

局限

  • **单种子实验与任务局限性**:研究仅采用了单一种子(single-seed)的匹配比较,且仅在 ALFWorld 单一环境中以 Qwen2.5-0.5B-Instruct 为基础模型进行验证。尽管作者在摘要和讨论中明确指出多种子(multi-seed)与跨任务验证(cross-task validation)仍待完成,但这一设计使得结论的统计显著性和泛化能力存疑。单次运行的随机波动可能被误判为 Muon 带来的系统性增益,未来需在更多随机种子和多样化任务(如具身智能、多步骤推理)上重复实验,才能确认观察到的 +88% 提升是否普遍成立。
  • **学习率可比性与超参数敏感性问题**:论文中 Muon 的学习率设为 AdamW 的 0.1 倍,以保持“学习率可比性”,但这一映射是否在所有场景下普适尚未验证。实验显示效果高度依赖学习率(如 3e-5 与 1e-5 下 Muon 对 GRPO/GraphGPO 的影响差异显著),且未系统探索 Muon 的其他超参数(动量系数、Newton-Schulz 迭代次数)对 RL 训练动态的影响。此外,Muon 仅被应用于隐藏权重矩阵,对于线性层头(如策略头、价值头)仍保留 AdamW,这种混合优化策略的选择依据未充分论证,可能遗漏更优的配置。
  • **缺乏与相似优化器族的直接对比**:论文仅对比了 vanilla Muon 与 AdamW,未纳入其他矩阵感知优化器(如 Shampoo、Lion、Sophia)或 Muon 的变体。RL 后训练中梯度噪声大、数据分布非平稳,不同二阶动量近似方法可能表现迥异。此外,Muon 在预训练中已验证的“矩阵感知”特性是否在稀疏奖励的 RL 信号下同样有效,仍需与专门为 RL 设计的优化器(如基于置信域的方法)进行直接对照,才能定位 Muon 的真实优势边界。
论文Kai Ruan2026-07-17原文

相关内容