重新思考预训练之外的 Muon:VLA 和 RLVR 的频谱失败与高通解决方法
Muon 是一种矩阵感知优化器,通过 Newton-Schulz (NS) 迭代 对动量矩阵的所有奇异值进行均匀白化,使梯度正交化,从而在 LLM 预训练中优于 AdamW。然而,这种统一的频谱白化在预训练之外的两类场景中暴露了根本性局限: 1. 跨模态视觉-语言-动作(VLA)训练:动作模块梯度本质低秩,均匀白化会放大噪音尾方向; 2. 可验证奖励强化学习(RLVR):低信噪比梯度及需保留预训练的头专化能力,使得白化不稳定。 为解决这些问题,本文提出 Pion——一个即插即用替代 Muon 的优化器。Pion 保留了 Muon 的计算效率,但将均匀白化替换为“Promotion + Suppression”两阶段机制,称为高通 NS 迭代:该设计产生尖锐的频谱高通效应,将主导奇异值锚定在 1,同时将噪音尾成分压制向 0,且滤波器强度可控。为保留预训练的头异质性,Pion 还支持 per-head 模式,通过简单 reshape 独立更新注意力头,无额外开销。 在 VLA 任务(LIBERO 和 LIBERO-Plus)上,Pion 在 l1 回归(VLA-Adapter)和流匹配(VLANeXt)架构下均持续优于基线:例如在 LIBERO Object 上,VLA-Adapter 仅 1500 步即达 100% 成功率,而 Muon 为 97.0%,AdamW 仅 32.2%。优势还扩展到真实 Franka Research 3 机器人(DROID 设置,pi0.5 主干)的三项抓放任务。在 Qwen3-1.7B/4B 的 RLVR 后训练(GRPO、GMPO)中,Pion 在 MATH 和 GSM8K 上均优于 AdamW,而 Muon 直接崩溃至零。
论文精读
TL;DR 发现 Muon 的均匀谱白化在低秩/低信噪比训练中失效,提出 Pion 优化器,用高通过滤抑制噪声分量、保留主导结构,并在 VLA 与 RLVR 任务中显著超越 Muon 和 AdamW。
问题
问题背景
随着大模型从纯语言预训练扩展到跨模态具身智能(VLA)与基于可验证奖励的强化学习(RLVR)后训练,优化器的选择变得尤为关键。近年来,矩阵感知优化器 Muon 凭借 Newton–Schulz 迭代实现的谱梯度正交化,在 LLM 预训练中显著增强了探索能力,一度被视为 AdamW 的强有力替代者。
现有方法的局限
Muon 的核心操作是均匀谱白化——将动量矩阵的所有奇异值强行推向 1。这一策略在梯度结构相对均匀的预训练中有效,但在以下两个新兴场景中暴露出根本性缺陷:
- VLA 训练:动作模块的梯度矩阵通常具有低秩特性,均匀放大所有奇异值会放大噪声尾部分量,导致训练不稳定甚至发散。
- RLVR 后训练:梯度信噪比(SNR)极低,且从预训练承接而来的注意力头特异性对保持已有知识至关重要,白化操作会抹平这种异质性,使训练迅速坍缩至零。
为什么这个问题既难又重要
从工程角度看,VLA 的多模态梯度场高度非均匀,低秩与高噪声并存,要求优化器既能抑制噪声又能保护关键信号方向。RLVR 中,梯度估计器(如 GRPO、GMPO)引入 on-policy 采样噪声和重要性采样偏差,使得谱白化的假设完全失效。这两个方向分别是具身智能和推理模型落地的核心路径,业界对能跨阶段稳定训练的优化器需求迫切,但现有方法要么算力开销大,要么谱先验不匹配,长期缺乏可插拔的改进方案。
行业类比
如同在扩散模型训练中,AdamW 常因更新方向过于“平均”导致模式坍塌,而引入 Lion 等自适应优化器可恢复多样性;VLA/RLVR 训练也亟需一种频率感知的优化器,像高通滤波器一样保留主信号、衰减噪声,而非简单地将所有方向等权处理。
核心洞察
- Muon 的均匀谱白化在低秩或低信噪比梯度场景下会放大噪声方向,导致训练崩溃。Pion 通过两阶段的高通 Newton–Schulz 迭代,将主导奇异值推向 1 的同时压制尾部噪声分量,首次在 VLA 和 RLVR 等非预训练任务中实现稳定且高性能的矩阵自适应优化。
- 在跨模态 VLA 训练中,动作头梯度呈现显著低秩结构,常规优化器难以平衡多模态表征;Pion 的 per-head 模式支持对注意力头独立施加高通滤波,无需额外开销即可保留预训练中的头异构性,从而在仿真与真实机器人任务上一致超越 AdamW 和 Muon。
方法
输入与动量维护
与 Muon 相同,Pion 接收梯度矩阵 ( G ),维护动量矩阵 ( M = \beta M + (1-\beta) G )。但 Pion 不再强制所有奇异值趋近于 1,而是通过谱高通变换重塑动量矩阵的奇异值谱。
核心:两阶段高通 Newton–Schulz 迭代
Pion 将 Muon 的单步 NS 迭代替换为 Promotion(增强)+ Suppression(抑制) 的级联多项式变换,整体产生尖锐的谱高通效应:
- Promotion 多项式 ( f_p(\sigma) ):约束在 ( \sigma=0 ) 处为 0、( \sigma=1 ) 处为 1,且原点导数最大化,使主导奇异值(接近 1 的方向)被推向 1,保留重要信号子空间。
- Suppression 多项式 ( f_s(\sigma) ):在 ( \sigma \rightarrow 0 ) 时快速衰减,将噪声尾部的奇异值压向 0,同时保持 ( \sigma=1 ) 附近不受影响。 两者组合相当于在奇异值轴上施加可调强度的高通滤波器:锚定主奇异值于 1,抑制低信噪比的尾部成分。变换通过牛顿迭代法高效实现,不引入额外 SVD 计算,与 Muon 具有相同的计算成本。
Per‑head 模式保持预训练异质性
对 多头注意力 模块,Pion 支持 per‑head 更新:将动量矩阵按注意力头维度 reshape 后,对每个头的子矩阵独立应用高通变换,再恢复形状。这以零额外开销保留了预训练模型中不同头对重要子空间的专注度,避免了统一白化造成的破坏。
与同类方法的差异
与 Muon 的均匀谱白化(所有奇异值→1)相比,Pion 通过自适应高通滤波,在低秩梯度(如 VLA 动作头)或低信噪比梯度(如 RLVR)条件下,抑制噪声方向放大的风险,同时保留关键方向的学习能力,是一种即插即用的替代优化器。
实验
实验设计
本文在两类场景中验证 Pion 优化器:
- VLA 训练: 仿真基准 LIBERO / LIBERO-Plus 上测试两种架构 (VLA-Adapter 回归、VLANeXt 流匹配),并在真实 Franka Research 3 机械臂上使用 pi_0.5 骨干与 DROID 设定执行抓放任务。
- RLVR 后训练: 在 Qwen3-1.7B/4B 上,采用 GRPO 和 GMPO 算法,评估 MATH 与 GSM8K 数学推理任务。
关键发现
- 仿真 VLA 收敛极快: Pion 在 LIBERO Object 上仅 1,500 训练步即达到 100% 成功率,远超 AdamW (32.2%),并优于 Muon (97.0%)。优势在 LIBERO-Plus 长序列任务与真实机械臂实验中保持一致。
- RLVR 稳定训练: 在 GRPO/GMPO 低 SNR 梯度下,Muon 因均匀谱白化放大噪声导致训练崩溃(精度归零),而 Pion 凭借 高通滤波机制 压制噪声尾部方向并保留头部异质性,最终 MATH/GSM8K 精度均超越 AdamW。
与基线对比解读
- 对比 Muon: 核心差异在于 Pion 用 Promotion+Suppression 两步机制 替代了 Muon 的全局奇异值置 1。在 VLA 中,动作头梯度低秩,Muon 白化将噪声小奇异值放大,导致优化不稳定;在 RLVR 中,Muon 破环了预训练注意力头的特殊性,而 Pion 的 per-head 模式 零成本保持这种异质性,并防止梯度崩溃。
- 对比 AdamW: Pion 继承了矩阵感知优化的探索优势,同时在低 SNR 与异构梯度场景下鲁棒性大幅提升,使得原本 AdamW 占优的 RLVR 任务也能被超越。实验表明,仅更换优化器即可在跨模态训练和强化学习微调中获得一致增益。
行业影响
落地场景
Pion 优化器主要面向**机器人学习(VLA)和可验证奖励强化学习(RLVR)**两大场景,适用于以下产品与业务:
- 具身智能机器人:用于工业臂、移动操作机器人的端到端动作生成模型训练,如基于 VLA-Adapter 或 VLANeXt 架构的抓取-放置任务。
- 大模型对齐:通过 GRPO/GMPO 等算法对 LLM 进行数学推理、代码生成等能力后训练,直接提升下游 SaaS 或 API 的准确率。
- 跨模态决策系统:如自动驾驶中的视觉-语言-规划联合模型,需要处理低秩动作梯度或低信噪比奖励信号。
商业价值
Pion 从降本和体验提升两条线创造价值:
- 训练效率提升:在 LIBERO Object 任务上,仅 1500 步即可达到 100% 成功率,相比 AdamW 的 32.2% 大幅减少训练步数,直接降低 GPU 租赁/电力成本。
- 模型稳定性与成功率:避免 Muon 在低秩或低信噪比场景下的训练崩溃(如 RLVR 中准确率归零),减少因训练失败的重复实验开销。
- 零成本集成:作为 Muon/AdamW 的 drop-in 替换,无需修改模型结构或训练流程,可无缝嵌入现有产线,缩短产品迭代周期。
与现有产品/工作流的接口
Pion 以优化器插件形式接入主流深度学习框架:
- 直接替换 PyTorch 的
torch.optim.AdamW或社区实现的 Muon,仅需修改一行optimizer = pion.Pion(params, lr=...)。 - 支持 per-head mode,通过一次
reshape对注意力头独立更新,不增加额外计算,适合 Transformer 系架构。 - 兼容标准训练流水线(DeepSpeed, FSDP, Hugging Face Trainer),无需改变数据加载、模型定义或评估脚本。
具体落地用例:
- 仓储机器人分拣:使用 Pion 训练多任务 VLA 模型,在 LIBERO-Plus 等仿真环境中快速收敛后 Sim2Real 部署到 Franka 机械臂,可将新品类抓取的样本效率提高 3 倍以上,减少现场数据采集成本。
- 在线教育平台的答疑模型:在 Qwen3 系列模型上用 GRPO 做数学题强化学习,Pion 避免传统优化器 SNR 退化的问题,使 MATH 和 GSM8K 指标稳定提升,直接减少学生求助转人工的比例,提升服务体验。
局限
- Pion 引入了 **high‑pass NS 迭代** 中的可控滤波强度参数 `α`, 但论文并未给出自动调整该参数的机制, 所有实验均采用固定值 (`α=2.0`). 在实际部署中, 不同任务(如机器人操控与数学推理)对滤波强度的需求可能差异显著, 需要人工调参, 增加了工程开销. 此外, 实验主要在 LIBERO, DROID 及 Qwen3‑1.7B/4B 上进行, 更大规模模型和更多模态组合(如视频‑语言‑动作)下的表现仍待验证.
- 论文提出的 **per‑head 模式** 通过 reshape 将更新独立作用于每个注意力头, 声称零额外成本, 但该操作的有效性依赖于头的维度划分与底层线性代数库的交互, 在非标准头数或极窄头宽度时可能会出现性能退化. 同时, Pion 的全部实验均围绕 Transformer 架构, 对卷积网络、状态空间模型等其他架构的适用性未被讨论, 限制了其通用性.
- 尽管 Pion 在 VLA 和 RLVR 上显著优于 Muon, 但对比基线较为单一: 仅与 AdamW 和原始 Muon 比较, 缺乏与 Lion, Sophia 等其他矩阵自适应优化器的全面对比. 此外, Muon 在 LLM 预训练中的优势属已知, 本文仅聚焦后预训练阶段, 并未在相同设置下复现 Muon 的预训练表现或讨论 Pion 在该场景下的兼容性, 削弱了作为通用替代方案的说服力.