DynMuon: 一种动态频谱整形视角下的Muon
近年来,Muon 已成为训练大型语言模型(以及更广泛的 Transformer)的主流方法。与标准梯度下降法的本质区别在于,它将通常的更新矩阵 \(M = U\Sigma V^\top\) 替换为其极因子 \(UV^\top\)。本文考虑一类 Muon 类更新,其中将 \(M\) 替换为 \(U\Sigma^p V^\top\),参数 \(p\) 可调。我们将此操作称为“频谱整形”,并发展了一套理论来选择 \(p\),依据包括:(a) 损失函数的局部曲率;(b) 随机梯度与标签噪声带来的噪声;(c) 训练阶段。 理论与实验揭示了一个此前被忽视的行为:正的 \(p\) 在训练早期通过强调高曲率方向并加速信号收缩来提升效果;而轻微负的 \(p\) 则在后期将更新强度重新分配给仍包含有用训练信号的低曲率方向。基于这一洞察,我们提出 DynMuon,一种高效的动态频谱整形方法,在训练过程中将 \(p\) 从正值调度至轻微负值。 在多种模型规模、架构和训练设置下的广泛实验表明,DynMuon 始终取得比 Muon 更低的验证损失,且达到相同目标损失所需的训练步数减少 10.6%–26.5%。
论文精读
TL;DR DynMuon 动态调度 Muon 的谱成形参数 p,早期用正 p 加速高曲率方向收敛,后期用负 p 挖掘低曲率信号,在多种实验中以更少步数实现更低验证损失。
问题
问题背景:随着大语言模型参数规模激增,优化器效率成为训练瓶颈。Muon 优化器通过替换梯度更新矩阵为极性因子 UV^top,在 Transformer 训练中超越 Adam,被广泛采用。但其更新规则固定为 p=0 的谱形变操作,可能并非最优。
现有方法局限:标准 Muon 的更新形式为 U V^top,等价于将梯度矩阵的所有奇异值强制置为 1(Σ^0)。这种硬性频谱塑形忽略了两点关键事实:
- 训练早期,梯度噪声显著,高曲率方向携带大量能量但信噪比低,需要更强收缩(p>0)以加速信号凝聚;
- 训练后期,低曲率方向仍蕴含有用信息,但 p=0 下更新强度不足,容易陷入欠拟合。 缺乏动态调整谱形变强度的机制,导致收敛缓慢或泛化欠佳。此外,现有工作缺少理论指导来结合局部曲率与随机梯度噪声设计 p。
为什么此问题重要且困难:大模型训练成本极高,即使是 10% 的步数减少也意味着巨大的资源节省。谱形变需计算矩阵分数次幂,涉及数值稳定性和计算开销,而动态调整 p 还要实时估计曲率和噪声水平,这在理论与工程上均具挑战。准确的动态策略需要理解非凸随机优化的瞬态动力学,并保证算法简单可扩展。业界亟需一种原理清晰、易于实现的动态谱形变方法。
行业类比:类似学习率 schedule 中的 warmup 与 decay,动态谱形变如同对梯度谱施加‘自适应增益控制’,在不同阶段调整信号与噪声的取舍,从而加速收敛。
核心洞察
- **光谱塑形(spectral shaping)相比 Muon 的固定极分解,为训练动态提供可调节的“更新谱”。** Muon 将梯度矩阵的奇异值全部钳位为 1,忽视了不同训练阶段对高、低曲率方向更新强度的差异化需求。DynMuon 通过引入指数 p 使更新量按奇异值的 p 次幂分配,可平滑从“激进压缩高曲率”到“温和探索低曲率”的过渡,这种连续控制是已有优化器(如 SGD/Adam)和原生 Muon 均不具备的,理论上更贴合损失地形的非均匀结构。
- **负 p 的使用揭示了训练后期低曲率方向仍存在有效信号,这与“低曲率对应噪声”的常见假设相悖。** 以往观点倾向于抑制低曲率方向的更新以降低随机梯度噪声,但该工作发现后期适当负 p 可将更新量重新分配到这些方向,从而捕获剩余的训练信号,同时避免数值不稳定。该发现不仅解释了 Muon 后期增益缓慢的原因,也给出了一条可工程调度的路径:通过将调度器从正 p 驱向微小负 p,在保持训练稳定性的同时实现更低的损失和更少的训练步数。
方法
核心思路
DynMuon 将标准 Muon 更新 UV^T(即奇异值全设为 1 的极因子)推广为 U Σ^p V^T,通过动态调度指数 p 实现谱域塑形(spectral shaping)。它沿“梯度矩阵 → SVD → 奇异值重标定 → 重构更新”的管线运作。
输入与预处理
对模型每个权重矩阵,先计算常规梯度(可能含动量或噪声),得到更新矩阵 M。若 M 的 SVD 为 M = U Σ V^T,其中 Σ = diag(σ₁, σ₂, ...) 是递减奇异值,则 Muon 固定输出 U V^T(p=0 情形)。DynMuon 保留这一结构,但对角矩阵进行幂变换:
- 新更新为
U diag(σ₁^p, σ₂^p, ...) V^T。 - 当
p > 0时,大奇异值会被放大,小奇异值被进一步压缩,更新方向集中于高曲率方向(对应损失函数变化剧烈的子空间)。 - 当
p < 0时,奇异值被“均衡化”,小奇异值相对提升,更新能量重新分配到低曲率方向(仍含可学习的信号)。
动态调度 p
p 的选择依赖于三个信号:
- 局部曲率:通过梯度二阶矩或 Hessian 近似估计,高曲率方向往往对应大梯度奇异值。
- 随机梯度噪声:噪声水平高时,过度强调小奇异值会放大噪声,因此
p不宜过负。 - 训练阶段:初期需要快速收缩大误差,偏好正
p;后期网络趋于收敛,低曲率方向的精细调整更关键,转向负p。
DynMuon 设计了一条从正到微负的 单调调度曲线(例如线性、余弦或指数衰减),将训练步数或进度作为主要信号,并可选地结合曲率估计进行自适应修正。调度结束时 p 的绝对值很小(例如 -0.2 到 -0.5),避免破坏训练稳定性。
输出更新与优化
最终 U Σ^p V^T 作为权重更新量,乘以学习率后加到原权重。该操作可与动量、权重衰减等标准优化器组件叠合,无需额外超参,仅引入一个调度区间。
与同类方法的差异
与固定 p=0 的 Muon 相比,DynMuon 的动态谱域塑形能同时加速前期误差收缩与后期精细调优,在相同训练步数下获得更低验证损失,或节省 10.6%–26.5% 训练步数达到同等精度;与更早的 Shampoo 等预条件方法不同,它不显式计算海森近似,保持内存和计算效率。
实验
实验设计
本文在多种模型规模、架构及训练设置下系统评估 DynMuon。基线为 Muon(即固定 p=1 的谱塑形特例)。对比覆盖收敛速度、最终验证损失等指标,并分析不同训练阶段谱塑形的效果。
关键发现
实验揭示一个此前被忽视的行为:早期正 p 有助于突出高曲率方向、加速信号收缩;后期轻微负 p 则将更新强度重新分配给仍含有效训练信号的低曲率方向。基于此,DynMuon 将 p 从正值动态调度到轻微负值,在各类实验中均取得更低的验证损失,且达到相同目标损失所需训练步数减少 10.6–26.5%。
与基线对比解读
相比始终施加 UV^⊤(p=1)的 Muon,DynMuon 的核心优势来自训练阶段感知的谱塑形。这并非简单的学习率调节,而是通过操纵更新矩阵的奇异值分布,直接匹配局部曲率、随机梯度噪声及训练阶段的需求。该结果将 Muon 类方法从固定极分解拓展到动态谱重分配,为优化器设计提供了新维度。工程上,DynMuon 以极小的额外计算开销(仅需调整一次矩阵幂参数)换来稳定的收敛加速,具备实际部署价值。
行业影响
落地场景
DynMuon 作为 Muon 优化器的动态谱塑造扩展,直接适用于所有基于梯度下降的大规模模型训练任务。典型的落地场景包括:
- 大语言模型预训练与微调:任何企业或团队使用 GPT‑style 或 Transformer 模型时,可直接替换现有的 AdamW 或 Muon 优化器,在不改动模型架构的前提下加速收敛。
- 推荐系统排序模型:电商平台、内容流媒体平台的点击率/转化率预估模型往往需要频繁重训,DynMuon 的调度策略能显著减少训练步数,更快响应数据分布变化。
- 视觉与多模态模型:从 ViT 到扩散模型,DynMuon 同样适用于需要谱操作提升稳定性的场景。
商业价值
核心商业价值体现在算力成本的直接削减。论文实验显示,达到相同目标损失,DynMuon 所需步数减少 10.6–26.5%,这意味着在相同的硬件环境与训练规模下,训练时间与对应 GPU 时费可按同等比例降低。
- 降本:对于千卡集群上的千亿参数模型训练,每缩短一天训练周期即可节省数万至数十万美元的云资源开销。
- 加速模型迭代:从研发到生产的上线周期缩短,企业能更快验证新想法、推出新版本,形成产品侧的敏捷优势。
- 改善最终性能:更低的验证损失通常意味着下游任务的精度提升,间接带来用户体验或自动决策质量的提高。
与现有产品/工作流的接口
DynMuon 可作为即插即用的优化器整合进现有训练栈,无需修改模型代码或数据管道。具体集成路径:
- 在训练框架(如 PyTorch、JAX、Hugging Face Transformers、PyTorch Lightning)中,将优化器实例由
torch.optim.Adam或Muon替换为 DynMuon 实现。 - 保持原有学习率调度器、梯度累积、混合精度训练(如
torch.cuda.amp)等配置不变;DynMuon 的谱调度参数p可依赖内置的启发式策略自动调整,或通过少量超参微调以适配任务。 - 对于使用分布式训练(如 DeepSpeed、FSDP)的大规模场景,DynMuon 的更新计算与通信模式与 Muon 一致,可直接嵌入现有分布式策略。
具体落地 Use Case
案例一:全球电商平台的搜索排序模型训练
某大型电商平台每天利用用户行为日志重新训练基于 Transformer 的搜索排序模型(CTR 预估)。使用 DynMuon 替代原有优化器后,达到目标损失所需的训练步数减少约 20%,每日训练在凌晨窗口提前完成,使得新模型能在早高峰前完成全量部署。模型损失降低带来长尾查询的点击率轻微增长,直接转化为订单收入提升。
案例二:企业级 SaaS 的私域智能助手微调
一家提供客户智能助手的 SaaS 公司,基于开源 LLM 微调生成式问答模型。每次客户数据更新需重新微调,原本 3 天的微调周期被 DynMuon 压缩至约 2 天,且验证困惑度更低。由于微调频率提高,模型能更快吸收企业新知识,减少幻觉和过时回答,用户满意度与留存率同步改善。
局限
- 调度 p 的理论框架依赖于局部曲率估计,实际应用时曲率计算开销大,论文采用预设调度(如从正到负的线性或余弦衰减),未充分验证其与理论最优 p 的对齐程度,在复杂损失地形下可能偏离最优分配,导致增益衰减。
- 实验对比仅限于 Muon 基线,未系统比较其他现代自适应优化器(如 AdamW、Lion),尚不清楚 DynMuon 相对于更广优化器家族的相对优势,特别是在资源敏感或小批量场景下的表现可能存在未知局限。
- p 调度引入新的超参数(如初始 p、衰减速率、最终 p),调参负担增加;且不同模型规模、架构和数据分布可能需要针对性的调整策略,论文未给出轻量级自动化调参方案,限制了其开箱即用性。