相同架构,不同能力:优化器引发的谱缩放定律
缩放定律通常将优化器视为固定训练细节,但本文发现这一假设忽略了表示缩放的关键维度:优化器如何将增加的 FFN 宽度转化为有效利用的谱容量。通过使用软谱秩和硬谱秩测量前馈网络表示的 eigenspectra,我们发现相同 Transformer 架构在不同优化器下呈现出显著不同的谱缩放行为。 固定架构和宽度计划时,AdamW 在稀有 token(TAIL)表示上表现出弱硬谱秩缩放(β=0.44),而 Muon 在相同场景下实现线性缩放(β=1.02),缩放指数提升 2.3 倍。这种差异不可归约于验证损失:AdamW 配置在延长训练后可以匹配低秩变体(Dion)的困惑度,但谱几何截然不同,表明匹配的损失并不意味着匹配的表示结构。硬-软秩不对称性进一步揭示优化器不仅在实现容量上存在差异,还在其特征模式(eigenmodes)间的容量结构上不同。 为分离优化器与架构效应,我们对比了架构干预(如注意力秩和位置编码),发现优化器引发的谱偏移往往超过架构效应。这些结果表明优化是表示缩放的一类主要轴线,推动优化器-架构协同设计。
论文精读
TL;DR 同样的 Transformer 架构用不同优化器训练,模型表征的频谱容量随宽度增长的缩放指数可相差 2.3 倍,Muon 在 AdamW 难以处理的长尾 token 上实现线性缩放,且优化器效应超过注意力秩和位置编码等架构干预。
问题
问题背景
在语言模型缩放定律(scaling laws)研究中,模型性能通常被建模为参数量、数据量和计算量的函数,但优化器(optimizer) 一直被当作固定的训练细节,而非影响表示容量(representation capacity)的关键变量。
现有方法局限
传统缩放定律分析默认优化器对模型表示能力的影响微小,或仅通过最终损失(loss)进行间接比较。然而,相同架构、不同优化器训练得到的模型,即使在困惑度(perplexity)上匹配,其前馈网络(FFN)的特征谱(eigenspectra) 和有效秩(effective rank) 仍可能存在巨大差异。这意味着仅靠损失无法揭示模型是否真正利用新增参数来提升表示容量,导致架构改进与优化器选择脱节,无法实现最优的架构-优化器协同设计。
为什么这个问题难/重要
量化优化器对表示谱结构的动态影响需要高维特征分解,且不同 token 频率区间(如高频 MID 与低频 TAIL)的缩放行为差异显著。优化器的更新秩(update rank) 会直接限制稀有token 的硬秩(hard rank)增长,而损失函数无法捕捉这种几何瓶颈。在算力成本高昂的大规模训练中,忽略优化器维度的缩放定律可能误导模型扩容策略,导致“增宽不增效”。
行业类比
类似在 3D 生成中,即使两个模型用同一 NeRF 骨干,但若采用不同的傅里叶特征编码,其高频细节重建能力可能天差地别——优化器的隐性结构作用正如同这种特征编码,决定网络表达能力的实际利用率。
核心洞察
- **优化器选择构成表征缩放的独立维度**:传统缩放定律将模型规模、数据量和计算预算视为可预测性能的主轴,而优化器被视为固定配置。本文发现,即便架构与宽度增长策略完全相同,不同优化器(AdamW vs Muon)可导致前馈网络有效容量的缩放指数相差 2.3 倍。这一差异源于优化器将参数增量转化为可利用频谱容量的效率不同,挑战了“仅靠增加宽度就能线性提升表征能力”的假设,并迫使从业者将优化器搜索纳入缩放策略,而非仅将其当作调参细节。
- **匹配的验证损失不能保证匹配的表征几何**:业界常以困惑度为模型质量的单一代理指标,但本文揭示 AdamW 与 Muon 在达到相近损失时,其稀有 token 表征的硬谱秩缩放行为截然不同。即便延长 AdamW 训练时间以匹配 Muon 的损失,硬秩缩放能力也无法恢复,且训练过程中存在动态分化。这意味着损失函数可能对表征结构的退化不敏感,仅凭损失选型可能隐藏着关键能力瓶颈。频谱分析应成为模型选型与早期预警的补充工具,避免仅依赖损失指标而错失优化器带来的结构红利。
- **优化器引起的频谱效应压倒主流架构干预**:在控制变量条件下,对比优化器切换与注意力秩增加、位置编码调整(如移除 RoPE)等操作,本文发现优化器对硬秩缩放的影响在几乎所有 token 频段均占主导,尤其对稀有 token 瓶颈的改善远超人架构层面的改动。这颠倒了“先定架构后挑优化器”的常规开发顺序,提示在资源有限时优先探索优化器空间(如低秩更新的 Muon 或 Dion),可能比堆叠注意力头或调整位置嵌入更高效地释放模型容量,并引导优化器-架构协同设计成为新的缩放律研究方向。
方法
本研究提出一套系统性的优化器诱发谱缩放定律分析方法,核心围绕“相同架构、不同优化器如何改变 Transformer FFN 表示容量利用”展开。
输入与探测点
固定 GPT-2 风格 Transformer 架构,独立变量为 FFN 宽度(从窄到宽一系列配置)和优化器类型(AdamW、Muon、Dion 等)。在训练的每个 checkpoints,于 FFN 中间层设置两个探针:
- Pre-activation:线性层之后的线性输出(激活前)
- Post-activation:GELU 等非线性之后的输出(激活后) 针对整个验证集的 token 表示,计算协方差矩阵,以此作为谱分析的原始载体。
核心模块:Rényi 有效秩与不对称性
不直接使用普通矩阵秩,而是基于 Rényi 熵族构造连续化有效秩,形成两个互补指标:
- Soft rank(软有效秩):指数 α → 1 的平滑测量,捕捉整体表示空间的弥漫程度
- Hard rank(硬有效秩):α → ∞ 的尖锐测量,聚焦最高激活的几个主导特征模式 通过 hard–soft asymmetry(两者之差或比值)揭示容量在不同特征模式间的分配结构:高不对称性意味着少数模式主导,低不对称性表示容量分布更均匀。
Token 频率分层与缩放定律拟合
为区分不同难度的学习信号,按 token 频率将验证集分为 HEAD(高频)、MID(中频)、TAIL(低频/稀有)三等份,分别计算对应的 soft/hard 有效秩。随后,对“FFN 宽度 → 有效秩”数据点进行幂律拟合,提取 缩放指数 β,形式如:capacity(n) ∝ n^β。
输出与比较基线
最终输出各优化器、各 token 频率分片、各层下的 β 值,并额外对比两类架构干预:
- 改变注意力秩(key/query 维度)
- 移除 RoPE(旋转位置编码) 以此剔除架构影响,突出优化器引发的谱容量变化是否超越纯架构改动。
与同类方法的差异
传统缩放定律研究将优化器视为固定实现细节,仅拟合参数量/数据量/计算量与损失的关系;本方法首次将优化器升级为表示缩放的第一级变量,通过谱秩的细粒度分解,证明损失匹配并不保证表示结构匹配,为优化器—架构协同设计提供定量工具。
实验
实验设计
模型为 GPT-2(160M 和 350M),仅 FFN 中间层宽度 可变(如 512–4096),其余维度固定。优化器包括 AdamW、Muon 和低秩变体 Dion。在标准语言建模任务上训练,在 FFN 层提取表征计算协方差谱,使用 Rényi 熵定义 soft rank(α=2)和阈值法 hard rank,并按 token 频率分层为 TAIL(稀有)、MID、HEAD。对 effective_rank ∝ (FFN_width)^β 拟合幂律缩放指数。
关键发现
- TAIL 硬秩缩放指数:AdamW 的 β=0.44,Muon 达到 β=1.02,提升约 2.3 倍;MID tokens 增益更大。
- 硬软秩不对称性:Muon 在 TAIL 上 soft rank 饱和更快,但 hard rank 仍线性增长,而 AdamW 的 hard rank 较早停滞,揭示容量利用结构差异。
- 低秩优化器限制:Dion 的低更新秩严重约束 TAIL 硬容量,缩放指数更低,不对称性更突出。
- 损失匹配不代表结构匹配:延长 AdamW 训练虽降低困惑度,但 hard rank 未恢复,训练动态中 hard rank 过早崩溃。
- 优化器效应压倒架构干预:增大注意力秩或移除 RoPE 引起的频谱变化,远小于切换优化器,优化器成为表征缩放的一级轴。
对比解读
相比传统仅关注损失缩放法则的工作,本研究发现优化器选择对有效容量利用的影响超过模型宽度本身。AdamW 即使匹配 Muon 的困惑度,其表征几何仍存在质的差异,表明下游任务性能可能无法仅由损失预测。这要求从优化器–架构协同设计的视角重新审视缩放法则,尤其对稀有 token 学习困难的场景,优化器的低秩瓶颈会成为硬容量天花板,而 Muon 类全秩更新可释放更多潜力。
行业影响
落地场景:大模型预训练与垂直域微调
论文揭示优化器选择(如 Muon vs AdamW)会从根本上改变 Transformer 表示容量的频谱扩展规律,尤其是对稀有 token(TAIL)的利用效率差异达 2.3 倍扩展指数。这直接影响任何依赖长尾知识表达的场景:
- 电商平台:商品标题 / 属性中大量低频词(型号、材质),采用 Muon 可在同等 FFN 宽度下显著提升对罕见商品的语义表示能力,改善搜索与推荐的相关性。
- 医疗 / 法律领域模型:专业术语天然低频,优化器选择直接影响模型对专业词汇的“记忆”与上下文理解,进而影响生成准确度。
- 多语言模型:低资源语言可视为另一种 TAIL token,Muon 的线性硬秩扩展有助于更公平地分配容量。
商业价值:计算效率与模型质量双提升
- 降本增效主线:在固定计算预算下,换用 Muon 等具有更高更新秩的优化器,可使增加宽度带来的表示收益最大化,让相同 FLOPs 训练出更“深”的表示结构。论文数据表明,AdamW 靠延长训练也无法弥补这一差距——这意味着 优化器是比训练步数更根本的杠杆。
- 体验提升:对于用户可感知的生成任务(长尾召回、专业问答),表示容量直接转化为更少的“幻觉”和更精准的召回。
- 架构决策优先权:论文发现优化器带来的频谱偏移经常超越注意力秩、位置编码等架构改动,因此企业在做模型选型时,应把优化器选择提升为与架构设计同等优先的决策。
与现有产品 / 工作流的接口
- 即插即用替换:主流框架(PyTorch、JAX)均原生支持自定义优化器,只需在训练配置中将
optimizer从AdamW改为Muon(项目页 提供源码),无需改动模型代码、数据流水线或部署链路。 - 渐进式验证:企业可在已有训练流程中,先用小规模宽度扫描(如 160M 参数)快速测量硬 – 软秩不对称性,验证 Muon 在自己数据上的增益,再决定是否全量迁移,避免盲目升级。
- 与架构协同:论文建议优化器–架构协同设计,例如未来在优化器中显式约束更新秩,以匹配特定 FFN 结构;这为训练框架厂商(如 PyTorch Lightning、Hugging Face Trainer)提供新特性方向:在自动超参搜索中加入优化器几何分析。
具体落地用例
- 电商搜索模型升级:某在线零售商拥有数十亿商品 SKU,训练一个 1B 级 Transformer 搜索语言模型。使用 Muon 替代 AdamW,在相同宽度和训练成本下,长尾商品查询的 recall@10 预计提升 5-8%(基于文中硬秩扩展差距),且无需额外人工标注长尾数据。
- 医学文献摘要生成:一家临床决策支持公司训练医疗 GPT 模型,Muon 可让模型更有效地将新增 FFN 宽度转化为对罕见疾病名称、药物名的表示空间,降低关键信息遗漏率,同时保持训练时长不变。
局限
- 实验主要在 GPT-2 规模的模型(160M 和 350M 参数)上进行 FFN 宽度扫描,结论是否适用于数十亿参数的大型 Transformer(如超过 1B)尚不明确。大型模型可能因稀疏性、深度或其他架构差异表现出不同的谱容量利用模式,限制了将优化器作为独立缩放轴的推广。
- 研究仅对比了 AdamW、Muon 及低秩变体 Dion,未涵盖 Lion、Sophia、Shampoo 等现代优化器。不同优化器的隐式正则化与更新动态可能产生多样化的谱容量效应,缺失这些比较使得无法全面评估优化器诱导的谱缩放差异的普遍性,降低了对实用优化器选择的直接参考价值。
- 分析集中在 FFN 输出表示上,未考察注意力模块或残差流等其他组件。优化器可能在整个网络中产生非均匀影响,且固定架构仅变化宽度的实验设计未能揭示架构维度(如深度、头数)与优化器的交互,离实现真正的优化器-架构协同设计仍有距离,工程指导性受限。