论文

尺寸可忽略,效果显著:大型语言模型中的尺度向量研究

尺寸可忽略,效果显著:大型语言模型中的尺度向量研究

现代大型语言模型(LLMs)中的归一化层由确定性归一化操作和可学习的尺度向量组成。尽管归一化操作已被广泛研究,但尺度向量的作用仍不明确。本文从表达能力、优化和架构三个角度对LLMs中的尺度向量进行了系统研究。 首先,实验表明即使尺度向量仅占模型参数的极小部分,移除它们会显著降低LLM预训练性能。理论分析进一步揭示,在Pre-Norm架构中,尺度向量并不增加表达能力,而是通过自放大预条件效应改善后续线性映射的优化。其次,研究了权重衰减对尺度向量的影响。通过区分Input-Norm层和Output-Norm层,理论指出权重衰减对前者有益,但对后者有害,原因是它们在优化和表达能力中扮演不同角色。 基于以上理解,提出了三种轻量且互补的改进: 1. 分支特异性异构(branch-specific heterogeneity) 2. 线性映射周围改进放置 3. 幅度-方向重参数化(magnitude-direction reparameterization) 理论和实验均表明每项改进带来一致增益。最后,将这些改进合并为统一的尺度向量策略,并在密集和混合专家模型(0.12B至2B参数)上进行了大规模LLM预训练实验,使用多种优化器和学习率调度,在工业级token预算下,统一策略比调优基线实现了更低的终末损失(terminal loss)和更优的缩放行为,且参数和计算开销可忽略。

论文精读

TL;DR 本文揭示 LLM 中参数量极小的 scale vectors 对预训练至关重要,通过理论分析其优化作用,提出三项互补改进,在 0.12B–2B 模型上一致降低最终损失,提升缩放性能。

问题

问题背景

现代 LLM 的归一化层(如 LayerNormRMSNorm)由确定性的归一化操作和一个极小的可学习 scale vector(例如 γ 参数)组成。归一化操作本身已被广泛研究,但 scale vector 虽然参数量占比可忽略(通常不到模型总参数的 0.1%),却在预训练中不可或缺。其作用机制与优化特性一直缺乏系统理论解释,业界常沿用默认设计,缺乏针对性优化。

现有方法局限

当前对 scale vector 的处理存在三大盲区:

  1. 位置无差别:不区分 Input-Norm(如注意力或 FFN 输入前的归一化)与 Output-Norm(如残差分支输出后的归一化),导致优化策略粗放。例如,对两类 scale vector 统一施加 weight decay 可能对一部分有害;
  2. 同构假设:所有层、所有分支的 scale vector 共享相同设计,忽略了 注意力分支FFN 分支 在优化动态上的差异,限制了性能上限;
  3. 参数形式单一:scale vector 常作为纯 magnitude 参数直接学习,未利用方向与幅度解耦带来的预条件(preconditioning)优势。

为什么这个问题重要且困难

  • 技术挑战:scale vector 在 Pre-Norm 架构下并不增强模型表达能力,其核心作用体现在优化过程——通过 自放大的预条件效应(self-amplifying preconditioning)改善后续线性映射的 Hessian 条件数。但这一定量关系需要深入的理论刻画,否则难以可靠地改进设计。
  • 工业价值:LLM 预训练成本极高,在几乎不增加参数和计算开销的前提下,任何能稳定降低终端损失(terminal loss)或提升扩展律(scaling behavior)的改进都有巨大吸引力。然而,scale vector 的改动可能干扰整体优化动力学,必须建立在严格理论之上,避免负向交互。

行业类比

这类似于 LoRA 等参数高效微调方法:以几乎零成本引入的微量参数,却通过对优化轨迹的微妙影响撬动大模型行为,本质是“小参数撬动大优化”的设计哲学。

核心洞察

  • 移除仅占参数极小比例的 scale vectors 会显著损害 LLM 预训练性能,但理论证明它们并不增强模型表达性,而是通过自放大预条件效应改善优化动态。这突破了对归一化层仅作训练稳定器的传统认知,将其重新定位为隐式的优化加速器,为轻量级架构改进提供了高杠杆切入点——聚焦此类微结构比盲目扩增参数能更高效地提升训练质量。
  • 权重衰减对 scale vectors 的影响因归一化层类型而异:对 Input-Norm 层施加有益,对 Output-Norm 层则有害。这一区分澄清了优化器配置中的常见误区,揭示出不同类型归一化层在表达性与优化上的不同分工。相比全局应用衰减的常规做法,按层类型差异化调整能无额外成本地改善训练动态,为超参数精细调校提供了理论依据。
  • 基于对 scale vectors 作用机制的理解,提出的分支特异性异构、围绕线性映射的合理放置和幅度-方向重参数化三项改进,以极低参数和计算开销(<0.1%)一致降低了终端损失并优化了扩展行为。与增加模型规模或深度等粗粒度方案相比,这种聚焦归一化细节的结构性优化提供了高性价比的性能增益,可直接无缝集成于现有预训练流程,对实际工程部署有显著价值。

方法

方法核心:系统分析 Pre-Norm LLMs 中 scale vectors 的优化与表达性角色,并基于理论发现提出三项轻量改进,组合成统一训练策略。

分析阶段:拆解 scale vectors 的作用

  • 必要性验证:移除 scale vectors(仅占参数量 0.1% 级别)导致预训练损失显著上升,理论证明其在 Pre-Norm 架构下不增加模型表达性,但能通过自增强预处理效应改善后续线性映射的优化地貌,即 scale vector 的幅值会自适应调节梯度流。
  • 权重衰减的二分性:区分 Input-Norm(位于残差分支输入)与 Output-Norm(位于残差分支输出)两类 scale vectors,证明权重衰减对 Input-Norm 有利(抑制其过度增长以稳定优化),对 Output-Norm 有害(削弱其必要的幅值增长以维持表达性),需差异化配置。

改进设计

  1. 分支异质性(Branch-Specific Heterogeneity):为注意力、FFN 等不同残差分支分配独立 scale vectors,打破原共享向量带来的优化耦合,允许各分支自适应调节。
  2. 优化放置(Improved Placement):在 Q/K/V 线性投影之后放置 scale vector,而非标准位置(投影之前),使预处理效应直接作用于激活分布的最终形态,理论证明可降低 Hessian 条件数。
  3. 重参数化(Magnitude-Direction Reparameterization):将 scale vector 分解为幅值标量 g 与方向单位向量 u,分别优化,防止幅值过大导致训练不稳定,同时保持方向学习。

统一策略

将上述三项改进叠加到标准 Pre-Norm LLM,形成 统一 scale-vector 策略:在 Input-Norm 层关闭权重衰减,在 Output-Norm 层开启权重衰减;为每个分支使用独立 scale vector 并置于线性映射之后;对 scale vector 做幅值 - 方向解耦优化。该策略可直接嵌入 AdamW、Muon 等优化器,适用于 Dense 与 MoE 架构,仅增加可忽略的参数量与计算开销。

与同类方法的差异:以往工作将 scale vectors 视为普通可学习参数,本研究首次揭示其优化本质并提出分类处理原则,用极低成本实现训练稳定性和最终损失的持续改善。

实验

实验设计:系统研究了 scale vectors 对 LLM 预训练的影响,从三个层面展开:(1) 直接移除 scale vectors,观察性能退化;(2) 区分 Input-NormOutput-Norm 层,分析 weight decay 的相反作用;(3) 提出并验证三个轻量改进——分支异质性、更优的线性映射附近放置、幅度 - 方向重参数化。最终在 0.12B 至 2B 参数denseMoE 模型上,结合多种优化器(如 AdamW、Muon)和学习率调度(如 wsd),使用工业规模 token 预算预训练,对比统一改进策略与精心调优的基线。

关键发现:scale vectors 仅占模型参数的极小比例,但移除后严重损害预训练;理论证明在 Pre-Norm 架构下,scale vectors 不增强表达能力,而是通过自放大预条件效应改善后续线性映射的优化。Weight decay 对 Input-Norm 层有益,对 Output-Norm 层有害。三个改进各自带来一致增益,且统一后始终获得更低的终端损失和更优的缩放行为,参数与计算开销几乎为零。

与基线对比解读:基线为标准的 scale vector 使用方式(全局施加 weight decay),统一策略在同等条件下将终端损失降至更低,并在模型规模增大时,保持缩放优势,避免了基线可能出现的优化瓶颈。这证明了基于理论理解的结构化改进,能够在不引入额外成本的情况下,实质性提升大模型的预训练效率与最终性能。

行业影响

落地场景

本研究揭示的 scale vectors 优化策略可直接应用于所有采用 Pre-Norm 架构的大语言模型(LLM)预训练与微调流程,覆盖 稠密模型混合专家模型(MoE)。对于正在进行 LLM 自研的云服务商、AI 平台以及垂直行业模型提供商,该策略可作为 即插即用 的组件嵌入训练栈,无需额外计算或参数开销即可获得一致的终端损失下降与更优的 scaling 行为。

商业价值

从商业指标看,该策略在同等算力预算下降低训练 loss,等同于提升模型性能或缩短训练时间,直接带来 成本节约。此外,通过改进 scale vectors 的权重衰减策略(区分 Input-Norm 与 Output-Norm),可避免训练后期输出层退化,从而提升模型收敛稳定性与最终效果,对 SaaS 化模型服务 的交付质量与客户续约率有正向影响。统一策略在多种优化器(如 Muon)和学习率调度下均有效,降低了超参搜索成本,加速模型迭代。

与现有工作流的接口

集成路径清晰:

  1. 在现有 Transformer 实现中,将 scale vectors 从统一参数分解为 分支特定异构参数(如注意力分支与 FFN 分支使用独立 scale)。
  2. 调整 scale vectors 的放置位置,使其 紧邻线性映射 以最大化预条件效果。
  3. 对 scale vectors 实施 幅度-方向重参数化,增强优化稳定性。
  4. 按层类型配置 权重衰减:Input-Norm 层施加衰减,Output-Norm 层移除衰减。

这些改动仅涉及模型定义与优化器配置,无需修改训练框架核心,可与现有 FSDP、DeepSpeed 等分布式方案无缝兼容。

具体落地场景

  • 电商搜索推荐:在商品理解模型预训练中采用该策略,同等算力下获得更低困惑度,可提升语义相关性匹配精度,改善零样本分类能力,支持多语言商品描述统一表征。
  • 企业知识管理:为 SaaS 平台内部的文档问答模型微调提供更稳定的基础模型,减少下游任务适配时的 loss spike,降低客户因模型效果波动导致的工单量,提升 NPS。

局限

  • 论文的理论分析主要建立在 Pre-Norm 架构和线性化假设之上,未深入探讨 Post-Norm 或 DeepNorm 等变体,因此结论的普适性可能受限。实验规模最大仅至 2B 参数,对于当前工业界常规的 7B~70B 甚至更大模型,所提出的改进策略是否仍能保持一致的增益和稳定的缩放行为,尚缺乏直接验证。此外,理论部分对 Hessian 锐度的讨论依赖局部二次近似,实际高维非凸优化中的行为可能更为复杂。
  • 所提出的三项改进(分支异质性、放置优化、幅值-方向重参数化)虽然在消融中各自有效,但组合时可能引入额外的超参数(如不同分支的 scale 初始化、权重衰减的区分),这会增加实际调参的负担。特别是权重衰减对 Input-Norm 和 Output-Norm 层的相反作用,要求工程师在训练时对不同层类型施加差异化的正则化策略,若没有论文中的理论指导,可能难以凭经验调出最优配置。
  • 该工作主要关注缩放向量本身的改进,没有联合优化归一化操作(如 RMSNorm 的 eps 或 affine 设计)或与其他训练技巧(如 LayerDrop、模型并行策略)的交互。在实际大模型训练中,缩放向量的增益可能被其他因素的波动掩盖,且论文未在更大 batch size 或不同数据分布下进行鲁棒性测试,因此其方法在极端训练条件下的表现仍有待评估。
论文Mingze Wang2026-05-26原文

相关内容