归一化低秩适配(NoRA)
问题:尽管低秩适配(LoRA)广泛用于参数高效模型适配,但如何正则化其训练动态以实现稳定优化仍未充分探索。 方法:由于LoRA将上投影初始化为零,其早期优化动态主要由下投影主导。基于此,我们提出归一化低秩适配(NoRA),在训练中对下投影矩阵进行归一化;并进一步表明,该归一化可仅在初始化时应用,即可改进标准LoRA,无需训练中重复归一化。 实验:在预训练、监督微调和强化学习中,NoRA一致加速收敛、提升性能与稳定性,并缓解灾难性遗忘。 结论:无需额外可训练参数或推理计算,NoRA是LoRA的简单通用增强。
论文精读
TL;DR NoRA 对 LoRA 下投影矩阵做归一化,稳定早期优化动态,加速收敛并提升性能,且零额外参数与推理开销。
问题
问题背景
随着大语言模型规模持续增长,参数高效微调(PEFT)成为降低训练成本的关键手段,其中 LoRA 因其简单高效而广泛应用。然而 LoRA 的优化动力学长期缺乏系统正则化,训练稳定性和收敛速度仍有提升空间。
现有方法局限
标准 LoRA 采用随机初始化的 下投影矩阵 A 和零初始化的 上投影矩阵 B,以保证初始权重更新为零。但这种非对称初始化使训练早期梯度主要由 A 主导,而 A 的随机初始化会带来特征范数不一致,容易导致:
- 优化路径不稳定,需要精细调整学习率;
- 微调时加剧灾难性遗忘;
- 低秩适配器内部权重尺度失衡,影响收敛速度。 已有改进如 rsLoRA 或正交初始化主要关注缩放因子或初始化类型,缺乏对训练过程中 down-projection 的持续正则化,无法根治早期动力学失衡。
为什么这个问题难/重要
LoRA 现在被扩展到预训练、监督微调和强化学习(尤其是 RLVR),这些场景对训练稳定性和收敛速度要求极高。对 down-projection 进行归一化相当于为低秩更新引入预条件,能抑制异常梯度、降低超参敏感性,且不增加任何可训练参数或推理计算。由于改动极小、可无缝嵌入现有 LoRA 工作流,这类正则化方法在工程上具有广泛适用性,是当前高效训练研究的一个高价值切入点。
行业类比
类似 LayerNorm 对深层 Transformer 训练稳定性的关键作用,NoRA 给 LoRA 的 down-projection 提供一个“训练期正则器”,像为低秩适配器内置一个隐式学习率调节器。
核心洞察
- 利用 LoRA 初始化不对称性来引导早期优化。LoRA 将 up-projection **B** 初始化为零,因此训练初期参数更新几乎完全由 down-projection **A** 决定,**NoRA** 通过标准化 **A** 改善梯度尺度与条件数。这一角度独特在于,现有 LoRA 变体通常调整初始化分布、放缩因子或低秩结构,却忽视了这种非对称初始化带来的动力学后果;**NoRA** 直接针对该不对称性,以极低成本稳定优化。
- 标准化操作可仅应用于初始化阶段,而非训练全过程。作者发现,仅对 **down-projection** 矩阵在初始化时做标准化,就足以复制训练期间持续标准化的收益,使 **NoRA** 成为即插即用的 LoRA 增强,不引入额外参数或推理开销。与需要每步归一化的方法如 **WeightNorm** 相比,**NoRA** 的实现和部署成本几乎为零,更适合大规模训练。
方法
NoRA 方法详解
输入 是预训练权重 W0 与低秩适配分支 ΔW = α B A。其中 A 为下投影矩阵(将输入维度映射到低秩 r),B 为上投影矩阵(将低秩映射回输出维度)。标准 LoRA 初始化 A 为高斯随机、B 为零,使 ΔW 初始为零,但早期梯度主要流经 A。
关键模块是归一化操作:NoRA 对下投影矩阵 A 施加归一化,使得 A 的每一行(对应每个低秩维度)具有单位范数或固定尺度。这一操作在训练期间持续执行,或仅在初始化时执行一次(后者称为 init-only NoRA)。归一化维度是可调超参数,论文实验表明在 A 的行方向归一化效果稳定。
从 preconditioning 视角 看,B 初始为零时模型输出由 B A x 中的 B 决定,但梯度更新会同时作用于 A 和 B;若 A 的尺度失衡,会导致早期更新不稳定。归一化 A 等价于对低秩子空间施加了各向同性的 preconditioner,使不同 rank 维度的学习速率趋于一致。此外,归一化 A 与 MiSS 和 block identity matrix initialization 存在理论联系:当 B 零初始化且 A 行归一化时,初始 ΔW 的零空间结构与正交初始化类似,有助于缓解灾难性遗忘。
输出 与标准 LoRA 完全一致:训练完成后 ΔW 可合并回 W0,推理时无需额外归一化或计算,参数量与计算量不变。
与同类方法的差异点:相比 rsLoRA、PiSSA、正交约束 LoRA 等需要重缩放学习率、更改初始化分布或引入额外正则项的方法,NoRA 仅依靠一个简单的行归一化算子,不改动 LoRA 的参数化形式,却能同时加速收敛、提升稳定性和缓解遗忘。
实验
实验设计
论文在三个典型场景验证 NoRA:LLM 预训练、监督微调 (SFT)、以及数学推理上的 RLVR(Reinforcement Learning with Verifiable Rewards)。对比基线为标准 LoRA,并考察归一化维度的影响。具体数据集与模型规模在本摘录中未披露,但实验覆盖了从预训练到对齐的完整 LLM 训练管线。
关键发现
NoRA 在多个任务上一致地加速收敛、提升性能与训练稳定性,并缓解灾难性遗忘。此外,归一化仅在初始化时施加即可获得大部分收益,无需训练中重复归一化。该方法不引入额外可训练参数,也不增加推理时计算。
对比解读
相比标准 LoRA,NoRA 的改进来自对下投影矩阵的归一化,等价于一种预条件 (preconditioning),改善了早期优化动力学。与近期工作如 MiSS 和块恒等初始化相比,NoRA 提供了更简洁的视角和实现,且不需要对模型结构做额外假设。其实用价值在于可作为 LoRA 的即插即用增强,对现有 PEFT 流程侵入性极低。
行业影响
落地场景
NoRA 适用于所有采用 LoRA 进行参数高效微调的场景,包括 LLM 预训练、监督微调 和 强化学习。具体产品与业务可覆盖:
- 电商平台:商品描述生成、推荐文案微调,用 NoRA 替换 LoRA 加速收敛并保持通用能力。
- 内容平台:个性化内容摘要、评论审核模型微调,改善训练稳定性并减少灾难性遗忘。
- 企业服务:客服问答、知识库检索系统,在保持低资源消耗的同时提升领域适配性能。
商业价值
- 降本:NoRA 加速收敛,直接减少训练步数与 GPU 时,降低算力成本;不增加可训练参数,存储与部署开销与 LoRA 相同。
- 体验提升:训练更稳定、性能更好,可提升模型输出质量;缓解灾难性遗忘,让同一基座模型可连续适配多个任务而不退化,延长模型生命周期。
- 增收:更快的微调周期支持更多客户项目或高频迭代;RL 场景下加速策略优化,可能带来更有效的交互系统。
跟现有产品/工作流的接口
- 集成方式:NoRA 可直接替换 LoRA 的初始化与训练策略,只需在
peft或类似库中为 down-projection 矩阵增加归一化操作,代码改动极小。 - 兼容性:归一化既可在训练中持续进行,也可仅在初始化时应用,后者几乎零额外开销,适合现有流水线快速验证。
- 部署:推理时不引入任何额外计算或参数,模型结构不变,可直接复用已有推理优化与部署流程。
局限
- 论文虽然展示了在预训练、监督微调和强化学习上的有效性,但实验主要基于相对较小规模的语言模型或特定数据集(如数学推理 RLVR),未在大规模生产级模型(如 70B 以上)或更复杂的多模态任务上验证。这限制了 NoRA 在超大模型上的泛化结论,实际部署时可能仍需额外验证。
- 归一化维度的选择是一个关键超参数,论文专门分析了其影响,但没有提供自动选择或自适应调整机制。不同层或任务可能需要不同的归一化维度,手动搜索会增加调参成本。此外,训练中持续归一化虽然效果更好,但会引入额外的计算开销(尽管不大),可能抵消部分参数效率优势。
- 与现有 LoRA 正则化方法(如 weight decay、orthogonal regularization、spectral norm 等)的直接对比不足,论文只与标准 LoRA 进行了比较,未充分展示 NoRA 相对于其他正则化策略的相对增益,这削弱了其在已有方法中的定位说服力。