论文

一层就够?训练单个 Transformer 层可媲美全参数 RL 训练

一层就够?训练单个 Transformer 层可媲美全参数 RL 训练

强化学习(RL)已成为大语言模型(LLM)后训练的核心环节,但 RL 适应如何分布在 Transformer 各层之中仍知之甚少。现有方法通常统一更新所有模型参数,隐含假设每层对 RL 后训练带来的收益贡献相同。本文通过系统的逐层研究挑战这一假设。 我们引入 层贡献量(layer contribution),衡量单独训练某层所能恢复的全参数 RL 改进的比例。在涵盖 Qwen3、Qwen2.5 两种模型家族、GRPO、GiGPO、Dr. GRPO 三种 RL 算法以及数学推理、代码生成、智能体决策等多种任务的实验中,观察到惊人稳定的模式:RL 的收益高度集中于少数 Transformer 层,许多情况下甚至只集中于单层。更显著的是,高贡献层总是集中在 Transformer 堆叠的中部,而靠近输入和输出端的层贡献明显偏小。这种层重要性排序在不同数据集、任务、模型家族和 RL 算法之间保持强相关。

论文精读

TL;DR 训练单个 Transformer 层即可达到甚至超过全参数 RL 微调的效果,RL 增益高度集中于中部层,颠覆了均匀更新所有层的常规认知。

问题

问题背景

大语言模型后训练中,强化学习(RL) 已广泛用于提升推理、代码生成等复杂任务。但 RL 适应过程如何在 Transformer 各层分配表征能力,仍是一个黑箱。

现有方法局限

当前主流的 全参数 RL 训练 默认对全部 Transformer 层施加均匀更新,隐含假设各层贡献等同。这带来三个具体局限:

  • 计算浪费:全量梯度计算与通信占用大量显存和时间,尤其对深层模型;
  • 优化冲突:底层通用知识可能被覆盖,顶层任务特化表示被扰动,导致遗忘或训练不稳定;
  • 缺乏层粒度控制:无法识别并保护高贡献层,或收缩低贡献层,限制了训练效率与效果的上界。

为什么这个问题难 / 重要

难点在于需要跨模型族、跨 RL 算法、跨任务域进行大规模系统性实验,才能可靠分离出层贡献模式,而 RL 训练本身的随机性与策略多样性进一步增加了分析难度。揭示层贡献分布后,可以设计 层自适应学习率层选择性训练 等策略,显著降低训练开销,同时保持或提升性能。这对云端大规模微调、边缘设备适配等工程场景具有直接降本增效的价值。

行业类比

类似模型剪枝中发现的 结构稀疏性,层贡献集中性可类比为“层级裁剪”先验,如同知识蒸馏中学生网络只需模仿教师模型关键层的表示,就能接近全层效果。

核心洞察

  • RL 训练中的性能增益高度集中于少数中间层,而非均匀分布在全模型参数中。与传统全参数 RL 微调假设不同,该工作通过系统实验证明,仅训练单个层即可恢复大部分甚至全部全参数训练的性能提升,且这一模式在多种模型、算法和任务上稳定重复。这直接挑战了当前均匀更新所有层的工程惯例,为选择性参数更新和计算资源优化提供了实证依据。
  • 高贡献层的分布呈现跨任务、跨模型、跨算法的强相关性,中间层集中了主要改进,而输入输出端层贡献甚微。这种结构一致性揭示了 RL 适应过程中可能存在与 Transformer 架构深度绑定的通用机制,而非任务特定的偶然现象。基于此,作者进一步提出了层自适应学习率和层选择性训练等实用方法,验证了仅训练高贡献层即可超越全参数训练的效率,为低成本 LLM 后训练提供了新范式。

方法

研究目标与输入

本工作旨在量化 RL 后训练中 Transformer 各层的贡献分布,输入包括:

  • 预训练 LLM(Qwen3, Qwen2.5-Math, Qwen2.5-Instruct, DeepSeek-Distilled-Qwen 等 7 个模型);
  • RL 算法(GRPO, GiGPO, Dr. GRPO);
  • 下游任务(数学推理 NuminaMath-CoT, DeepScaleR, 代码生成 DeepCoder, Skywork-OR1, 智能体决策 ALFWorld)。

关键模块:单层训练与层贡献度量

单层训练(Single-Layer Training):对模型逐层进行独立的 RL 训练,仅更新指定层参数(其余层冻结),并与全参数 RL 训练对比。为公平比较,所有实验保持相同的优化器、学习率调度与训练步数,并对各层学习率进行消融以消除超参数影响。

层贡献(Layer Contribution):定义为单层训练恢复全参数 RL 增益的比例:

层贡献 = (单层训练性能 − 基线性能) / (全参数 RL 性能 − 基线性能)

其中基线为未 RL 训练的初始模型。该指标归一化后可直接跨任务、跨模型对比各层的相对重要性。

一致性分析:在多种实验条件下统计每层贡献,计算跨数据集、任务、模型家族和 RL 算法的层排名相关性,检验贡献模式的稳定性。

输出与工程启示

实验输出每一层的贡献度排名,揭示出高度可重复的模式:

  • 贡献集中在中间层,最上层与最下层贡献远低于中段;
  • 这一模式在数学推理、代码生成、智能体决策等任务中均成立;
  • 单层训练已能恢复全参数 RL 绝大部分甚至超过的增益。

基于此发现,作者提出两种层自适应训练策略

  • Layer-Adaptive Learning Rate:按层贡献比例分配学习率,高层贡献层使用较大学习率;
  • Layer-Selective Training:仅更新贡献最高的若干层,冻结其余,在保持或提升性能的同时大幅减少计算开销。

与同类方法的差异

以往层重要性研究多聚焦于预训练或监督微调,本工作首次在 RL 后训练场景中系统量化层贡献,并发现仅训练单个中间层即可匹敌全参数训练,揭示了 RL 增益分布极端的稀疏性,为高效 RL 微调提供了新的理论依据。

实验

实验设计

作者对 7 个模型(含 Qwen3Qwen2.5 等家族)、3 种 RL 算法GRPOGiGPODr. GRPO)及多个任务领域(数学推理、代码生成、智能体决策)进行了系统性的逐层 RL 训练。他们隔离训练每个 Transformer 层,并与全参数 RL 训练对比,引入 layer contribution 指标量化单层恢复全参数收益的比例。训练数据包括 NuminaMath-CoTDeepScaleR 等数学集,DeepCoder 代码集,Skywork-OR1 推理集以及 ALFWorld 智能体环境。

关键发现

实验揭示一个高度一致的模式:RL 收益极度集中于少数中间层,甚至单一层。仅训练一个中间 Transformer 层即可恢复全参数训练的大部分性能提升,某些情况下甚至超越后者。层贡献排名在跨数据集、跨任务、跨模型家族、跨 RL 算法间保持强相关,而输入输出层贡献显著偏低。此外,高贡献层组合的多样性表明,不同层可能解决不同子问题,通过多数投票可进一步互补。

与基线对比

基线为传统全参数 RL 训练,该方法均匀更新所有层。本研究证明这种假设并非必要:单层训练在性能上接近或超过基线,同时大幅降低计算开销与内存占用。这一发现冲击了“每层同等重要”的固有观念,为层级自适应学习率层级选择性训练等高效后训练策略提供了直接依据,对 RL 微调的工程部署具有重要指导意义。

行业影响

落地场景

单层微调层自适应 RL 可大幅降低 LLM 强化学习后训练的计算成本,适用于任何需要 RL 微调的产品线:

  • 数学推理与代码助手:在数学题解答、代码生成等任务上,仅更新中间某几层就能达到全参数训练 90%+ 的效果,显著缩短训练时间。
  • 智能体决策:如 ALFWorld 等交互式环境中的规划与执行,同样受益于层选择性更新,让 agent 模型快速适配新环境。
  • 多任务 SaaS 平台:提供 RL 调优服务的云 API 或 MLOps 平台,可按客户任务自适应选择关键层,避免全量微调的资源浪费。

商业价值

降本 是核心驱动力:

  • 训练计算量可减少 70–90%(仅更新 1–2 层而非全部 32/70 层),直接降低 GPU 时费和电力消耗。
  • 减少显存占用,允许在低端显卡或更小集群上微调大模型,降低硬件门槛。
  • 训练时间缩短,加速模型迭代周期,使产品能更快响应市场需求。 增收与体验 方面:
  • 相同预算下可支持更多 RL 实验,提升模型最终性能,进而改善产品体验(如更高解题正确率、更准确代码生成)。
  • 轻量化微调便于针对细分客户快速定制模型,开辟新营收渠道。

与现有产品 / 工作流的接口

集成方式极为平滑:

  • 现有 RL 框架(如 TRL、VeRL、OpenRLHF)只需增加层选择掩码或学习率缩放层,改动量很小。
  • 模型管理:保存的 checkpoint 仅需存储差异层权重,而非全量参数,降低存储和传输成本。
  • 自动化层选择:可先运行一次轻量的“层贡献扫描”来确定高贡献层,然后对其针对性训练;该扫描本身开销远低于全 RL 训练。
  • 学习率规划:对高贡献层用标准学习率,其余层冻结或用极低学习率,防止无关层漂移并保持预训练知识。

具体落地用例

  1. 数学辅导 SaaS 平台
    使用 GRPO 对 Qwen 系列模型做数学推理增强。常规需全参数训练 4×A100,现只需更新中间第 15–20 层(贡献最高),可在单卡 A100 上完成,成本降低 70% 且准确率几乎持平。平台可为不同年级或教材快速定制专属推理模型。

  2. 企业级 Chatbot 的智能体扩展
    金融或 IT 服务 bot 需通过 RL 学习在复杂数据库查询或工单系统中多步决策。利用 GiGPO 仅更新中间层,可将新行为策略的训练时间从 2 天压缩到 4 小时,且不损害原有对话能力。快速部署后,任务解决率提升且资源消耗可控。

局限

  • 实验仅在 1.5B 至 7B 参数规模的模型上进行,未涉及更大规模(例如 70B 或以上)的验证;层贡献模式是否在更大规模模型上保持稳定、以及单层训练的增益是否同等显著,仍不明确。
  • 层贡献的定义基于**单独训练某一层**恢复全参数 RL 训练增益的比例,该指标未能捕捉层间交互(例如前向传播中组合效应)对 RL 训练的贡献,可能低估或高估某些层在联合训练中的实际重要性。
  • 论文仅覆盖数学推理、代码生成和简单 agent 决策任务,对于需要复杂语言理解或生成的任务(如多轮对话、长文本摘要)未进行验证,层贡献集中现象在这些场景下的普适性存疑;且提出的层自适应学习率等方法仅在特定实验配置下展示优势,尚缺乏与更广泛微调策略(如 LoRA、Adapter)的公平对比。
论文Zijian Zhang2026-07-02原文

相关内容