只需最少 RLVR 训练:通过 Rank-1 轨迹外推 LLM
基于可验证奖励的强化学习(RLVR)已成为提升大语言模型推理能力的主流范式,但其参数轨迹的底层几何结构仍未充分探索。本工作揭示 RLVR 权重轨迹具有极低的秩且高度可预测:大部分下游性能增益可由参数差分的 秩一近似 捕获,且该投影的大小随训练步数近乎线性增长。 基于此,我们提出 RELEX(REinforcement Learning EXtrapolation),一种简单且计算高效的方法。该方法从短观测窗口估计秩一子空间,并通过线性回归外推未来检查点,无需学习模型。在 Qwen2.5-Math-1.5B、Qwen3-4B-Base、Qwen3-8B-Base 三个模型上,RELEX 生成的检查点在领域内和领域外基准上匹配甚至超越完整 RLVR 训练的性能,所需训练步数仅为其 15%。特别地,RELEX 能在零训练成本下外推至远超观测窗口的范围(例如仅观测前 50 步,外推至 1000 步)且性能持续提升。 消融实验证实 RELEX 的极简充分性:提升子空间秩或采用非线性建模均无进一步收益。其成功源于 去噪效应:将更新投影到秩一子空间后,模型丢弃了本会在外推中降低性能的随机优化噪声。代码已开源。
论文精读
TL;DR RLVR 训练中权重更新轨迹呈现极低秩且近线性,RELEX 仅用前 15% 步骤观测,通过秩-1 线性外推生成的 checkpoint 性能超越完整训练,成本大幅降低。
问题
问题背景
当前,基于可验证奖励的强化学习(RLVR)已成为提升大语言模型推理能力的主流范式。然而,完整的 RLVR 训练通常需要数千步的梯度更新,计算成本极高,且中间 checkpoint 的存储与选择进一步增加了工程负担。
现有方法局限
常规 RLVR 流程直接对所有参数进行高维优化,训练过程中权重轨迹的低秩结构未被有效利用。这导致两方面的低效:
- 训练成本高:必须跑完预定的所有训练步数,无法提前预测模型收敛趋势或跳过冗余步骤,造成大量 GPU 小时浪费。
- 缺乏对训练动态的解析:现有方法将 RLVR 当作黑盒优化,无法从训练早期的有限步数中提炼出模型性能持续提升的规律,因此难以实现计算高效的模型外推。
为什么这个问题难且重要
RLVR 的高成本本质在于高维权重空间的优化与长度依赖的探索。具体挑战有:
- 随机噪声干扰:优化过程中的随机梯度噪声会掩盖真实的性能提升方向,使得简单线性投影或插值方法在外推时迅速累积误差。
- 低秩假设的验证与利用:尽管已有工作猜测微调过程中的权重变化具有低秩性,但在 RLVR 场景下,该假设的稳定性与可预测性从未被严格验证,更缺乏基于此的实用外推算法。 业界对降低 RL 训练总计算量的需求极为迫切,因为从大模型到 agent 系统的迭代均依赖快速、低成本的 RL 微调。
行业类比
就像在自动推理 agent 开发中,仅需观察 agent 在少量任务上的学习曲线,即可外推其未来表现并直接获取高质量策略,而不必跑完完整的 RL 训练,这将极大缩短模型迭代周期。
核心洞察
- RLVR训练的参数轨迹呈现极低秩,主成分幅度近乎线性增长,只需少量观察步骤即可准确外推未来模型性能。这与以往需要复杂动态建模(如非线性的缩放法则或插值方案)的工作截然不同,揭示了在可验证奖励驱动下,LLM的微调更新实际上沿着一个极低维流形推进,使得通过简单线性外推即可捕捉大部分收益,大幅降低了预测长程训练动态的计算成本。
- RELEX仅用rank-1子空间与线性回归,无需额外训练,就能在外推中匹配甚至超越完全RLVR训练,其核心在于通过 **rank-1 投影** 丢弃随机优化噪声,形成 **去噪** 效应。这与普遍追求更高秩或非线性建模的直觉相反,证明了在RLVR这种高信号场景下,最简方案即可实现最优泛化,为工程实践提供了极低成本的模型改进范本。
方法
RELEX 方法:基于 Rank-1 轨迹外推的极小样本 RLVR 训练
输入
- RLVR 训练观测窗口:在完整 RLVR 训练的前 (T_{\text{obs}}) 步中,每隔一定步数保存的 LLM 参数检查点(即权重快照)。
- 基础模型权重 (\theta_0)(RLVR 初始参数)。
关键模块与处理流程
Rank-1 子空间估计(SVD 降维)
- 对观测窗口内每一步相对于 (\theta_0) 的 参数增量 (\Delta\theta_t = \theta_t - \theta_0) 进行组装,得到形如
[num_steps×num_params]的矩阵。 - 对该矩阵执行 奇异值分解(SVD),提取最大奇异值对应的 rank-1 方向向量 (u_1),作为参数变化的主方向。该方向捕获了性能增益的绝大部分信息。
- 对观测窗口内每一步相对于 (\theta_0) 的 参数增量 (\Delta\theta_t = \theta_t - \theta_0) 进行组装,得到形如
线性外推投影系数
- 将每个观测步的 (\Delta\theta_t) 投影到 (u_1) 上,得到标量系数 (c_t = u_1^\top \cdot \text{vec}(\Delta\theta_t))。
- 观察到 (c_t) 与训练步数 (t) 近乎线性,因此使用最小二乘法对 ((t, c_t)) 拟合一条直线,得到 (c(t) \approx a \cdot t + b)。
预测未来权重(零训练成本)
- 对于任意目标步数 (t_{\text{future}})(可远超观测窗口,如 10-20 倍),直接用线性函数计算 (c(t_{\text{future}}))。
- 预测参数为 (\theta_{\text{pred}}(t_{\text{future}}) = \theta_0 + c(t_{\text{future}}) \cdot u_1)。该过程不需要任何额外训练,仅做一次向量加法。
输出
- 任意未来步数的 外推检查点,在数学推理等任务上达到或超越完整 RLVR 训练的性能,且仅需 约 15% 的 RLVR 训练步数。
方法与同类工作的差异
RELEX 完全摒弃了学习型外推模型(如高阶多项式拟合或神经网络预测器),只依赖 线性回归 + rank-1 投影,既保持了外推的稳定性,又通过 SVD 投影起到“谱去噪”作用,滤除随机优化噪声,使外推检查点的泛化能力更优。
实验
实验设计
研究在 Qwen2.5-Math-1.5B、Qwen3-4B-Base 和 Qwen3-8B-Base 三个模型上进行 RLVR 训练,采集从初始化到收敛的权重检查点序列。通过 SVD 分析参数增量 ΔW 的奇异值谱,确认了其强低秩特性。RELEX 方法仅取前 T_obs 步(如 50 步)的权重轨迹,估计 rank‑1 投影子空间,再对投影系数做线性回归,外推至后续步数,生成预测检查点。基线包括全 RLVR 训练及其他外推方法(如非线性拟合、高阶子空间)。评估覆盖领域内数学推理和领域外泛化基准。
关键发现
- 极低秩与可预测性:RLVR 权重增量
ΔW的 top‑1 奇异值占据支配地位,rank‑1 近似即可恢复大部分下游性能。 - RELEX 高效匹配全训练:仅需 15% 的 RLVR 训练步数,RELEX 生成的检查点在领域内和跨领域基准上达到或超越全 RLVR 模型的成绩,训练成本降低约 80%。
- 鲁棒远距离外推:从 50 步观察窗口出发,RELEX 可稳定外推至 1000 步(20× 跨度),性能仍持续提升。
- 消融证明极简设计:提升子空间秩或多采用非线性回归均无额外收益,线性 rank‑1 外推已足够。
基线对比解读
与传统全量 RLVR 训练相比,RELEX 大幅节省算力且不牺牲性能,本质在于从早期轨迹中提炼了优化过程的 低维信号。相较于其他外推基线,RELEX 的优势源于其内在的 谱去噪机制:投影至 rank‑1 子空间滤除了随机优化噪声,避免误差在长程外推中累积。这使得 RELEX 即使在远远超出观察窗口的步数,其预测的权重仍沿真实优化方向演进,而非常规外推方法在方向与幅值上均发生漂移。与模型合并或缩放律等需大量先验的工作不同,RELEX 无需额外数据或学习器,仅凭线性回归便实现高效外推。
行业影响
落地场景
RELEX 方法可直接应用于所有依赖 RLVR (强化学习可验证奖励) 微调大语言模型的产品线,尤其是需要频繁迭代、资源受限的推理增强业务。典型场景包括:
- 企业级代码助手:在代码生成与调试场景中,用极少步数 RLVR 训练(观察前 15% 步骤)外推得到媲美全量训练的 checkpoint,快速发布新版本。
- 数学 / 科学教育题库生成:教育平台需持续提升模型解题准确率与推理结构化程度,RELEX 使模型只需短时间 RLVR 微调即可外推到远超出观察窗口的步数,降低 GPU 租赁成本。
商业价值
- 降本:RELEX 将 RLVR 训练成本减少约 80%(仅需 15% 步数),且外推过程零训练开销,直接降低云计算 / GPU 集群支出。对于千亿参数模型,节省的算力可达百万美元级。
- 增效:模型迭代速度大幅提升,能够更快响应业务需求变化(如新题库、新领域推理格式)。同时,外推 checkpoint 在分布内与分布外基准上表现持平甚至超越全量 RLVR,不牺牲质量。
- 体验提升:在产品中可提供接近实时更新的模型能力,例如客服机器人推理能力每月升级而非每季度。
与现有工作流的接口
RELEX 可无缝嵌入现有 RLVR 训练流水线:
- 训练观测阶段:在正常 RLVR 训练中保存少量早期 checkpoint(如每 10 步一次)。
- 秩 -1 子空间估计:对参数增量矩阵做 SVD,取最大奇异值对应的秩-1 分量,计算投影系数的时间序列。
- 线性外推:用线性回归拟合系数趋势,直接生成任意未来步数的权重,无需继续训练。
- 集成:可结合现有模型注册中心(如 MLflow)保存外推 checkpoint,服务框架直接加载。无需额外推理框架改动。
具体落地 Use Case
- 电商搜索与推荐推理优化:某电商平台用 RLVR 提升大模型对复杂查询(如“适合 8 岁男孩的生日礼物,预算 30 美元内,不喜欢乐高”)的结构化分解与推理能力。常规 RLVR 需 2000 步训练,RELEX 仅用前 300 步观测即可外推得到 2000 步模型,并继续外推到 4000 步仍保持提升,实现搜索相关性周级迭代,算力成本降低 85%。
- 金融报告自动生成:投行分析系统需模型根据市场数据生成严谨、可追溯的推理报告,使用 RLVR 强化逻辑链。RELEX 允许团队在一个早晨的观测训练后,立即外推出未来一周乃至一个月后的模型状态,直接部署到报告生成管道,使模型更新频率从月级缩短到天级,同时满足合规审查对一致性的要求。
局限
- **观察窗口敏感性**:论文在消融分析中指出,RELEX 的外推效果对所选观察窗口长度敏感。窗口过短会导致低秩子空间估计不准确,过长则失去了减少计算量的意义。不同模型、不同训练阶段的最佳窗口可能不同,目前需要手动调参或依据先验知识,缺乏自适应的窗口选择机制。这在工程部署中引入了额外的调参成本,削弱了方法的即插即用性。
- **低秩假设的局限性**:RELEX 完全依赖 RLVR 参数轨迹的极低秩性质(秩 1),但这一性质仅在论文实验所用的数学推理类 RLVR 任务(基于 Qwen 系列模型)上被验证。若 RLVR 的奖励信号更复杂(如多目标、多模态任务),权重轨迹可能不再保持近似的秩 1 结构,导致外推失败。论文未在其他 RL 范式(如 RLHF/PPO)或更一般的微调场景下测试,通用性存疑。
- **外推权重的工程漂移**:论文附录指出,随外推步数增加,预测的权重在原始参数空间中会逐渐偏离真实 RLVR 轨迹的方向和幅度。尽管该漂移在评测基准上未立即反映为性能下降,但长期或极远外推下可能累积错误,且在实际部署中可能需要权重对齐或校准步骤来保证稳定性,而这些额外工程开销未被计入“零训练成本”的宣称中。