论文

不只是何处,更是何时:RLVR 的时间调度

不只是何处,更是何时:RLVR 的时间调度

可验证奖励强化学习 (RLVR) 已成为大语言模型 (LLM) 后训练的核心技术。然而,现有方法使用全局标量奖励驱动所有采样 token 的策略优化,忽略了轨迹中异构策略行为的差异。现有工作通过信用分配(如 token 级优势重加权、选择性 token 优化)来缓解此问题,但其分配标准在训练过程中静态不变,限制了策略的自适应演化。 本文提出引入时间维度,即调度信用分配准则在 RLVR 优化过程中的变化。核心发现是:优先关注具有特定策略行为的针对性 token,并逐渐向通用优化衰减,可带来更稳定、高效的训练动态。具体地,简单轨迹百分位能为区分策略行为提供自然视角,并与时间调度有效结合。分析表明,标准优化在处理异构行为时大幅牺牲策略熵,而时间调度则产生更健康的策略演化。 在数学和通用推理基准上的实验表明,时间调度能持续提升性能,证实其是一个有前景的优化维度。

论文精读

TL;DR 将 RLVR 的信用分配从静态准则扩展到时间调度维度:训练前期优先优化特定行为 token,后期逐步衰减至全局优化,显著提升策略熵保持与推理性能。

问题

问题背景

RLVR(使用可验证奖励的强化学习)已成为 LLM 后训练的核心范式,通过在轨迹级标量奖励信号下优化策略,显著提升了数学推理、代码生成等任务性能。然而,轨迹内部不同 token 的策略行为存在显著异质性:部分 token 负责探索性假设(如数学推理中的关键步骤),部分 token 仅用于确定性解码。现有方法大多以统一梯度信号更新所有 token,未能区分这种差异。

现有方法局限

当前信用分配方法试图区分 token 重要性,主要包括两类:token 级优势重加权选择性 token 优化。但它们存在共同缺陷:

  • 分配准则静态固化:阈值、权重或 mask 在整个训练过程中保持不变,无法适应策略进化阶段的变化。例如,初期可能需更多探索性 token 强化,后期则需稳定确定性路径。
  • 忽视策略熵损伤:标准优化同时容纳所有行为模式,导致策略熵过早坍缩,模型过早确定化、丧失多样性,影响长期探索能力和最优解发现。

为什么这个问题难 / 重要

RLVR 的优化本质是一个 非平稳信用分配问题(non-stationary credit assignment):不同训练阶段需要强调不同的 token 子集。如果分配准则无法随课程推进而调整,则要么过度强化低频高奖励的随机性模式(导致方差),要么抑制关键推理链的探索(导致欠拟合)。作者发现,引入时间维度动态调度分配准则——早期优先针对性 token、后期逐步衰减至全局优化——能保持更健康的策略熵演化,并获得稳定的性能增益。这为 RLVR 优化开辟了新维度,在数学(如 MATH)与通用推理(如 ARC)基准上均观察到一致提升。

行业类比

类似课程学习在训练中安排样本顺序,或学习率调度按迭代调整步长,时间调度可视为在 RLVR 中对"学习信号在哪里分配"引入"何时侧重"的调控,对需要精细控制策略探索-利用平衡的场景(如 LLM 推理、具身智能决策)有直接参考价值。

核心洞察

  • **信用分配的时间调度** 将 RLVR 中的学习信号设计从静态“空间分配”扩展为动态“时间调度”,强调训练早期应优先强化特定策略行为对应的 token,再逐步过渡到全局优化。这与以往固定信用分配标准(如固定的 token 级优势重加权或选择性优化)形成鲜明对比,使得策略进化更稳健,避免了早期同时拟合多样行为导致的熵崩溃。
  • **轨迹百分位数** 作为一种简单无参数的启发式方法,能有效区分 LLM 推理轨迹中的异质策略行为,并与时间调度机制自然结合。相比复杂的 token 级信用分配模型,该方法无需额外训练,计算开销低,且在数学及通用推理基准上持续提升表现,揭示了“粗糙但自适应”的信号筛选有时优于精细的静态分配。

方法

方法概述

本文提出在 RLVR(可验证奖励的强化学习)中引入时序调度(temporal scheduling) 维度,动态调整信用分配(credit allocation)的侧重点,以提升策略学习的稳定性与效率。

输入与基础框架
  • 输入:语言模型策略 π_θ,一组可验证奖励任务(如数学推理),每条轨迹采样自当前策略,并获得全局标量奖励 r
  • 基础 RL 优化:使用类似 PPO 的策略梯度,但信用分配不再对所有 token 均等对待。
关键模块 1:基于轨迹百分位数的行为区分
  • 计算每条轨迹的策略行为指标,例如轨迹对数概率 log π 或优势值分位数。
  • 根据该指标将所有轨迹划分为不同百分位区间(如 top-k%、bottom-m%),每个区间反映不同的策略行为模式(高奖励但低熵的“利用型”与低奖励但高熵的“探索型”)。
关键模块 2:时序调度信用分配
  • 选取一个信用分配代理(proxy),例如 token 级优势重加权选择性 token 优化,该代理决定哪些 token 获得更强的学习信号。
  • 在训练早期,优先针对具有特定策略行为的 token(如那些处于高奖励轨迹中但策略不确定 token),通过增大其优势权重或仅优化这些 token 来强化有利行为。
  • 随着训练推进,逐步衰减针对性,最终过渡到对所有 token 的一般优化。该过程由调度函数(如余弦退火)控制,将训练步数映射为一个注意力系数 λ(t),用于控制分配准则的选取范围。
输出与学习动态
  • 输出更新后的策略参数。相比固定分配的做法,时序调度在早期允许策略专注于关键 token 的高效探索,后期回归全面优化,从而避免策略熵过早崩塌,并缓解同时适应异质行为带来的优化冲突。
与同类方法的差异

现有工作(如 TOKEN-AWAREDAPO)的信用分配准则在整个训练过程中保持不变,而本文首次引入时间维度上的动态调度,使分配标准随学习阶段自适应演变,更贴合策略从探索到收敛的自然进程。

实验

实验设计

本文在 数学推理通用推理 两类基准上验证 Temporal Scheduling for RLVR。基线包括:

  • 标准 RLVR(如 GRPO / PPO,全局标量奖励驱动所有 token 优化)
  • 静态 Credit Allocation(固定 token 级优势重加权或选择性优化,如 RLOO、DAPO)

实验以 轨迹百分位数(trajectory percentiles)作为区分策略行为的代理,按奖励高低将轨迹分档,并对不同档位的 token 实施差异化学习信号。调度函数控制训练过程中这些档位的关注度:早期聚焦于高奖励(或低奖励)轨迹中的代表性 token,后期平滑过渡到全体 token 的统一优化。消融实验考察了调度函数类型、百分位阈值等超参影响。

关键发现

  1. 策略熵分析:标准 RLVR 在同时适应异质行为(奖励高 / 低的轨迹)时,策略熵出现明显下降,表明模型过早丧失探索能力;而 时间调度 能维持更健康的熵演化,训练更稳定。
  2. 性能提升:在数学与通用推理任务上,时间调度相比静态分配取得 一致改进,且对多种 Credit Allocation 代理(如基于优势的重加权、选择性优化)均有效。
  3. 调度重要性:学习信号“何时”分配与“何处”分配几乎同等重要,单纯依靠固定规则会限制策略弹性演化。

与基线对比的深度解读

静态 Credit Allocation 方法在整个训练周期内采用同一个标准区分 token 重要性,无法适应策略的阶段性需求。例如,早期可能需要引导模型产生更多高奖励行为,后期则需巩固整体输出质量。Temporal Scheduling 通过引入时间维度,将这一标准动态化,从而协调“探索—利用”的节奏。这与课程学习思想同构,但更细粒度地作用于 token 级信号。实验揭示的 策略熵保护 效应,解释了为何调度的稳定性增益转化为最终性能提升——避免策略坍缩到少数模式,为强化探索保留了空间。对于工业级 LLM 后训练,该方法仅需修改信用分配权重的计算方式,实现成本低,且可与现有 RLVR 框架(如 OpenRLHF)便捷集成,为推理模型的对齐与优化提供了新的视角。

行业影响

落地场景

RLVR 时间调度直接作用于 LLM 后训练,可提升任意需可验证奖励信号的推理任务。典型的落地产品包括:

  • AI 编程助手(如 GitHub Copilot、Cursor):需生成可执行代码并验证正确性,调度策略可更高效地收敛到高质量解题路径。
  • 教育辅导系统:数学/科学问题分步解答,要求中间步骤可验证;时间调度能让模型先聚焦关键步骤,再泛化到一般优化。
  • 对话式推荐(电商/内容平台):需要多步推理生成个性化推荐解释,奖励可来自用户反馈或业务指标,调度能平衡探索与利用。

商业价值

  1. 降低训练成本:更稳定的学习动态可减少超参调优与重复实验的算力消耗,同时提升采样效率——轨迹百分位数可作为轻量级信用分配 proxy,无需复杂奖励模型。
  2. 提升模型性能:在数学和通用推理基准上的稳定增益直接转化为产品指标(如代码生成通过率、解题正确率),带来用户体验改善与用户留存。
  3. 防止策略退化:发现标准 RLVR 会显著牺牲策略熵,而时间调度维持更健康的策略分布,意味着模型在部署时具有更好的输出多样性与鲁棒性,对长尾场景尤其关键。

与现有产品/工作流的接口

该方法可作为RLVR 训练流水线的一个插件,与现有 RLHF/RLVR 栈无缝集成:

  • 在常用框架(如 trlOpenRLHF)中修改奖励/优势计算逻辑,增加一个基于轨迹百分位数的掩码模块;
  • 调度函数(如线性衰减、余弦退火)通过配置文件传入,不改变原有训练主循环;
  • 利用开源实现 RLVR-Schedule 直接替换信用分配层,对工程师而言集成成本低。

具体落地用例

  • 智能教师批改系统:针对数学题分步骤批改,模型需解释每一步的正确性。时间调度先强化关键步骤(如设置方程)的优化,再调整全步长,使学生获得更符合教学逻辑的反馈。
  • 电商虚拟导购:在对话中逐步了解用户偏好并推荐商品,每一步的推荐理由可被点击/购买信号验证。时间调度让模型前期专注学习“锁定需求”的关键提问,后期提升整体对话流畅度,最终提高转化率。

该技术为 RLVR 优化引入了时间维度,是后训练策略的一次轻量但高潜力的升级,适合所有依赖可验证奖励的 LLM 应用。

局限

  • 时间调度策略高度依赖轨迹百分位数作为行为区分标准,虽然作者声称其简单有效,但在多步工具调用、代码生成等更复杂轨迹中,固定百分位阈值可能无法准确捕捉策略异质性,且未与其他信用分配代理(如基于价值的差分奖励)进行系统对比,限制了该方法的普适性结论。
  • 方法引入了调度函数与衰减时序等额外超参数,论文对不同调度曲线(线性、余弦、指数衰减)的敏感性分析不够充分,实际应用时可能需要针对任务特性进行精细调优,增加了与现有RLVR流程集成的工程成本与不稳定性风险。
  • 实验主要局限在中等规模模型(约7B)和数学/一般推理基准,未在70B以上模型及对话式RLHF等场景下验证,且分析止于训练动态,未深入评估调度对最终收敛点性能与策略熵长期演化的影响,可能无法揭示训练后期可能出现的策略退化或遗忘现象。
论文Jinghao Zhang2026-05-25原文

相关内容