RISE: 通过自外推策略蒸馏实现递归改进
on-policy distillation (OPD) 为语言模型后训练提供密集的逐 token 监督,但其效果受限于教师模型质量:外部教师存在分布不匹配,而带特权条件的自蒸馏受限于上下文学习能力。我们提出 RISE (Recursive Improvement via Self-Extrapolating Policy Distillation),直接从模型自身的 RLVR 训练轨迹构造合成教师。通过外推当前检查点与滞后锚点之间的位移——在参数空间或输出 logit 空间——RISE 将稀疏的结果驱动参数更新转化为密集的 token 级目标,无需任何外部模型或特权条件。 RISE 将 RLVR 与 OPD 以互补循环结合:结果奖励引导外推朝向正确推理,而外推教师细化 token 级决策。由于教师随学生改进每轮刷新,蒸馏成为递归改进机制而非一次性压缩步骤。 在数学推理、多领域 STEM、代码生成及多轮 agentic 任务上的实验表明,RISE 在所有设置中均优于纯 RLVR 训练和 on-policy self-distillation。
论文精读
TL;DR RISE 从模型自身 RL 轨迹外推合成教师,将稀疏结果奖励转化为稠密 token 级监督,无需外部模型或特权条件,并在每轮刷新教师实现递归自我提升,在数学、代码、智能体任务上超越 RLVR 与自蒸馏。
问题
问题背景
大模型后训练中,强化学习验证器奖励(RLVR)通过可验证结果提供稀疏监督,是推理能力提升的关键路径;在线策略蒸馏(OPD)则提供逐 token 的稠密信号,用来加速收敛和稳定训练。
现有方法局限
- 外部教师 存在分布不匹配:教师模型与学生策略不一致,产生的 token 级目标偏离学生自身分布,导致蒸馏信号噪声大。
- 自我蒸馏 依赖特权条件(如正确答案或推理过程),受限于模型上下文学习容量,无法泛化到复杂多步推理。
- RLVR 单独使用 只有结局奖励,token 级梯度稀疏,样本效率低,尤其在长轨迹任务中难以及时纠正中间错误。
为什么这个问题难且重要
技术挑战在于:如何在不引入外部模型或特权信息的条件下,获得高质量稠密 token 级监督?这直接决定 RLVR 能否实现递归自我改进。业界关注度源于 LLM 自主提升能力,减少人类标注依赖。实际工程中,若能用模型自身训练轨迹合成教师,将大幅降低部署复杂度并提升训练稳定性。
行业类比:类似代码生成场景中,RLVR 只给出“测试是否通过”的稀疏奖励,而 OPD 需要模仿一个更优的中间 token 序列,但现有教师往往不可靠。
核心洞察
- RISE 将 RLVR 产生的稀疏、结果级反馈转化为稠密 token 级监督,核心是通过外推当前 checkpoint 与 trailing anchor 在参数空间或 logit 空间的位移,构建合成 teacher。与依赖外部 teacher 的 on-policy distillation 不同,RISE 完全基于模型自身训练轨迹,避免了分布不匹配;与使用 privileged conditioning 的自蒸馏相比,它不依赖上下文学习容量,从源头解耦 teacher 质量对蒸馏效果的瓶颈。
- RISE 将 RLVR 与 on-policy distillation 组合成递归改进循环:outcome rewards 为外推提供正确推理的 grounding,而外推出的 teacher 反过来精细化 token 决策。这不同于以往把蒸馏看作一次性压缩或固定 teacher 的监督,也不同于单纯叠加 RLVR 与 OPD 损失;teacher 每次迭代随 student 更新而刷新,使蒸馏成为持续自我提升机制,有效克服 RLVR 样本效率低和 OPD 难以获取高质量 on-policy teacher 的双重短板。
方法
方法详解
输入:模型自身的 RLVR 训练轨迹,包括当前策略 checkpoint 与滞后 anchor 的参数或输出 logit。
关键模块:
自我外推教师构建:在 RLVR 训练过程中,模型因 outcome reward 产生参数更新。RISE 选取当前 checkpoint
θ_t和一个滞后k步的 anchorθ_{t-k},计算参数位移Δθ = θ_t - θ_{t-k};也可在输出 logit 空间对 token 级 logits 做同样外推。然后将该位移沿原方向外推,得到合成教师θ_teacher = θ_t + α Δθ(α 为外推强度)。该教师虚拟地代表了模型“再向前一步”的策略,无需外部模型。密集 token 级蒸馏:用外推教师对当前策略进行 on-policy distillation (OPD),对每个 token 计算学生输出分布与教师输出分布之间的 KL 散度 等损失,从而将稀疏的 outcome 信号转化为密集的逐 token 监督。RLVR 的 outcome reward 仍保留,用于将外推方向锚定到正确推理,防止外推偏离。
递归更新机制:每个 iteration 结束后,当前 checkpoint 和 anchor 均向前移动,外推教师随之刷新;因此蒸馏不是一次性的压缩,而是跟随学生能力提升的递归改进循环。
输出:经过多轮 RLVR+OPD 联合训练的策略,在数学推理、STEM、代码生成、多轮 agentic 任务上均优于纯 RLVR 和现有自蒸馏。
与同类方法的差异:RISE 不依赖外部教师(避免分布不匹配),也不使用特权条件自蒸馏(不受上下文学习容量限制),而是从自身训练轨迹中自我外推生成教师,实现真正意义上的递归自我改进。
实验
实验设计
论文在四个任务族上评估 RISE:数学推理、多领域 STEM、代码生成、多轮 agentic 任务。实验设置包括与 RLVR-only 和 on-policy self-distillation 的对比,以及消融研究。正文未提供具体数据集名称或训练算力细节,因此本摘要不列出具体数据集与指标数值。
关键发现
RISE 在所有评估设置中均优于 RLVR-only 和 on-policy self-distillation。核心机制是通过自外推构建合成教师,将稀疏结果奖励转化为稠密 token 级目标,并递归刷新教师,使蒸馏成为持续改进循环而非一次性压缩。
与基线对比解读
相比 RLVR-only,RISE 利用稠密监督细化 token 级决策,同时保留结果奖励的 grounding;相比 on-policy self-distillation,RISE 避免了外部教师分布不匹配和特权条件造成的 in-context 容量限制,教师质量随学生同步提升。这解释了其在多任务上的稳定优势,但缺乏具体数值,无法量化差距。
行业影响
落地场景
RISE 适用于任何依赖 RLVR(Reinforcement Learning with Verifiable Rewards)进行后训练的大模型产品,尤其在 数学推理、代码生成、多轮 agent 任务 等有可验证奖励信号的场景。例如 AI 编程助手、智能客服 agent、教育解题工具等。RISE 通过自外推从模型自身轨迹生成稠密 token 级监督,避免外部教师模型分布偏移与特权条件限制,可直接嵌入现有 RLVR 后训练阶段。
商业价值
- 降本:无需外部教师模型,省去蒸馏所需的高质量教师推理算力与数据标注成本;同时样本效率提升可能减少训练步数。
- 增效:RISE 在数学、STEM、代码、agent 任务上均优于 RLVR-only 和 on-policy self-distillation,提升模型最终能力,可直接转化为产品竞争力。
- 持续改进:教师每迭代刷新,蒸馏变为递归改进,模型可不断自举提升,降低后期迭代成本。
与现有工作流接口
RISE 作为额外损失项与 RLVR 联合训练,只需维护一个 trailing anchor checkpoint,计算当前模型与锚点的参数/logit 位移外推作为蒸馏目标。实现上可在现有 PPO/GRPO 等 RLVR 框架中新增一个 distillation loss,需保存历史 checkpoint 并按步长更新锚点。对现有 reward model 或 verifier 无额外要求,集成成本较低。
具体用例
- AI 编程助手:在代码生成任务上,用执行结果作为 verifiable reward,RISE 提升 token 级生成质量,减少编译错误,提升用户采纳率。
- 智能客服 agent:多轮 agentic 任务中,RISE 优化每一步 token 决策,减少无效工具调用,提升任务完成率和响应速度。
局限
- **线性外推假设的脆弱性**:RISE 的核心机制依赖于当前 checkpoint 与 trailing anchor 在参数空间或 logit 空间位移的线性外推,但 RLVR 训练轨迹可能高度非线性,特别是在稀疏奖励或探索阶段,外推方向可能偏离最优策略,导致 token 级蒸馏目标引入噪声。论文在 A.2 中虽然理论上分析了外推 gap,但实际复杂任务(如多轮 agentic)中该假设是否成立缺乏充分验证,外推强度的选择也需要额外调参。
- **任务类型受限**:RISE 严格建立在 RLVR 框架之上,要求每个 prompt 都有可验证的结果奖励(如数学答案、代码测试通过),对于开放域对话、创意写作等难以定义客观奖励的任务无法直接应用。即使有可验证奖励,RLVR 本身可能受到 reward hacking 的影响,而 RISE 的外推过程可能放大这种偏差,导致 token 级监督的可靠性下降。
- **额外计算与工程开销**:方法需要维护 trailing anchor 的模型参数或 logits,每次迭代都要进行当前模型与 anchor 的双重前向计算,并在参数空间外推时保存历史向量并执行向量运算。相比纯 RLVR 或标准 self-distillation,训练内存和计算成本更高,且 anchor 更新策略(η)以及 resample/rollout reuse 等细节会直接影响稳定性和性能,调参和部署门槛较高。