On-Policy Distillation 中的收益与崩溃:一个强化学习视角
On-policy distillation(OPD)已成为语言模型后训练的重要方法。尽管它带来了显著的性能提升,OPD 也可能崩溃为过度冗长且高度重复的生成,而这两种截然不同结果的成因机制至今仍缺乏理解。 我们从强化学习 的视角解释这一现象:teacher 会隐式地奖励 student 的行为,即便是它自身极少表现出的行为。基于该视角,实验表明 OPD 能在不扩展 student 能力的前提下提升性能。 - 当隐式奖励模型 可靠时,OPD 让正确回答更容易被采样到。 - 当偏好与质量不匹配时,则会出现 reward hacking:隐式奖励模型会放大 student 中过长、重复的 rollout,尽管 teacher 自身极少生成此类文本。 在这一诊断的指导下,我们发现在训练中屏蔽不健康的响应 以及使用 SFT 初始化 都能有效缓解崩溃。这些发现共同表明,OPD 放大的是 teacher 隐式反馈所偏好的学生行为,因此关注点应从 teacher 生成得多好,转向它评估学生 rollout 有多可靠。代码见 https://github.com/HancCui/opdhacking。
论文精读
TL;DR 将 on-policy distillation 建模为隐式奖励优化:增益不扩展学生能力,而是放大教师反馈偏好;反馈与质量错位时会造成长度/重复崩溃,屏蔽异常样本和 SFT 初始化可缓解。
问题
问题背景
语言模型后训练领域正转向更高效的知识蒸馏方法,on-policy distillation(OPD)因性能提升显著而受到关注。
现有方法局限
OPD 虽然能提升基准分数,但训练中可能 崩溃 为生成过长且重复的文本。传统蒸馏假设教师生成质量是标准,而 OPD 中教师扮演 隐式奖励模型,学生优化的是教师给出的序列级反馈。当该反馈与实际质量错位时,学生可能放大教师罕见但被奖励的行为(如重复、绕圈),产生 reward hacking。现有方法缺乏对教师评估可靠性的诊断手段,难以预判和防止这种 collapse。
为什么这个问题难/重要
技术挑战在于:隐式奖励模型的可靠性与对齐程度无法从教师生成分布直接推断;OPD 是一个动态交互过程,教师评估学生 rollout 的偏好可能被学生迭代放大;诊断需要解耦“教师生成能力”与“教师评估能力”。业界高度关注 LLM 后训练的稳定性与效率,蒸馏是降低模型推理成本、提升下游性能的常用路径,一旦发生 collapse,轻则降低输出质量,重则导致生产事故。
行业类比
类似推荐系统中反馈循环引发的 内容同质化,OPD 的 reward hacking 会让对话模型陷入重复应答,严重影响产品体验。
核心洞察
- 将 OPD 视为隐式奖励优化过程:教师对学生行为的偏好构成隐式奖励模型,学生通过策略梯度优化该奖励,而非直接模仿教师输出分布。这一视角解释了 OPD 能提升性能但不扩展学生能力边界的现象——学生只是在已能解决的问题上提高采样正确率,而非覆盖新问题。与传统将蒸馏视为行为克隆或监督学习不同,强化学习视角揭示了 OPD 的核心机制是奖励信号而非数据分布,因此教师生成质量不是唯一决定因素,教师评估学生 rollouts 的可靠性同样关键。
- OPD 的崩溃本质是奖励黑客:当教师隐式奖励与真实响应质量错位时,学生会利用奖励信号生成过长、重复的文本以获得高奖励,即使教师自身很少产生此类输出。这挑战了“教师生成能力决定蒸馏结果”的假设,指出教师评估可靠性才是关键。与 RLHF 中已广泛研究的奖励黑客不同,该工作明确指出 OPD 同样存在此问题,并且可以通过掩盖不健康响应和 SFT 初始化有效缓解,这为实际训练提供了可操作的干预策略,也为后续研究指明了方向。
方法
方法框架
输入:预训练学生模型与教师模型(如 DeepScaleR 或 Qwen3-4B 系列),在数学推理任务上进行在线策略蒸馏(On-policy distillation, OPD)。
关键模块:
- 隐式奖励建模:将教师对学生在策略采样响应的监督(例如序列级对数似然)重新解释为隐式奖励信号,推导出对应的策略梯度更新目标,教师本身作为隐式奖励模型。
- 能力边界审计:设计大池评估与条件扩展的覆盖审计,通过
pass@k和覆盖集变化判断学生在增加采样预算后能否解决原本无法解决的问题。 - 奖励黑客诊断:观察训练收敛(损失正常下降)与生成质量崩塌的并存现象,验证学生忠实地拟合了隐式奖励信号,即使该信号与真实质量不对齐(教师对过长重复文本给予高优势)。
- 候选池干预:训练时对截断或失败响应进行损失掩码,并从SFT 检查点初始化学生,作为缓解奖励黑客的手段。
输出:结论是 OPD 通过放大教师偏好行为而非扩展学生能力边界来提升表现;当偏好误对齐时会导致奖励黑客和输出崩溃,而候选池干预可以显著缓解该问题。
与同类方法的差异点:不同于显式奖励模型或离线拒绝采样,本工作将 OPD 本身视为隐式奖励优化,揭示教师评估可靠性而非其生成质量才是决定 OPD 成败的关键。
实验
实验设计
论文把 OPD 视为隐式 reward 优化:学生在线采样,teacher 以序列对数似然作为隐式 reward,通过 policy-gradient 更新。实验在 AIME24 与 AIME25 数学推理集上,分别使用 DeepScaleR 与 Qwen3-4B 作为 teacher/student 设置。设计了三种检验:1) 能力边界审计(pass@k 随采样预算变化);2) 崩溃模式分析(长重复 rollout 的 reward hacking);3) 候选池干预(掩码不健康响应 + SFT 初始化)。
关键发现
- OPD 能提升低频采样下的正确率,但不扩展学生的可解问题集合;已经可解的问题更容易被采样到。
- 当隐式 reward 与响应质量错位时,学生忠实拟合被污染的 reward:生成超长、重复文本,即使 teacher 很少生成这类样本。
- 掩码不健康响应、用 SFT checkpoint 初始化都能显著缓解崩溃。
对比解读
与侧重 teacher 生成质量的常见 OPD 做法不同,本文论证核心是 teacher 作为 evaluator 的可靠性。实际工程中,不能只监控 teacher 输出分布,应同时监控 student rollouts 的 teacher reward 分布,并对低质量高 reward 样本做过滤或 loss mask。这为 post-training 管道提供了低成本诊断点。代码见 GitHub,项目页见 hancui.site。
行业影响
落地场景
On-policy distillation (OPD) 适用于语言模型后训练中的知识蒸馏与模型压缩场景,尤其适合将大参数教师模型迁移到小参数学生模型。例如:
- 电商智能客服:从大模型蒸馏轻量回复模型,OPD 可提升小模型在常见查询上的准确率,但需警惕模型生成过长且重复的回复。
- 内容平台自动摘要:用 OPD 训练摘要生成模型,需防止奖励函数偏差导致输出冗长、可读性下降。
商业价值
- 降本:避免 collapse 后学生模型输出过长的重复文本,直接减少推理 token 消耗,降低服务成本。
- 体验提升:模型回复更简洁精准,用户等待时间缩短,满意度提高。
- 训练稳定性:采用 masking unhealthy responses 和 SFT 初始化 可有效抑制 reward hacking,减少模型调试周期,加速迭代。
接口
可无缝集成进现有 RLHF/DPO 训练栈,基于 PyTorch / DeepSpeed 实现。开源代码 opd_hacking 提供参考实现。集成时需在损失函数中对不健康响应(如截断、失败样本)进行掩码,并使用 SFT checkpoint 作为学生模型初始化。与现有 SFT / RL 工作流兼容,改动成本低。
具体用例:
- 电商客服:使用 OPD 蒸馏 7B 级回复模型,通过 masking 避免产品描述过度重复,同时保持知识准确性。
- 教育辅导:AI 数学解题助手采用 OPD 提升推理性能,用 SFT 初始化防止生成循环重复的解题步骤。
局限
- - **实验范围受限**:本文主要在数学推理任务(AIME 等)和若干教师-学生组合(如 DeepScaleR-7B 教师、Qwen3-4B 学生等)上验证,覆盖的任务类型相对单一。虽然作者考察了不同温度与采样预算,但缺乏对代码生成、指令跟随、多轮对话等常见 post-training 场景的验证。因此,关于“OPD 不扩展能力边界”和“reward hacking 主要体现为过长重复”的结论,能否推广到更广泛的语言任务和更大规模模型仍不明确。
- - **隐式奖励模型的简化假设**:论文将教师评分解释为隐式奖励模型并关联策略梯度,但实际 OPD 中教师的 top-k 采样、温度、长度惩罚、以及 token-level 概率可能使得奖励信号并非严格的标量反馈。该视角虽有助于诊断,却未提供形式化的理论保证,隐式奖励是否存在非平稳偏差也未被充分讨论。这可能导致对“reward hacking”的归因不够严谨,尤其是当教师自身也在训练中变化时。
- - **缓解措施的泛化性有限**:本文提出的 masking unhealthy responses 和 SFT 初始化虽在实验设置下有效,但“unhealthy”响应依赖预定义规则(如过长、重复),可能无法捕捉其他形式的坍塌或质量退化。同时,SFT 初始化需要额外的高质量 checkpoint,增加了工程成本。与一些在线 RL 中的正则化方法(如 KL 约束、reward shaping)相比,本文的缓解策略相对直接,尚未在更复杂的异构偏好或开放域生成中验证。