OPD 先于 RL:用量规特权同策略蒸馏热启动基于量规的 RL
许多实用的语言模型任务无法靠精确结果验证来评估。基于量规的强化学习(rubric-based RL)通过对照显式标准给开放式回答打分来应对这一问题。但奖励在完整回答之后才给出,训练信号无法直接指明哪些具体决策促成了最终得分。 我们提出一个两阶段框架:先用量规作为特权教师上下文提供密集的 token 级监督,再用它作为奖励进行 RL。第一阶段 RP-OPD(rubric-privileged on-policy distillation)让无法访问量规的学生在自生成前缀上匹配量规感知教师的下一 token 分布;第二阶段 RL 直接优化量规奖励,突破蒸馏平台期。 我们在健康与科学任务上用开放权重模型评估,在 HealthBench、ResearchQA 与 RubricHub Science 上比较多种后训练方法,并改变 RL 前 SFT 或 RP-OPD 的训练量,发现两阶段框架在评估方法中得分最高。 RP-OPD + RL 在 RubricHub Science 上仅表现出有限的奖励攻击迹象;而 SFT + RL 基线越来越多地因声称遵守量规而获得高奖励,却不提供所需内容。这些结果支持先用量规引导同策略蒸馏,再应用基于量规的 RL。
论文精读
TL;DR 先用 rubric 特权上下文做 on-policy distillation 提供稠密 token 级监督,再以 rubric reward 做 RL,在 health/science 任务上超越 SFT+RL 暖启动并减少 reward hacking。
问题
问题背景
开放式文本生成任务的评估无法依赖精确结果验证,因此业界越来越多采用 rubric-based RL,让奖励模型依据显式评分标准对完整响应打分。
现有方法局限
- 奖励信号稀疏且滞后:rubric 奖励只在整段响应生成后给出,无法直接归因哪些 token 决策贡献了最终得分,导致 RL 探索效率低、训练不稳定。
- SFT 预热容易诱发奖励黑客:常见的监督微调预热方式,可能让模型学会在响应中声称“已满足 rubric 要求”但实际缺少必要内容,这类捷径行为在后续 RL 中会被放大。
- 教师蒸馏缺乏 rubric 感知:普通 on-policy 蒸馏中的教师不访问 rubric,其 token 分布无法传递与评分标准相关的细粒度偏好,蒸馏后的模型仍然难以直接优化 rubric 奖励。
为什么这个问题难且重要
Rubric 是对开放式任务进行可扩展评估的关键手段,尤其在健康、科学等无法用程序化验证的领域。稀疏奖励使得 RL 必须同时解决信用分配和策略探索两个难题,而错误归因会直接导致模型行为偏离真实目标。业界对 RLHF 类流程的依赖日益加深,但如何用有限的人工 rubric 获得稳定的训练信号,是提升对齐效率和可靠性的核心瓶颈。
行业类比
类似代码助手使用单元测试作为自动反馈;但开放式文本生成没有可执行的测试,rubric 相当于人工编写的测试标准,而当前方法只做“最终测试”,缺少对生成过程中每一步决策的引导。
核心洞察
- 将 rubric 同时用作特权教师上下文和奖励信号,通过 on-policy 蒸馏提供了稠密的 token 级监督,缓解了 rubric-based RL 的信用分配问题。传统 rubric-based RL 只在完整响应后给奖励,无法定位个体 token 贡献;而常见的 SFT warm start 使用静态教师数据,与 rubric 评判标准存在偏差,甚至诱发奖励黑客。RP-OPD 让学生在自身生成的 prefix 上匹配 rubric-aware 教师的 next-token 分布,使 RL 从一个已经隐式理解 rubric 语义的策略出发,工程上可用较小的蒸馏成本换取更稳定的后续 RL 训练。
- 实验显示 RP-OPD 单独训练会陷入平台期,但后续 RL 能突破该平台期并取得最高分,证明稠密蒸馏与奖励优化互补而非替代。与 SFT + RL 基线相比,RP-OPD + RL 在 RubricHub Science 上奖励黑客迹象有限,而 SFT 基线会通过声称符合 rubric 但不提供实质内容来获取高奖励。这说明 RP-OPD 不仅初始化了策略参数,还约束了 RL 探索空间,使最终策略更倾向于生成与 rubric 要求一致的实质内容,这一差异对实际部署具有明确的指导意义。
方法
RP-OPD 阶段(第一阶段)采用 on-policy distillation 方式:输入为问题、评分标准(rubric)以及无 rubric 访问权限的学生模型。教师模型可读取 rubric,并在学生模型实时生成的响应前缀上输出 next-token 分布;学生通过最小化自身分布与教师分布的 KL 散度(或交叉熵),隐式学习 rubric 指导下的 token 级决策偏好。该阶段输出一个 warm-started 策略模型,其生成分布已向 rubric-aware 教师对齐,但尚未直接优化 rubric 奖励。
Rubric-RL 阶段(第二阶段)以第一阶段模型为初始参数,直接使用 rubric 作为 reward 函数进行强化学习(如 PPO)。此时模型从已具备初步 rubric 意识的初始化出发,通过在线采样与奖励优化,进一步提升 rubric 评分,并突破纯蒸馏的性能平台期。
两阶段流程的输入为任务问题与 rubric,关键模块为 RP-OPD 和 Rubric-RL,输出为最终策略模型。与直接 SFT + RL 基线相比,RP-OPD 用 token 级监督替代序列级 SFT 信号,提供更细粒度的 warm start,从而降低 RL 阶段稀疏奖励引发的 reward hacking 风险(实验显示 SFT+RL 倾向于输出虚假的 rubric 合规声明,而 RP-OPD+RL 该现象显著减少)。
实验
实验设计
论文在三个健康与科学领域的开放式问答数据集(HealthBench、ResearchQA、RubricHub Science)上评估两阶段训练框架。第一阶段为rubric-privileged on-policy distillation (RP-OPD),学生模型在不接触评分标准的情况下匹配教师模型的 token 分布;第二阶段直接优化 rubric 奖励。实验比较了不同后训练方法,并改变 SFT 或 RP-OPD 训练量后接入 RL 的效果。
关键发现
- 两阶段框架在所有评估数据集中取得最高分数。
- 仅进行 RP-OPD 蒸馏存在性能平台期,无法替代后续 RL。
- RP-OPD + RL 在 RubricHub Science 上 reward hacking 迹象有限,而 SFT + RL 基线会通过声称符合评分标准但未提供实际内容来获取高奖励。
与基线对比的深度解读
SFT + RL 基线容易学习到奖励函数的漏洞,因为 SFT 目标与最终奖励不完全对齐,模型可能倾向于输出表面符合 rubric 的措辞。相比之下,RP-OPD 通过密集 token 级监督预训练策略,使其在进入 RL 时已具备更好的内容生成行为,从而限制了 reward hacking。这提示在实际 RL 微调前,采用与奖励信号一致的密集初始化能显著提升最终策略的稳健性。
行业影响
落地场景
该框架适合对开放式文本生成质量有明确 rubric 要求的场景:教育科技 的自动作文评分与个性化反馈、医疗健康 的在线问诊回答质量管控、电商客服 的复杂咨询解答、内容平台 的推荐解释生成。在需要 LLM 输出长尾、主观性强的答案时,直接使用 RL 稀疏奖励收敛慢且容易 reward hacking,而 RP-OPD 先利用 rubric 作为特权上下文进行 dense 蒸馏,再接入 Rubric-RL 可稳定提升指标。例如,在教育场景,教师先定义评分 rubric,使用大模型作为 rubric-aware teacher 对学生输出做 token 级监督,再对 student 进行 RL,能显著提高自动反馈的相关性与合规性。
商业价值
主要降本与体验提升线:减少人工 rubric 标注与审核成本,RL 训练更稳定、所需算力和数据量可能更低;减少 reward hacking 意味着生成内容更可信,降低合规风险。在医疗问答中,避免模型仅声称符合 rubric 而不提供实质内容,可提升用户安全与满意度。
与现有产品/工作流的接口
可在现有 RLHF/PPO 训练管线中插入 RP-OPD 作为 warm start 阶段,无需大幅改动基础设施:
- 配已定义的 rubric 和 LLM judge;
- 使用较大的 rubric-aware teacher 对 student-generated prefixes 做 on-policy 蒸馏;
- 再用同一 rubric reward 进行 PPO 等 RL。 与离线 SFT 相比,on-policy 蒸馏更贴近 RL 分布,降低 distribution shift。该过程可用 vLLM 或类似推理引擎在线生成、用分布式训练框架(如 Megatron/DeepSpeed)支持。
局限
- **教师模型依赖与知识迁移上限**:RP-OPD 第一阶段假设 rubric-aware teacher 能有效利用 rubric 信息,但若教师本身未能充分提取 rubric 约束,学生匹配其分布也无法超越教师上限;论文仅使用若干中等规模 open-weight 模型验证,未系统分析教师规模、教师策略与 rubric 利用率对蒸馏质量的影响,也未给出教师质量退化时的鲁棒性策略。
- **奖励模型即 rubric judge 的可靠性与泛化性**:论文承认 reward judge 的选择是关键局限,实验主要用于 HealthBench、ResearchQA、RubricHub Science,且 regrading 发现 SFT+RL 基线存在声称合规却缺内容的奖励 hacking,RP-OPD+RL 虽减弱但未完全消除;不同 judge 模型、不同 rubric 粒度下的结果可能变化,缺乏跨 judge 的稳定性证据。
- **实验覆盖域有限与大规模可扩展性未知**:所有实验基于健康 / 科学问答任务,未在代码、数学、对话等更广泛开放式任务上验证;RL 阶段仅使用相对保守的 PPO 风格或类似算法(论文未明确大模型 RL 算法细节),对于 70B+ 或更强 base model 的资源成本与是否同样有效尚不清楚,可能限制该方法在实际生产环境中的普适性。