同族 On-Policy Distillation 的 Scaling 性质
Reinforcement learning (RL) 能为大语言模型(LLMs)带来显著的推理能力,但该能力跨模型规模迁移的程度与速度仍不明确。我们研究 on-policy distillation (OPD) 在 weak-to-strong、same-base、strong-to-weak 三种师生设定下的 scaling 性质。 我们发现,OPD 早期训练动态一致呈现出一个规则的 有用迁移 区间:其中留出集准确率(即 gold score,G)随 d = sqrt(KL(πθ ‖ πref)),即学生初始化处 token 级 reverse KL 散度的平方根,近似线性上升。 在每一组 weak-to-strong 配对中,学生的峰值 gold score 都超过教师自身,因此紧凑的 RL 专家可通过 OPD 向远大于自己的学生迁移能力。我们用 power laws 拟合 Gpeak 与有用迁移斜率随学生、教师参数量及教师 gold score 的变化,结果表明:峰值 gold score 仅在教师规模不超过学生规模时随教师规模提升;而在 gold score 相同时,更小的教师迁移效果更好——教师自身的分数并不能单独定义其监督价值。我们还考察了 bootstrapping weak-to-strong OPD 与 on-policy 监督强度两种变体的 scaling 效应。
论文精读
TL;DR 系统研究同家族 on-policy 蒸馏的规模律:发现早期有用迁移阶段金分随 √KL 近似线性增长,弱教师可让强学生超越自身,并拟合出峰值金分与迁移速率的幂律。
问题
问题背景
强化学习(RL)已成为诱导大语言模型(LLM)推理能力的重要手段。但如何将一个小型已优化模型(教师)的推理能力迁移到不同规模的学生模型,以及迁移效率如何随模型规模变化,目前缺乏系统的定量理解。
现有方法局限
- 静态离线蒸馏:传统蒸馏依赖固定数据集或离线教师输出,学生训练时数据分布与自身策略不匹配,容易产生分布偏移,导致性能上限受限。
- 教师能力指标单一:业界常以教师准确率(gold score)作为监督价值判断依据,但忽略了模型参数量、表征相似度等因素,导致跨尺度选择教师时无法预测实际迁移效果。
- 缺乏跨尺度规律:弱到强、强到弱等不同师生规模组合下,能力迁移的峰值、速率和衰减规律未被量化,实践中只能靠经验搜索,计算成本高。
为什么这个问题难/重要
OPD 中学生在训练过程中不断改变自身策略,教师提供的是在线分布上的反馈,因此数据分布动态变化,迁移过程非线性。需要同时平衡有用信号吸收与过度正则化导致的性能退化。量化早期有用迁移区间、峰值位置以及规模幂律,对于控制训练预算、选择合适师生对至关重要。业界需要可预测的扩展法则,而非每次任务都重新扫描。
行业类比
这类似于在真实生产环境中,用一个较小、便宜的专家模型持续为大型通用模型提供在线反馈,以低成本扩展推理能力;若能预测迁移效果,即可避免盲目堆叠教师规模带来的算力浪费。
核心洞察
- OPD 中老师规模对学生的增益存在 **饱和点**:当老师参数量接近学生时,峰值 gold score 达到最高,超过该规模后提升有限;在相同 gold score 下,较小老师反而能更高效地转移能力。这挑战了“更强老师一定更好”的直觉,与 RL scaling laws 中性能随规模单调提升的趋势不同。该发现表明老师的监督价值并非仅由其自身分数决定,还取决于与学生的 **规模匹配度**。工程上,选择蒸馏老师时应同时评估其能力和参数规模,避免单纯追求最高 benchmark 分数而导致计算浪费。
- 早期 OPD 训练中,held-out gold score G 与 token 级 reverse KL 散度的平方根 d 近似线性,斜率和峰值可用 power law 拟合。这个 **useful-transfer regime** 在 weak-to-strong、same-base、strong-to-weak 等不同配对下均出现,提供统一的动态规律。与以往蒸馏研究只关注最终性能对比不同,该线性关系使训练早期就可以估计最终潜力,为资源分配和早停提供依据。工程上可据此在少量训练步后判断蒸馏是否有效,及时调整教师或停止无效训练,节省 GPU 预算。
方法
输入与任务设定
输入 包括一组数学推理任务(如 Qwen2.5 math trajectory grid 生成的提示)、一个作为蒸馏起点的学生模型 π_ref,以及一个已完成 RL 训练、具备推理能力的教师策略 π_teacher。教师与学生规模可形成 weak-to-strong、same-base、strong-to-weak 三种配对。
关键模块:On-Policy Distillation + 几何度量
核心是 on-policy distillation (OPD):教师模型在训练过程中实时生成响应轨迹,学生策略 π_θ 在这些轨迹上进行策略优化,目标是模仿教师的行为分布,而非直接最大化环境奖励。为量化转移进度,作者引入两个关键指标:
- gold score
G:在留出测试集上的准确率,衡量学生实际能力。 - token 级 reverse KL 散度的平方根
d:表示学生相对初始化参数π_ref的漂移程度,作为训练进度的统一几何度量。
实验观察发现,早期 OPD 训练普遍呈现 useful-transfer 线性区域:G 随 d 近似线性上升,其斜率定义为 useful-transfer rate,用于刻画单位参数漂移带来的能力增益。
输出与缩放定律
作者对多个教师-学生组合拟合 power law,描述 G_peak 和 useful-transfer rate 如何随学生参数量、教师参数量、教师 G 缩放。结论包括:峰值随教师规模仅增加到约等于学生规模的临界点;在相同教师 G 下,更小的教师反而转移更优。此外还评估了 Delta-OPD 变体、on-policy 监督程度、以及 bootstrapping weak-to-strong OPD 迭代策略的影响。
与同类工作的差异点:该方法将 OPD 的训练动态投影到 KL 几何空间中,用统一的
d度量归一化跨规模比较,从而得到可外推的缩放定律,而不是仅报告下游任务准确率。
实验
实验设计
本文系统研究 On-Policy Distillation (OPD) 在不同师生规模组合下的能力转移规律。实验覆盖 weak-to-strong、same-base、strong-to-weak 三种设置,以 RL 训练的专家模型为教师,通过 OPD 将推理能力蒸馏到不同参数量的学生模型。核心监控指标为 gold score(留出集准确率 G)与 token 级 reverse KL 散度(KL(π_θ∥π_ref))。通过大量训练轨迹拟合幂律关系,分析 G_peak 与 useful-transfer 阶段斜率如何随学生参数量、教师参数量和教师 gold score 变化。
关键发现
早期训练存在一致的 useful-transfer 阶段,gold score 与 d = sqrt(KL) 近似线性增长。所有 weak-to-strong 组合中,学生峰值 gold score 均超过教师自身,证明小型 RL 专家可将能力有效转移给大得多的学生。幂律拟合表明,教师规模对峰值分数的增益上限大致与学生规模相当;在相同的教师 gold score 下,规模较小的教师反而转移效率更高。因此,教师分数不能单独决定其监督价值。
与基线对比及工程启示
相比传统知识蒸馏或直接 RL 训练,OPD 展示出高效且可预测的能力转移特性。工程上,选择教师模型时不应仅看其绝对性能,还需考虑师生规模匹配:过大的教师可能带来冗余甚至干扰,而紧凑教师配合适当 OPD 设置可达到更优迁移效果。此外,早期线性增长区间可用于快速预估训练收益,减少试错成本。
行业影响
落地场景
On-policy distillation (OPD) 可用于将小型 RL 专家 的能力迁移到大型 学生模型 的工业场景。典型如:
- 企业级推理助手:用 7B 级别的 RL 专家教师,通过 OPD 将复杂推理能力蒸馏到 70B+ 学生,大幅降低大规模 RL 训练开销。
- 代码生成服务:将已验证的 bug 修复策略从轻量策略模型迁移到旗舰代码模型,保持生成质量同时缩短迭代周期。
- 内容审核 / 风控:利用强标注专家蒸馏到边缘端小型模型,实现低延迟、高性能的在线决策。
论文发现的 weak-to-strong 特性尤为关键:学生可超越教师本身的 gold score,打破传统蒸馏的教师上限。
商业价值
OPD 的规模化规律直接降低 RL post-training 的成本与不确定性。研究发现:
- 成本节省:教师模型无需与学生等规模,用小模型即可训练学生,显著减少 GPU 小时与标注预算。
- 性能提升:弱到强蒸馏中学生 peak gold score 超越教师,可以用较少 RL 资源获得更高下游任务准确率。
- 决策依据:拟合的 power laws 可预估不同师生配比的最终性能与有用转移速率,帮助团队在项目启动前做 ROI 权衡,避免盲目扩大教师规模。
以电商推荐系统的 LLM 排序器 为例,一个小型 RL 策略可将其排序能力蒸馏到线上大模型,带来点击率提升,同时避免直接对线上大模型做昂贵 RL。
与现有产品/工作流的接口
OPD 可以自然嵌入现有 LLM post-training 流水线:
- 在 SFT 之后、RLHF 或部署之前,插入 OPD 阶段:教师策略用当前学生初始化,通过 on-policy rollout 与 KL 正则 进行监督。
- 监控指标使用论文中的
d = sqrt(KL(πθ||πref))与 gold score 曲线,可设定早期停止阈值,避免进入性能退化区。 - 与已有 distillation 框架 (如 TRL、DeepSpeed Chat) 兼容,只需增加教师策略的在线采样与 KL 计算模块。
工程师可利用论文的开源代码或 scaling law 拟合脚本,快速在自有模型族上估计 OPD 收益,降低试错成本。
局限
- 模型家族与任务类型单一:实验全部在 same-family(Qwen2.5 系列)内进行,教师与学生共享相同预训练基座,结论能否迁移到跨家族 OPD(例如 Llama 教师到 Qwen 学生)仍未验证。评估任务集中在数学推理,对代码生成、科学推理等能力的 scaling 规律是否一致未知。这限制了幂律作为通用预测工具的范围,实际部署时若模型家族或任务域改变,需要重新拟合参数。
- 距离度量与训练阶段覆盖有限:论文以 token-level reverse KL 的平方根 `d` 作为转移坐标,发现早期 linear useful-transfer regime,但未对后期能力饱和、退化或熵崩塌阶段建立定量模型。其他分布散度(如 forward KL、JSD)可能呈现不同 scaling 行为。工程中若需预测最终收敛位置或避免过优化,本文提供的幂律在 useful-transfer regime 之外可能失效,需要完整训练曲线模型补充。
- 实验规模与超参敏感性:模型参数量范围可能不足以使 scaling 规律外推到百亿/千亿参数模型,且 OPD 涉及学习率、KL 系数、采样温度等多个超参数,论文虽列出配置但未做系统性消融,导致拟合出的 power law 系数存在不确定性。此外随机种子数量有限,统计稳健性有待加强,直接用于指导大规模训练前仍需谨慎验证。