更小的模型,更好的 rejects:偏好蒸馏的缩放规律
偏好蒸馏 通常把 teacher 的 response 视为 preferred,把 student 自身的 response 视为 rejected。这一做法隐含两个假设:自生成的失败是最有信息量的 negatives;rejects 必须来自规模不小于 student 的模型,因而大规模生成成本高昂。 我们发现这两个假设都不成立:在 7B 到 72B 的 student 上,较小的 frozen 模型能用更少的推理算力生成 rejects,却训练出比自生成 rejects 更强的 student,且在序列级知识蒸馏前后、在 代码生成 与 数学推理 任务上均成立。为解释该结果,我们在线性化特征模型中推导了 Direct Preference Optimization 的 finite-horizon utility bound,该上界刻画了有利的 reject 分布,并引出三项干预: 1. 混合来自更小模型与 student 规模的 rejects,随着更小模型占比提高,性能持续改善; 2. 把 rejects 重新分配给其他 prompt 并打乱其 code tokens,仍优于长度匹配的 gibberish,说明任务结构对 reject 效用有贡献; 3. 选择在 reference policy 下 likelihood 更低的候选可提升净迁移,且对每个来源都是低 likelihood 选择优于高 likelihood 选择。 这些结果表明:有效的 rejects 在保留任务结构的同时限制了与 reference policy 的耦合,而更小的 frozen 模型能够低成本地提供它们。
论文精读
TL;DR 发现偏好蒸馏中,用较小冻结模型生成的 rejects 代替学生自生成负样本,成本更低且训练效果更强;理论分析揭示有效 rejects 需保留任务结构并减少参考策略耦合,并给出三个构造干预。
问题
问题背景
偏好蒸馏(preference distillation)是当前大语言模型对齐的主流范式,通过构造“偏好-拒绝”样本对,利用 DPO 等方法让模型学习人类或教师偏好。其中拒绝样本的质量直接影响训练信号的优劣。
现有方法局限
主流做法默认将 教师响应 作为 preferred,将 学生模型自身生成 的响应作为 rejected。这隐含两个假设:
- 学生自身失败是最具信息量的负样本;
- 拒绝样本必须来自规模不小于学生的模型,以保证对比难度。
但本文发现这两个假设在代码生成和数学推理任务上均不成立。自生成负样本不仅推理计算开销高,而且更小规模冻结模型生成的拒绝样本往往训练出更强的学生模型。
为什么这个问题难/重要
负样本质量与生成成本之间存在尖锐矛盾:过于简单的负样本无法提供有效梯度信号,过于昂贵的大模型生成又限制规模化。本文通过线性化特征模型推导出 DPO 有限时域效用上界,揭示有利拒绝分布的特征——保留任务结构、降低与参考策略的耦合。这表明拒绝样本设计是一个可优化的数据工程问题,而非必须依赖更大模型。
行业类比
类似在代码助手模型对齐中,用更轻量模型生成错误代码作为负样本,可以在推理预算降低一个数量级的情况下获得同等或更好的策略改进。
核心洞察
- 拒绝样本的来源规模不必与学生模型匹配,较小冻结模型生成的拒绝样本能以更低推理成本训练出更强的学生模型。传统偏好蒸馏隐含假设负样本需来自同等或更大模型,导致生成开销随学生规模线性增长。本文通过跨 7B 到 72B 学生的实验证明,较小模型生成的拒绝样本不仅有效,而且在代码生成和数学推理上优于学生自身生成,且这一优势在序列级知识蒸馏前后均成立。这一发现将拒绝样本的选择从“模型规模匹配”转向“数据分布质量匹配”,为低成本偏好蒸馏提供了可扩展的工程路径。
- 有效拒绝样本的关键特性是保留任务结构同时降低与参考策略的耦合,而非简单地提供错误答案。实验表明,将拒绝样本重新分配到其他提示并打乱代码 token 仍优于长度匹配的乱码,说明任务中的内在结构(如语法约束、语义模式)即使错位也携带可迁移的对比信号。进一步地,在参考策略下选择更低似然的候选者能提升净迁移,因为高似然拒绝样本与参考分布过于接近,提供的梯度对比不足。这一洞察将拒绝样本设计从二元正确性判断推进到分布级特征分析,为主动构建高价值负样本提供了新准则。
- 本文在线性化特征模型中推导了 DPO 的有限时域效用边界,将拒绝样本选择形式化为逆数据设计问题。该边界描述了对训练有利的拒绝分布应满足的特征迁移与参考耦合条件,而非依赖经验式调参。基于这一理论框架,作者系统设计了三种干预措施:混合不同规模源、跨提示重分配与 token 置换、参考似然重选,并预测其效果。相比以往只关注优化算法或正负样本配比的工作,本文提供了可解释的拒绝分布效用度量,为后续在更大规模模型和更复杂任务中自动化数据选择奠定了基础。
方法
输入:偏好蒸馏设定中,每个样本包含提示、教师首选响应、学生自生成响应,以及可选的由更小冻结模型生成的拒绝响应。
关键模块:
- 拒绝源选择作为逆数据设计:将拒绝样本的生成视为数据设计问题,目标是找到一种拒绝分布,使得经过 Direct Preference Optimization (DPO) 训练后的学生策略效用最大化。
- 线性化特征模型与有限时间效用界:在特征空间中对策略进行局部线性化,推导出 DPO 在有限步更新后效用的上界。该界表明,高质量拒绝样本应具备两个特性:特征转移(能将学生策略推向更优方向)和低参考耦合(与参考策略似然差异大,提供更强对比信号)。
- 三种构造干预措施:基于理论界的指导,提出以下可操作方案:
- 来源混合:将更小模型生成的拒绝样本与学生规模模型的拒绝样本按比例混合,提高更小模型占比可提升性能。
- 提示重分配与词法置换:将拒绝样本重新分配给其他提示,或打乱其代码令牌顺序,仍优于长度匹配的无意义序列,说明任务结构本身具有校正价值。
- 参考似然重选:从候选集合中选择参考策略下似然较低的样本作为拒绝,降低与参考策略的耦合,改善净转移。
输出:高质量的拒绝分布,用于 DPO 训练学生模型,在代码生成和数学推理任务上提升学生性能。
与传统偏好蒸馏将学生自生成失败作为唯一拒绝源、且要求生成模型不小于学生不同,本方法利用更小的冻结模型生成拒绝样本,并以理论界为指导主动构造最优拒绝分布,实现更低推理成本和更高训练性能。
实验
实验设计
在 7B 到 72B 的学生模型上,以代码生成与数学推理为任务,对比不同来源的拒绝样本:自生成 (Self)、更小冻结模型 (Smaller Base)、以及两者混合。优化使用 DPO,并评估序列级知识蒸馏前后效果。
关键发现
- 更小冻结模型生成的拒绝样本一致优于自生成,且推理成本更低。
- 混合源中小模型占比越高性能越好;随机打乱来源分配仍保持增益。
- 将拒绝样本重新分配到其他 prompt 或置换代码 token 后仍优于长度匹配的无意义文本,说明任务结构(如代码词法)提供修正价值。
- 参考策略低似然候选在控制变量下优于高似然候选,表明降低与参考策略的耦合能提升有效迁移。
与基线对比解读
传统偏好蒸馏隐含两个假设:学生自生成失败是最有效负样本;拒绝样本需来自至少与学生同规模模型。本工作在 7B–72B 多尺度上证伪两个假设,并给出可操作的拒绝样本构造原则:保留任务结构、限制参考策略耦合。相比自生成基线,小冻结模型以更低推理开销获得更强学生,为大规模偏好蒸馏的数据设计提供了新的成本-效用权衡。
行业影响
落地场景
本工作可直接用于偏好蒸馏(DPO/PPO)驱动的代码生成助手、数学推理模型、企业客服机器人、内容审核等场景。例如在代码助手(如 GitHub Copilot 类产品)微调中,用更小的冻结模型(如 7B)生成错误补全作为 rejects,替代学生自生成负例,降低推理成本并提升训练效果。
商业价值
- 降本:reject 生成从学生同规模模型降为更小冻结模型,推理计算量显著下降。论文实验显示小模型生成 rejects 仍能训练出更强学生,直接降低对齐环节的 GPU 小时成本。
- 体验提升:学生模型在代码生成与数学推理基准上表现更优,意味着产品端回答准确率、代码可接受率等关键指标改善。
- 增收路径:低成本迭代模型可支撑更高频的个性化微调,如针对不同企业客户的轻量定制模型,扩展 SaaS 服务品类。
跟现有产品/工作流的接口
现有 RLHF/DPO 流程无需大改,只需替换负例采样源:
- 采样层:设置规模更小的冻结模型生成 rejects,支持混合不同规模来源(如 30% 小模型 + 70% 学生规模),比例可调。
- 数据过滤层:增加参考似然重选步骤,筛选参考策略下似然较低的候选作为 rejects,提升对比信号质量。
- 数据增强层:允许 rejects 跨 prompt 重分配或 token 打乱,保留任务结构的同时解耦 prompt 对应关系,可作为低成本数据扩充手段。
具体 use case:
- 某在线教育平台的数学解题模型微调:用 3B 小模型生成错误推理步骤作为 rejects,训练 13B 学生模型,在保持低推理开销的同时提升解题准确率。
- 电商智能客服模型迭代:使用 1B 模型生成不相关或错误回答作为负例,代替线上 70B 模型实时采样失败案例,大幅降低标注与计算成本,同时模型拒识能力提升。
局限
- - **实验任务覆盖有限**:论文仅在代码生成和数学推理两个领域验证,这两个任务具有强结构化输出和可自动化评测的特点。对于开放式对话、创意写作、多轮交互等偏好更主观、reject 信号更微妙的场景,较小模型生成的 rejects 是否仍能保持优势未经验证。此外,实验使用的模型族和规模范围可能不足以覆盖非 Transformer 架构或更大规模(如 100B+)上的表现。
- - **理论模型简化**:论文推导的有限时域效用界基于线性化特征模型,其中策略和奖励函数的表示被限制在特征线性组合内。这种简化忽略了深度网络中非线性激活、注意力机制带来的复杂交互,因此理论结论(如低参考耦合、任务结构保留)可能只在局部有效,无法直接外推到实际训练的动态过程。作者也承认这是“线性化”模型,未提供与真实非凸优化轨迹的严格对应。
- - **未涉及安全与对齐影响**:论文聚焦于偏好蒸馏的性能提升和成本降低,没有探讨使用更小模型生成 rejects 是否会影响最终学生模型的对齐质量,例如在有害内容、偏见、事实性等方面的表现。更小的模型可能因为能力不足难以生成足够有害或错误的 rejects,导致学生模型在后训练中不能充分学习拒绝坏行为,从而留下安全漏洞。