论文

通过位置选择性自蒸馏从语言反馈中训练 LLM 评判器

通过位置选择性自蒸馏从语言反馈中训练 LLM 评判器

我们研究如何从自然语言反馈中训练 LLM 评判器(LLM judges),尤其是主观任务:判决结果高度依赖评判器调用了哪些评价标准、以及如何权衡它们。 主流做法 outcome-supervised RL(如 GRPO)会给一次 rollout 中每个 token 分配同一个标量,该标量仅由最终判决的准确性决定,因此标准选择位置得不到独立信用,也浪费了偏好标签天然附带的丰富语言反馈(如偏好理由)。Self-Distillation(SD)是利用这类反馈的一种自然方式:同一模型在给定反馈后充当教师,提供密集的、位置级别的监督。但并非所有位置都携带同等有效的信号。 借助教师与学生之间的逐位置熵偏移,我们识别出两种情形:一是 context sharpening,即教师把概率集中到某个与反馈对齐的标准表述上;二是 context spreading,即教师把概率分散到多个与反馈对齐的备选项上。我们将其解读为:sharpening 鼓励记忆特定表述,而 spreading 通过保留备选项促进语义理解。基于这种不对称性,我们引入基于熵偏移的 position masking,只保留熵偏移分布的下尾。 实验表明,掩掉高熵偏移位置比朴素 SD 有更好的 out-of-distribution 泛化。所得自蒸馏评判器在主观子类上比 outcome-supervised RL 训练的评判器高 2-9 个百分点,在客观子类上仍具竞争力。

论文精读

TL;DR 利用语言反馈进行自蒸馏,并按位置熵位移掩码筛选训练信号,训练 LLM judge:在主观任务上较 GRPO 提升 2–9 个百分点,且不牺牲客观任务性能。

问题

问题背景

LLM-as-a-Judge 已成为评估模型输出的主流方案,但主观任务的判定高度依赖评价准则(criteria)的选择与加权,模型能否稳定运用准则成为关键。

现有方法局限

主流 outcome-supervised RL(如 GRPO)将最终判定准确率作为单一标量奖励,平均分配到 rollout 中所有 token,导致:

  • 无法区分“准则选择 token”与普通生成 token 的贡献;
  • 完全忽略偏好标签中天然存在的语言反馈(rationale/rubric),损失了可解释的监督信号;
  • 稀疏信用分配 容易让模型记住表面浅层模式而非学习语义准则,泛化能力不足。

为什么难/重要

主观任务中,同一回答在不同准则下合法性可能相反,模型既要学会从语言反馈中识别准则,又要学习如何在不同上下文中动态加权准则。语言反馈本身是高维、冗余信号,如何提取 position-level 可泛化监督是核心挑战。业界对 LLM judge 的可靠性要求不断提高,因为 judge 常用于 reward modeling 和策略优化,判定偏差会直接污染下游模型。

行业类比

类似于自动代码审查系统:如果只看“最终是否 merge”,无法教会模型区分“代码风格问题”与“逻辑错误”的权重差异;必须利用 review comment 语言反馈定位到具体 token 位置做密集监督,才能训练出平衡多准则的评审模型。

核心洞察

  • 按位置的熵偏移(per-position entropy shift)能分离两种教师行为:上下文锐化(概率集中到单一表达,导致记忆)和上下文扩散(保留多个语义等价候选,促进语义理解)。与 uniform self-distillation 或 outcome-supervised RL 对所有位置一视同仁不同,该方法提出只掩码高熵偏移位置,即保留低尾分布,从而避免学生复制教师的锐化模式,在不牺牲语言反馈信息的前提下提升主观评判任务的分布外泛化能力。
  • 语言反馈自蒸馏将偏好理由等自然语言信号直接嵌入教师条件,提供 dense token-level 监督,解决 outcome-supervised RL 中仅靠最终 verdict 准确率赋分、无法给 criterion-choice token 单独归因的问题。该方法对 criterion-choice token 的损失占比做了量化,发现这些位置承载大部分蒸馏损失,说明判别标准的选择是主观任务的核心变量。这种位置选择性监督与现有仅优化最终答案的方法形成互补,可迁移到其他需要隐式决策点的 LLM judge 或 reward model 训练。

方法

输入与核心思路

输入为 自然语言反馈(如偏好 rationale、评分 rubric)与待评估的响应对。核心思路是用 自蒸馏(Self-Distillation)将语言反馈转化为密集的逐位置监督信号:同一模型在额外条件化于反馈后作为教师,为学生模型提供每个 token 位置的分布指导。

关键模块:熵移位分析与位置掩码

教师与学生在每个位置的输出分布差异通过 熵移位(entropy shift)度量,即教师相对学生的熵变化。该值呈现两种模式:

  • 上下文锐化(context sharpening):教师将概率集中到某个特定反馈对齐的准则表达上,此时熵移位较大;
  • 上下文扩散(context spreading):教师将概率分散到多个反馈对齐的备选表达上,此时熵移位较小。

作者指出,锐化模式倾向于记忆具体措辞,而扩散模式更利于语义理解。因此提出 位置掩码:保留熵移位分布的低尾部位置,屏蔽高熵移位位置,避免逐字记忆而保留背景语义。

输出与训练目标

输出为训练的 LLM judge,在主观评测标准上与 outcome-supervised RL(如 GRPO)相比提升 2–9 个百分点,在客观评测上保持竞争力。

差异点:相比 GRPO 仅用单一标量奖励(忽略 token 级信号和语言反馈),本方法利用反馈实现位置选择性监督,并通过熵移位掩码避免 naive SD 对特定表达的过度拟合。

实验

实验设计

论文在主观与客观两类 LLM judge 任务上对比位置选择性自蒸馏(Position-Selective Self-Distillation, PSD)与结果监督强化学习(如 GRPO)。训练数据包含自然语言反馈(偏好理由 / 评分标准),SD 用同一模型以反馈为条件生成教师分布,对学生进行逐位置 KL 监督。通过逐位置熵位移 $\Delta H_t$ 分析教师-学生概率变化,识别 context sharpening(高熵位移)与 context spreading(低熵位移)两种模式。提出保留低熵位移尾部(即掩码高熵位移位置)的位置掩码策略。

关键发现

  1. 高熵位移位置掩码能提升分布外泛化,优于朴素 SD。
  2. 自蒸馏法官在评估的主观子类别上比结果监督 RL 提升 2–9 个百分点。
  3. 在客观类别上保持竞争力,无明显退化。
  4. 熵位移掩码与更广泛的准则多样性相关,spreading 模式保留语义理解而非记忆特定表达式。

基线对比解读

与 GRPO 等结果监督 RL 仅用最终判决准确率作为标量奖励不同,本文利用语言反馈的密集信号,对准则选择 token 提供单独监督。熵位移分析揭示并非所有位置都有用:sharpening 鼓励记忆特定准则表达,而 spreading 促进语义泛化。掩码高熵位移位置(即抑制 sharpening)实质是选择性保留泛化友好的监督信号。这解释了为何该方法在主观任务上显著优于 RL,同时不损失客观性能——主观任务更依赖准则权衡,而客观任务对准则选择不敏感。

行业影响

落地场景

该方法可直接用于 LLM-as-a-Judge 产品线,尤其适用于主观评估:电商评论质量评分、内容平台偏好标注、客服对话满意度分级、教育作文批改、金融舆情情感判定等。与传统 outcome-supervised RL 相比,位置选择性自蒸馏能从自然语言反馈中提取细粒度监督,提升评测器在分布外主观任务上的准确率 2-9 个百分点。

商业价值

对提供 RLHF/评分 API 的企业服务或内部数据标注平台,降本来自减少人工精标反馈的依赖:利用已有偏好理由文本即可训练更稳的 reward model。主观评测准确率提升可降低错误筛选导致的用户流失与合规风险。若用于电商推荐排序的 reward model,能间接提升 GMV;用于内容审核可减少误伤优质内容。

跟现有产品/工作流的接口

训练阶段可集成在现有 GRPO/DPO 框架中:将奖励模型的 rollout 序列按位置计算熵差 ΔHt 保留低尾部位置做 KLD 蒸馏;无需额外模型,只需修改 loss 掩码。推理时无额外开销。建议先在内部评测集上对比 naive SD 与 OPSD 的 OOD 表现,再替换线上 judge;工程实现参考 项目页 与 代码库。

局限

  • **泛化边界存疑**: 论文在偏好理由 (preference rationales) 与评分标准 (rubric) 两类语言反馈上做了实验, 但位置掩码策略依赖教师与学生间逐位置熵移分布, 该分布可能对基座模型容量、反馈模板风格和任务主观程度敏感。当前结果主要来自几个 LLM judge 基准, 缺乏对不同规模模型(如 7B 到 70B)和真实众包反馈噪声的系统验证; 熵移分布的尾部选择阈值 ρ 需要针对新任务重新调整, 可能限制零样本部署。
  • **计算与调优成本**: 方法需要额外的前向/反向来计算教师条件分布与熵移, 相比直接 outcome-supervised RL 增加了约一倍的自蒸馏训练开销; 同时引入 mask-fraction ρ 与 selector 两个超参, 消融显示性能对 ρ 敏感。虽然作者做了参数扫描, 但工程实践中需要为每个基座模型和反馈类型重新搜索, 导致部署调优成本上升, 且未给出自动选择 ρ 的启发式规则。
  • **评测局限性**: 主要收益集中在主观任务的子类别上, 客观任务仅持平; 下游 policy optimization 只在单个 setup 验证, 并未证明该 judge 训练方法在 RLHF 全流程中的稳定增益。此外, 论文未涉及 judge 自身的偏见放大与反馈循环问题, 即用同一模型生成反馈并蒸馏可能强化既有偏好; 与使用外部更强教师(如 GPT-4)蒸馏的方法相比, 本文的自蒸馏完全依赖模型自身, 其上限受限于基座模型能力。
论文Ilgee Hong2026-09-30原文

相关内容