论文

我们能信任教师吗?自蒸馏中解耦的信用方向与幅度

我们能信任教师吗?自蒸馏中解耦的信用方向与幅度

RLVR 能提供可靠的 trajectory 级信用,而 OPSD 则为 token 级信用给出密集监督。然而,当用教师监督同时更新 step 级信用的方向与幅度时,二者存在根本性耦合,导致每个 step 既难以获得可靠的信用方向,也无法确定其贡献幅度,同时使两者都易受教师判断错误与偏好方差的影响;论文对此给出了理论分析。 为将信用方向与贡献幅度分离,作者提出 Decoupled Credit Self-Distillation(DCSD),在理论上把信用方向与幅度解耦为两个可靠信号,并用它们校准特权教师监督。具体而言,设计了 belief-margin probing 来确定信用方向,用 marginal information gain 量化信用幅度,从而实现从 step 到 token 的信用分配,用于策略优化。 在 11 个 benchmark 上,DCSD 相对 GRPO、OPSD、RLSD 与 RLCSD 均取得最佳总体得分。与基座模型相比,DCSD 在数学推理上的总体得分提升 8.45 分,在多模态推理上提升 7.01 分,同时纠正了 6% token 的信用方向,并使 token 信用幅度降低 1.5 倍。

论文精读

TL;DR DCSD 通过 belief-margin probing 与 marginal information gain 将 self-distillation 的 credit 方向与幅度解耦并校准 teacher 监督,纠偏 token 级信用、降低幅度误差,在 11 个 benchmark 上全面领先。

问题

问题背景

可验证奖励强化学习(RLVR)为推理任务提供可靠的轨迹级反馈,而 OPSD 等自蒸馏方法使用特权教师信号给出 token 级稠密监督,目标是提升推理效率和中间步骤质量。

现有方法局限

OPSD 直接使用教师信号同时更新步骤级 credit 的方向(该步应被鼓励还是抑制)和幅度(该步贡献多大),二者耦合导致:

  • 方向失真:教师判断错误会直接翻转或偏移 credit 方向,且方向随教师偏好方差漂移。
  • 幅度不可靠:直接 log-ratio 尺度受教师偏好分布影响,一个错误 token 可能被赋予过大的贡献量。
  • 理论缺陷:RLSD 受 no-crossing limitation 限制,无法在不同轨迹间正确排序;RLCSD 虽使用对比偏好消除部分偏差,但仍受 outcome anchoring 和 no-crossing 约束。

为什么难/重要

本地 credit 的真实方向和大小是不可观测隐变量:轨迹级奖励只提供整体结果,token 级教师信号又混合了判断噪声与偏好方差,难以天然分离“该不该走”和“走多远”。若直接耦合二者,模型会同时学到错误中间步骤和错误步长,既损害最终准确率,也降低探索效率。DCSD 用 belief-margin probing 决定方向、用 marginal information gain 量化幅度,从信号源头解耦,与 RLSD/RLCSD 的约束式方法形成差异。

一句行业类比

类似在代码生成中,用单测奖励整段生成,而用语言模型教师标注每个 token 贡献;如果不分离方向和幅度,一个错误的 token 标注会同时误导策略梯度的符号和步长,导致生成质量下降。

核心洞察

  • DCSD 的核心洞察是将 step-to-token 信用解耦为方向与幅度两个独立信号,分别用 belief-margin probing 和 marginal information gain 量化,从而校准特权教师监督,避免直接使用教师信号带来的方向偏差和幅度膨胀。与以往直接使用 teacher logits 或 outcome reward 作为 token 级信用的方法(如 OPSD、RLSD、RLCSD)相比,解耦后方向不再受教师判断误差影响,幅度也能通过信息增益得到原理性约束,实验显示纠正了 6% 的 token 方向并压缩了 1.5 倍幅度,这种显式解耦是本文区别于同类工作的关键。
  • DCSD 将信用分配从值估计转向信息论归因:belief-margin probing 利用模型自身置信度边界确定信用方向,marginal information gain 通过信息增益量化每个 token 对最终结果的贡献幅度。这一视角不同于 RLSD 的 outcome anchoring 或 RLCSD 的 contrastive preference cancellation,它不依赖外部偏好或锚定,而是直接从模型表征和推理过程中提取可靠信号,因此在处理教师判断误差和偏好方差时表现出更强的鲁棒性,并为后续 step-to-token 信用分配提供了理论保证。

方法

输入:RLVR 提供可靠的轨迹级信用,OPSD 提供密集的 token 级信用,但直接使用教师信号会导致信用方向与贡献幅度的耦合,且易受教师判断误差与偏好方差影响。

关键模块

  1. belief-margin probing:从局部表征几何中归纳推理步骤,通过探测模型对步骤的信念边缘(belief margin)确定信用方向,即判断某一步是否有利于最终正确结果。
  2. marginal information gain:基于信息增益原理,量化每一步对最终答案的信息增量,作为信用幅度的独立信号。该信号与方向解耦,避免直接使用教师 log-ratio 带来的尺度扭曲。
  3. calibrated teacher supervision:将解耦后的方向信号与幅度信号用于校准特权教师监督,再执行 step-to-token 的信用分配,用于策略优化。

输出:校准后的 token 级信用信号,用于策略优化。

跟同类方法的差异点:与 GRPO 仅依赖轨迹级收益、OPSD 直接采用教师密集信号不同,DCSD 首次将信用方向与幅度解耦为两个可靠信号,并用它们校准教师监督,减少教师判断误差和偏好方差带来的方向扭曲与幅度污染。

实验

实验设计

论文在 11 个基准上评估 DCSD,覆盖数学推理与多模态推理任务。基线包括 GRPO、OPSD、RLSD、RLCSD,并与 base model 对比。评估指标为整体得分(overall score),并分析训练 reward、验证准确率、信用方向校正比例与幅值变化。

关键发现

  • DCSD 在 11 个基准上综合得分最佳,优于所有基线。
  • 相对 base model,数学推理整体得分提升 +8.45,多模态推理提升 +7.01。
  • DCSD 校正了 6% token 的信用方向,并将 token 信用幅值缩减 1.5 倍,表明其信用分配更精确。

与基线对比解读

DCSD 通过解耦信用方向与贡献幅值,分别用 belief-margin probing 和 marginal information gain 来校准教师监督。不同于 OPSD 直接使用教师信号导致方向与幅值耦合,DCSD 能抵抗教师判断错误与偏好方差。因此在整体得分上稳定超越 OPSD、RLSD、RLCSD,验证了 decoupled credit 对 self-distillation 的有效性。

行业影响

落地场景

DCSD 适用于任何需要逐步推理的 LLM 训练,尤其是数学解题、代码生成、多模态科学问答(如视觉推理、图表分析)。典型业务场景包括:

  • 教育解题助手:分步解析数学/物理题,学生可看到可信的推理过程
  • 金融分析:财报解读、风险评估中的多步逻辑推演
  • 电商客服:复杂售后政策、组合优惠的推理式回答
  • 医疗辅助:鉴别诊断的逐步推理,减少幻觉步骤

论文在 11 个基准上超越 GRPO、OPSD 等基线,数学推理提升 8.45 分,多模态提升 7.01 分,说明这些领域可直接受益。

商业价值

降本:传统 token 级过程监督需要大量人工标注,DCSD 用教师模型自动生成校准后的 step-to-token 信用信号,减少细粒度标注成本。

体验提升:纠正 6% token 的信用方向,降低 1.5 倍 token 信用幅度,使模型更少被错误步骤误导,最终答案更可靠。对用户而言,推理过程错误率下降,信任度上升。

训练效率:信用幅度控制让 RL 训练更稳定,可能减少超参调优和重训次数,间接降低算力消耗。

与现有工作流集成

DCSD 可作为现有 RLVR 管线的插件模块:

  1. 在 GRPO/PPO 计算 advantage 后,插入 belief-margin probing 判断步骤信用方向
  2. 用 marginal information gain 量化信用幅度,替换原生的 token 级监督
  3. 输出校准后的 credit 用于策略更新,与 vLLM、DeepSpeed 等训练框架兼容

依赖组件:策略模型、参考模型、验证器(reward model)。对已使用 OPSD 或 RLSD 的团队,迁移成本低,只需替换 credit 分配部分。

局限

  • 论文未提供计算开销与效率分析。**DCSD** 引入 **belief-margin probing** 与 **marginal information gain** 量化,需要在前向传播中额外存储隐藏状态、计算特征组信息增益并构建探针,训练时间与显存占用显著高于直接使用教师 logits 的 **OPSD** 或 **RLSD**。论文仅在 11 个 benchmark 上报告精度指标,未对比训练 wall-clock time、GPU 内存或可扩展性。在长序列、多步推理或大 batch 设置下,该方法可能成为瓶颈,工程部署时需要针对性优化或近似计算。
  • 实验设置存在覆盖局限。论文在数学推理与多模态推理共 11 个 benchmarks 上验证 **DCSD**,但未涉及代码生成、对话、工具使用等主流 **RLVR** 任务,跨任务泛化性存疑。所有实验均基于同一类基座模型(论文未明确具体模型大小与架构),对 **MoE**、小模型或非 transformer 架构的适配性未讨论。作者仅证明相对 4 个基线(**GRPO**、**OPSD**、**RLSD**、**RLCSD**)的优势,缺少与更细致信用分配方法(如 **Process Reward Model** 变体)的对比。
  • 依赖奖励信号质量与隐式线性假设。**DCSD** 以 **RLVR** 轨迹级信用作为方向真值,当环境奖励或 verifier 存在噪声、稀疏或偏差时,**belief-margin** 可能探测到错误方向。同时,**marginal information gain** 的估计基于隐藏特征可分性与特征组线性叠加假设,在推理步骤间信息高度冗余或非线性的情况下,贡献大小量化可能不稳定。论文没有对奖励噪声、偏好扰动进行敏感性分析,教师校准效果可能随任务奖励设计波动明显。
论文Yugu Li2026-09-28原文

相关内容