dOPSD: 扩散语言模型的On-Policy自蒸馏
扩散大语言模型(dLLMs)通过迭代去噪掩码序列生成文本,为自回归模型提供了并行替代方案,但其后训练中难以激发强推理能力:监督微调是离策略的,存在曝光偏差;强化学习仅提供稀疏的序列级奖励,且由于缺乏可处理的序列似然而难以应用。 On-Policy自蒸馏(OPSD) 提供了一种有前景的替代方案,使用同一模型作为学生和教师,提供密集的、词元级的、在策略监督信号。然而,其有效性依赖于给予教师 特权信息(PI)——通常是推理时不可用的实例级真值参考——导致学生最终蒸馏出一个弱PI-free共识策略,对dLLM推理改进甚微。 我们提出 dOPSD,它直接在学生自身的去噪轨迹中衍生教师特权:利用同一轨迹中更后的解码步骤来评估掩码位置,而非外部标签,从而使教师优势来自模型自身的解码过程。在 Dream 和 LLaDA 上,dOPSD 同时改进了 在域数学推理 和 域外代码生成 性能,超越了监督和在策略基线。
论文精读
TL;DR dOPSD 利用扩散语言模型自身的去噪轨迹生成教师特权信息,实现 on-policy 自我蒸馏,无需外部标注即可增强数学推理与代码生成能力。
问题
问题背景
扩散大语言模型(dLLMs)通过迭代去噪掩码序列实现并行解码,为自回归模型提供了高效替代,但其推理能力(数学、代码等)在标准后训练流程中难以被有效激发。
现有方法局限
- 监督微调(SFT):采用离线教师强制,学生仅见过真实前缀而非自身生成分布,导致曝光偏差;即使增加数据,也因分布不匹配而表现退化。
- 强化学习(RL):依赖序列级稀疏奖励(如最终答案正确性),无法提供 token 级细粒度信号;且 dLLM 缺乏可处理的对数似然,使策略梯度方法难以稳定实施。
- 在线自蒸馏(OPSD):试图同时作为学生和教师,提供在线、密集的 token 级监督。但教师常需特权信息(PI)(如真实中间状态),该信息在推理时不可用,导致教师退化为无 PI 共识策略,学生只能蒸馏出弱基线模型,无法提升推理能力。
为什么这个问题难且重要
核心挑战在于:如何在保持在线策略的同时,为 token 级监督生成高质量的特权信号,且不依赖任何外部真实标签。现有在线自蒸馏因 PI 缺失而崩塌,而 dLLM 的去噪轨迹天然包含逐步揭示的信息——若能从模型自身解码过程中挖掘该特权,则可能实现真正的自改进。业界对此高度关注:若成功,将解锁 dLLM 在推理任务上的扩展路径,无需昂贵的人工标注或奖励模型,直接利用模型自身的迭代去噪过程构建优势信号。
行业类比
类似 AlphaGo 的自我对弈——从同一模型的不同阶段生成更强信号,驱动策略持续提升,但此处是让扩散语言模型从自己的去噪轨迹中“学习未来”。
核心洞察
- **内部轨迹自监督解决了 OPSD 的特权信息崩塌**:传统 on-policy self-distillation (OPSD) 需要外部 ground-truth 作为 teacher 特权信息,导致 student 只能蒸馏出一个无特权、性能下降的共识策略。dOPSD 创新性地让 teacher 的 privilege 来自 student 自身去噪轨迹的“未来步骤”——利用同一序列后续更少掩码的状态去评估当前掩码位置,使特权优势天然内生于模型解码过程。这彻底消除了对外部标签的依赖,且因为 teacher 与 student 共享同一轨迹,避免了分布偏移,在 Dream 和 LLaDA 上首次实现 OPSD 对扩散语言模型推理的正向提升。
- **去噪轨迹的时差监督为扩散语言模型提供密集 token 级学习信号**:扩散语言模型的生成是逐步去掩码的过程,天然形成一条从完全掩码到干净文本的轨迹。dOPSD 将 teacher 定义为观察更多去噪步骤后的模型自身,利用轨迹后半段的预测作为当前步骤的 soft target。这种“时差蒸馏”不仅提供比强化学习更密集的 token 级监督,而且完全 on-policy,避免了监督微调的暴露偏置;实验表明,仅使用前向 KL 散度且无需 rollout 验证即可稳定训练,相比 RL 和 SFT 基线更简洁、更稳定,同时显著提升数学推理和跨域代码生成性能。
方法
dOPSD 是一种针对扩散语言模型(dLLM)的在策略自蒸馏方法,解决传统 OPSD 因依赖外部特权信息(PI)导致的性能退化问题。其核心思想是将模型自身去噪轨迹中的未来步骤作为教师特权,实现完全自主的密集令牌级监督。
方法流程
输入与状态定义
扩散语言模型生成文本的过程可视为一个逐步去掩码的轨迹。在轨迹中的第t步,学生模型看到的是一个部分掩码的序列x_t,需要预测哪些掩码位置应被揭示(即下一个状态x_{t+1})。教师特权构建
传统 OPSD 使用外部证据(如最终答案)作为特权信息,该信息在推理时不可用,导致学生收敛到弱共识策略。dOPSD 的关键创新是:对于学生状态x_t,教师观察到同一轨迹中更晚的、已揭示更多信息的状态x_{t+k}(k为教师前瞻步数)。教师利用这个“未来”状态生成每个掩码位置的预测分布,作为学生学习的软目标。训练目标
学生模型以x_t为输入,输出去掩码策略π_student;教师模型以x_{t+k}为输入,输出更优的策略π_teacher。训练通过最小化两个分布间的差异(如正向 KL 散度)来实现,从而使学生在不接触未来信息的条件下逼近教师的行为。同时,通过轨迹验证机制过滤掉不满足真实去噪路径的无效未来状态,保证特权信息的可靠性。输出
训练结束后,学生模型在推理时无需任何特权信息,仅凭当前掩码序列即可做出更合理的去掩码决策,显著提升数学推理和代码生成等需要强推理能力的任务性能。
与同类方法的差异
不同于 RL 方法提供的稀疏序列级奖励,也不同于监督微调因 off-policy 导致的曝光偏差,更不同于传统 OPSD 对外部特权信息的致命依赖,dOPSD 完全在策略、令牌级稠密地利用自生成轨迹的未来步骤构建监督信号,使特权来源与推理条件完全对齐,从而首次在 dLLM 上实现了有效的自蒸馏。
实验
实验设计
研究在两个扩散大语言模型(Dream 和 LLaDA)上评估 dOPSD,以验证其在数学推理和代码生成任务上的有效性。训练数据使用域内数学问题集,评测涵盖 GSM8K、MATH500(域内数学推理)和 HumanEval、MBPP(域外代码生成)。对比基线包括:监督微调(SFT)、强化学习(RL)、朴素 OPSD 及其消融变体(前向 / 反向 KL、教师视野等)。所有方法均在同一基础模型上进行后训练,以确保公平比较。
关键发现
- 唯一提升基模型的方案:dOPSD 是唯一在 Dream 和 LLaDA 上均能提升推理性能的方法,而 SFT、RL 和朴素 OPSD 均导致性能下降,证实了 OPSD 在 dLLM 中因缺少特权信息而退化为弱共识策略。
- 域外泛化:dOPSD 在未见过代码基准上表现出明显增益,表明利用自身去噪轨迹获得的特权信息更具泛化性。
- 消融实验:前向 KL 优于反向 KL,且教师视野(horizon)越长、轨迹掩码阈值越低(保留更多未来步骤信息)效果越好;移除 rollout 验证会损害稳定性和性能。
与基线对比的深度解读
SFT 在 dLLM 中遭受 exposure bias,即训练时输入干净数据、推理时却面对自身有噪输出,导致分布偏移。RL 仅提供稀疏的序列级奖励,且因缺乏可处理的似然而难以优化。朴素 OPSD 由于特权信息(PI)来自外部参考文本,学生最终学习的是 PI-free 共识策略,无法学到高质量推理。dOPSD 将特权信息定义在模型自身的去噪路径上——用同一轨迹的后段掩码预测结果监督前段,使教师优势天然来源于模型解码过程,从而实现了 on-policy、逐 token 密集 且无外部依赖的自我蒸馏,从根本上解决了上述方法的缺陷。
行业影响
落地场景
扩散语言模型(dLLMs)的并行解码特性非常适合对延迟敏感的实时文本生成产品,但推理能力不足限制了其在复杂任务中的应用。dOPSD 在数学推理(GSM8K、MATH500)和代码生成(HumanEval、MBPP)上的显著提升,使其可直接赋能:
- 智能客服与对话AI:处理需要多步推理的订单查询、故障诊断、政策解释等场景,利用并行解码降低首token延迟,提升用户体感。
- AI辅助编程工具:代码补全与生成中,推理能力直接影响正确性和可用性,dOPSD增强的dLLM可在保证生成速度的同时提供更可靠的代码建议。
- 教育与内容审核:自动解题、作业批改或对生成内容进行逻辑一致性检查,需要模型具备稳健的推理链,dOPSD提供了一种无需外部标注即可自我提升的方法。
商业价值
- 降本:dOPSD是一种纯后训练自蒸馏方法,不依赖人工标注、奖励模型或昂贵的RLHF流程,仅需单模型自身完成数据生成与训练,大幅降低模型定制化成本。同时,dLLM推理速度优势可减少GPU资源消耗,直接降低API或私有化部署的算力开支。
- 体验提升与增收:更快的响应和更准确的推理直接提升用户留存和付费意愿。例如在编程助手场景,更少的错误代码能显著提高开发者效率,从而提升产品竞争力与订阅收入。
与现有产品/工作流的接口
- 模型训练pipeline集成:dOPSD可作为一个独立的post-training阶段,无缝插入现有的SFT(监督微调)后、推理部署前。无需改变模型架构或推理框架,仅需使用模型自身的解码轨迹,可与Hugging Face Trainer、DeepSpeed等标准训练栈兼容。
- 持续改进闭环:在线自蒸馏特性允许在模型部署后,利用真实流量不断收集新的解码轨迹,周期性进行dOPSD微调,实现模型推理能力的持续进化,而不依赖昂贵的人工校验。
具体落地Use Case
- 电商智能导购:在大型电商平台,用户常询问“哪款手机适合玩大型游戏且预算3000以下?”这类需要跨商品比较、参数推理的问题。dLLM可并行生成答案,dOPSD确保推理逻辑正确,避免推荐错误,提升转化率。
- 在线编程教育平台:编码练习自动评分与提示系统。学生提交错误代码时,模型需给出修正建议。dOPSD增强的dLLM能在低延迟下理解代码逻辑并生成合理提示,降低人工助教成本,提高教学响应速度。
局限
- **依赖学生模型初始能力**:dOPSD 的教师信号源自学生自身去噪轨迹的未来步骤,要求中间解码步已具备一定推理质量,若基模型过弱,自举过程可能引入高噪声,导致训练崩溃或提升有限。论文仅在 Dream 和 LLaDA 两个强基模型上验证,未给出基模型能力阈值或弱模型场景下的失效分析,限制了该方法在低资源或早期探索阶段的可信度。
- **任务覆盖与泛化性有限**:实验聚焦数学推理(GSM8K、MATH500)与代码生成(HumanEval、MBPP),虽展示跨域迁移,但任务类型单一,均为逻辑密集型;对于常识推理、开放域问答或长文本任务的表现缺乏验证。此外,仅在两个 dLLM 架构上测试,不同噪声调度或预训练目标的扩散模型可能带来性能波动,方法的通用性需更多交叉验证。
- **计算效率与可扩展性不足**:在线蒸馏需保存并回放完整去噪轨迹,每个样本需执行多次前向传播以生成教师信号,显存与时间开销显著高于离线 SFT。论文未提供训练吞吐量或资源对比,在大规模模型(如 30B+)或海量数据上的可行性未知。相对于自回归模型的在线蒸馏,扩散模型迭代步数更多,该开销将进一步放大,可能限制其在工业场景中的快速应用。