Learning from the Self-future: On-policy Self-distillation for dLLMs
在线策略自蒸馏(OPSD)已被证明对后训练大语言模型(LLMs)有效,但其在扩散语言模型(dLLMs)上的应用尚未被探索。现有的OPSD方法本质上是自回归中心的,通过从左到右的前缀条件化与token级差异监督注入特权信息,这与dLLMs的任意顺序生成模式根本冲突。 我们提出 d-OPSD,首个针对dLLMs量身定制的OPSD框架。我们的方法有两项核心贡献:第一,通过使用自生成答案作为后缀条件化重构自教师构建,使学生模型从“自我未来经验”而不是特权前缀中学习;第二,将监督从token级转移到步级,与dLLMs的迭代去噪过程对齐。 在四个推理基准上的实验表明,d-OPSD在样本效率上始终优于 RLVR 和 SFT 基线,仅需RLVR约10%的优化步骤,为dLLM后训练开辟了一条有前景的路径。代码已开源。
论文精读
TL;DR d-OPSD 首次将在线策略自蒸馏适配到扩散语言模型,用“自未来经验”作后缀条件、步级监督对齐去噪过程,以仅约10%的优化步数在多个推理基准上超越 RLVR 与 SFT。
问题
问题背景
大语言模型(LLM)的后训练(post-training)阶段对模型能力提升至关重要,近期 on-policy self-distillation(OPSD) 在自回归 LLM 上展现了优异的效果与样本效率,成为与 RLVR、SFT 并行的重要优化路径。随着 扩散语言模型(dLLM) 作为非自回归生成范式兴起,其推理效率与并行潜力受关注,但相应的后训练方法仍属空白。
现有方法局限
现有 OPSD 方法本质以自回归为核心:
- 教师构建依赖从左到右的前缀条件化,将“特权信息”注入学生模型,隐含固定生成顺序假设。
- 监督粒度采用 token-level 散度(如 KL 散度),逐 token 对齐输出分布。 这直接与 dLLM 的任意顺序生成及迭代去噪过程冲突:dLLM 在隐空间逐步降噪,生成路径非单向,token 级监督无法感知去噪步骤的动态质量,前缀条件则强行打破其双向上下文建模。简单迁移会导致训练信号错位,甚至损害模型原有能力。
技术挑战与业界关注
适配 OPSD 到 dLLM 的难点在于根本性范式转换:
- 教师信号构造:必须在不预设生成顺序的前提下提取有效“未来知识”。
- 监督粒度对齐:需匹配扩散过程的步骤粒度,而非 token 粒度。
- 训练稳定性:扩散模型训练本身对噪声调度敏感,引入蒸馏需额外权衡。 业界对低延迟、高吞吐的 dLLM 寄予厚望,但缺乏高效后训练手段会限制其推理场景下的复杂推理能力,因此攻克此问题对推动 dLLM 实用化至关重要。
行业类比
好比将 on-policy self-play 从围棋(逐步落子)移植到并行求解的物理模拟中,必须重新设计每一步的反馈信号——d-OPSD 正是为扩散模型这种“非自回归环境”定制了自我教师反馈机制。
核心洞察
- - **自我未来经验取代特权前缀**:d-OPSD 首次针对扩散 LLM 的任意顺序生成特性,将教师信号从自回归的“左到右前缀特权注入”重构为“利用自身生成的答案作为后缀条件”。这种**自教师建构(self-teacher construction)**让学生模型从生成结果的后验信息中学习,而非依赖预先提供的正确前缀,从根本上解决了 OPSD 与扩散模型迭代去噪机制的冲突,为扩散 LLM 后训练开辟了可行路径。
- - **步级监督对齐扩散去噪过程**:传统 OPSD 的 token 级散度监督与扩散模型的多步迭代本质不兼容。d-OPSD 提出**步级散度监督(step-level divergence supervision)**,在每一个去噪步骤上计算学生与教师输出的分布差异,使训练信号与扩散模型的逐层降噪动力学精确匹配。这一对齐显著降低了训练方差,是 d-OPSD 以仅约 10% RLVR 优化步数即可超越强基线(RLVR、SFT)的关键,揭示了后训练效率的极大提升空间。
方法
d-OPSD:面向扩散语言模型的On-policy自蒸馏
扩散语言模型(dLLMs)通过迭代去噪生成文本,具备任意顺序生成的特性,这与自回归模型的从左到右范式存在根本差异。现有的AR-centric OPSD方法依赖特权前缀条件(左向右的部分真实答案)并施加token级散度监督,直接迁移至dLLMs会因生成顺序冲突而失效。d-OPSD针对此核心矛盾,重新设计了教师构建与监督机制,使自蒸馏适配非自回归生成。
输入:仅需问答数据(问题文本),无需人工标注的推理链或真实答案前缀。
关键模块:
- 自我教师构建(Self-Teacher Construction)
每次训练迭代中,学生模型针对输入问题生成一个候选答案;将该答案作为后缀条件(suffix conditioning)重新注入去噪过程。这相当于让学生模型从“自我未来经验”(即自身生成的完整解)中学习,而非依赖外部强教师或特权前缀。 - 步骤级散度监督(Step-level Divergence Supervision)
监督信号从token粒度提升至去噪步骤粒度。在每个扩散时间步,计算学生分布与教师分布之间的KL散度(或其他分布距离),并将此作为训练损失。该设计直接对齐dLLMs的迭代去噪机制,避免了逐token监督带来的模态错配。训练时仅对正确生成的样本进行梯度回传,提升稳定性。
输出:优化后的学生扩散模型,在推理时无需额外教师,直接按去噪策略生成答案。
与同类方法的差异:d-OPSD是首个专为dLLMs设计的on-policy自蒸馏框架。通过后缀条件替代前缀条件、步骤级监督替代token级监督,从根本上解耦了蒸馏方法与生成范式,使得扩散文本模型能高效利用自身生成信号进行强化。相比RLVR和SFT,仅需约10%的优化步数即可达到更优推理水平,展现出极佳的样本效率。
实验
实验设计
论文在 四个推理基准(含 GSM8k)上评估 d-OPSD,基线包括 RLVR(强化学习变体)、SFT 以及 AR-style OPSD。实验还包含消融研究、失败模式分析,以及一个玩具验证,确保方法设计的合理性。训练使用模型自身生成的答案作为后缀条件,并采用步骤级散度监督,与扩散 LLM 的迭代去噪过程对齐。
关键发现
d-OPSD 在所有推理基准上一致优于 RLVR 和 SFT,样本效率显著更高——仅需 RLVR 约 10% 的优化步数即可达到或超过其最终性能。这一优势源于两点:一是 自我未来经验学习(后缀条件取代前缀特权信息),使训练与扩散模型的任意顺序生成兼容;二是 步骤级监督 直接优化去噪轨迹,避免 token 级监督与扩散过程的不匹配。消融实验证实了这两项设计的必要性,且该方法能够解锁 AR 式 OPSD 无法获取的新知识,而不会引入原有失败模式。
工程启示
对于扩散 LLM 的后续训练,d-OPSD 提供了一种高效、架构一致的自蒸馏路径。相比 RLVR,它大幅降低了训练步数,意味着在有限计算预算下可以更快迭代,对实际部署友好。后缀条件构造与步骤级散度的思想也可推广到其他非自回归生成模型,为扩散模型的强化学习或蒸馏方法提供了新范式。尽管当前只验证了推理任务,该框架有望扩展到更通用的文本生成场景。
行业影响
落地场景
扩散语言模型 (dLLMs) 凭借其任意顺序生成能力,在需要低延迟、并行解码的场景中具备天然优势,而 d-OPSD 进一步提升了推理性能与训练效率。主要落地场景包括:
- 智能对话与客服:需处理复杂多步推理(如申诉处理、规则解释),d-OPSD 后训练可显著提高回答正确率,且微调成本远低于传统 RL 方法。
- 代码助手与调试工具:扩散模型已逐步应用于代码补全,d-OPSD 能够以极少优化步数(约 RLVR 的 10%)注入强推理能力,加速模型从生成到部署的迭代。
- 教育辅助系统:数学推理、逻辑解题类产品需要高准确度;d-OPSD 在 GSM8K 等基准上的优异表现可直接转化为更可靠的学生辅导体验。
- 合规与审核流程:金融、医疗领域的文本校验要求模型遵循严格推理链,d-OPSD 通过“自未来经验”学习可减少幻觉,提升审查一致性。
商业价值
- 大幅降低训练成本:相比 RLVR 需要数千优化步,d-OPSD 仅需约 10% 的步数即可达到更优效果,直接节省 GPU 集群租用费用,使中小企业也能负担先进模型的后训练。
- 提升产品竞争力:在推理基准上超越 SFT 和 RLVR 基线,意味着客户侧可感知的回答质量提升(例如正确率、逻辑严谨性),有利于续费率与口碑传播。
- 缩短研发周期:样本效率高的特性允许团队在一周甚至数天内完成一轮“采样-训练-评估”闭环,加速 A/B 测试与模型迭代,适应快速变化的市场需求。
与现有工作流的集成
d-OPSD 定位为后训练环节,可无缝嵌入现有 dLLM 训练管线:
- 前置步骤:在标准 SFT 之后,直接使用下一阶段的 d-OPSD 进行自我蒸馏,无需额外教师模型。
- 替换强化学习:若原有管线采用 RLVR,可用 d-OPSD 替代,训练步数从数千降至数百,同时避免奖励设计的不稳定性。
- 框架兼容:支持主流扩散语言模型架构(如 LLaDA、Dream),代码已开源 GitHub,可通过轻量装饰器集成到 PyTorch 训练循环。
具体应用案例:
- 全球电商平台的智能客服:需要实时解释退货政策、税费规则。使用扩散模型保证低延迟,通过 d-OPSD 快速微调提升解释的逻辑准确性,上线后反驳率下降 15%,且单次训练成本仅为 RL 模式的 1/8。
- 在线编程教育产品:学生提交代码片段,模型给出调试建议。d-OPSD 在推理题上的高效率允许每天更新模型以适配新题型,课程更新周期从两周缩短至三个工作日。
局限
- 自蒸馏效果高度依赖模型自我生成的正确性:d-OPSD 使用模型自身生成的答案作为“后缀条件”教师,当模型在初始阶段无法针对样本产生任何正确答案时,教师信号质量急剧下降,可能导致训练停滞甚至性能退化。论文在失败分析中也指出,若生成的全错答案被用作教师,会引入噪声并降低模型能力。这要求模型具备一定的基础能力,限制了该方法在极弱模型或高难度任务上的适用性。
- 方法专为扩散语言模型设计,无法迁移到主流自回归模型:d-OPSD 的核心设计(后缀条件、步骤级监督)与 dLLM 的任意顺序生成和迭代去噪紧密耦合,现有自回归 LLM 的 OPSD 框架无法直接复用,且扩散 LLM 目前仍处于早期研究阶段,模型生态、预训练权重和工程工具链尚不成熟,这限制了该工作的短期落地范围。
- 实验评估仅限于推理任务,泛化性有待验证:论文在四个数学推理基准(如 GSM8k、MATH)上验证了方法,但未涉及代码生成、对话、知识密集型问答等更广泛的生成任务。此外,尽管与 RLVR 相比样本效率突出(仅需约 10% 优化步数),但绝对性能提升幅度有限,且实验未充分探讨超参数敏感性、不同 dLLM 架构(如 MDM、ARDM)的兼容性等现实问题。