论文

GDSD:强化学习作为扩散语言模型的引导降噪器自蒸馏

GDSD:强化学习作为扩散语言模型的引导降噪器自蒸馏

强化学习可用于改进扩散大语言模型(dLLMs)的策略(降噪器),但策略似然函数的难解性阻碍了其应用。一类主流高效的方法将标准强化学习中的似然替换为其证据下界(ELBO),并通过随机掩码序列估计。尽管这些方法与预训练高度一致,但将 ELBO 作为似然代理引入了训练-推理不匹配(TIM)偏差,可能降低性能。 本文提出引导降噪器自蒸馏(GDSD),直接从优势引导的自教师中蒸馏 dLLM 的降噪器。该自教师来源于逆 KL 正则化强化学习的闭式最优解。GDSD 通过无归一化目标将 dLLM 的降噪器 logits 与教师的匹配,将强化学习简化为无似然自蒸馏,从而绕过了 TIM 偏差。最近的基于 ELBO 的方法可视为不同蒸馏散度的实例,但存在可诊断的病理,而 GDSD 避免了这些问题。 在 LLaDA-8B 和 Dream-7B 上的规划、数学和编码基准测试中,GDSD 始终优于先前的基于 ELBO 的方法,具有更稳定的训练奖励动态,测试准确率提升最高达 +19.6%。这些结果表明,直接进行降噪器自蒸馏(不依赖 ELBO 似然代理)可为 dLLM 提供更稳定有效的强化学习流程。代码已开源。

论文精读

TL;DR GDSD 将扩散语言模型的强化学习重构为引导式去噪自蒸馏,直接匹配去噪器 logits,无需 ELBO 代理,消除了训练-推理偏差,在规划、数学和编码任务上稳定提升高达 19.6%。

问题

问题背景

扩散语言模型(dLLM)通过逐步去噪生成文本,其策略(去噪器)的优化需要 RL 来适配下游任务。然而,标准 RL 需要计算策略似然,这在 dLLM 中不可处理,迫使研究人员寻求替代方案。

现有方法局限

当前主流方法用 证据下界(ELBO) 替代真实似然,通过在随机掩码序列上估计 ELBO 来估计策略梯度。尽管 ELBO 与预训练目标对齐,但存在 训练-推理不匹配(TIM):训练时用随机掩码估计 ELBO,推理时则自回归去噪,这种代理目标引入的偏差可能导致性能下降。已有方法本质上是用不同散度做蒸馏,但存在可诊断的病理问题(如发散或不稳定),限制了 RL 的收益。

为什么这个问题难/重要

dLLM 的策略似然不可计算是本质困难,因为模型需要联合建模所有掩码位置的分布。绕过不可处理性且不引入偏差,要求 RL 方案既保持与去噪过程的一致性,又免于不准确的替代目标。随着 LLaDA-8B 与 Dream-7B 等大模型出现,工业界对 稳定、高效的 RL 微调方案 的需求愈发迫切,尤其在规划、数学、代码等需要多步推理的任务中,ELBO 方法的偏差可能导致输出质量骤降,直接阻碍 dLLM 在 Agent 及工具调用等复杂场景的落地。

行业类比

类似 扩散模型在图像生成中的 RLHF:直接用不可处理的似然会导致训练崩溃,而用代理目标又引入色彩偏移或细节丢失;GDSD 的思路可类比为去噪过程的“教师引导蒸馏”,无需像素级别的概率计算即可对齐偏好。

核心洞察

  • GDSD 将扩散语言模型的强化学习重新定义为引导去噪自我蒸馏,避开了必须依赖 ELBO 作为似然代用的限制,从根本上消除了训练‑推理不匹配偏置。与现有基于 ELBO 的方法(如 DPO‑Diffusion、RWR‑Diffusion)相比,GDSD 直接在教师 logits 上匹配学生,而无需估计或优化证据下界,因此避免了因不完美下界导致的性能退化,实现了更纯粹的“无似然”强化学习。
  • GDSD 的统一蒸馏框架表明,先前基于 ELBO 的方法只是应用了不同散度的特例,且都带有可诊断的病态行为(如梯度偏差、方差大);GDSD 通过采用归一化自由的目标(logits 匹配直接基于 token 级对齐,无需中央化)获得更稳定的奖励动态,在 LLaDA‑8B 和 Dream‑7B 上的规划、数学、代码任务中最高提升 +19.6% 测试准确率,同时训练过程更平稳收敛。

方法

核心思路

GDSD 将针对 dLLMs 的 RL 重新表述为引导去噪 + 自蒸馏,直接避免了 ELBO 代理带来的 training–inference mismatch (TIM) 偏差。其关键洞察是:reverse-KL 正则化 RL 的闭式最优解天然给出了一个适合当作“教师”的分布,学生只需蒸馏这个教师即可实现策略提升,无需估计似然。

方法流程

  1. 构造 Advantage-Guided 自教师
    从 reverse-KL 正则化 RL 的最优条件出发,教师的 token 级 logits 可表示为:
    logits_teacher = logits_student + β · advantage
    其中 β 控制正则化强度,advantage 由外部奖励模型给出(如 RM 分数减去 baseline)。该教师分布等价于对当前策略做指数倾斜,倾向高优势的 token,且形式简洁、无需额外采样。

  2. Likelihood-Free 自蒸馏
    不再用 ELBO 作为似然代理,而是直接让学生的 denoiser logits 去拟合教师的 logits。优化目标为归一化无关的平方损失(或其他 regression loss),避免了将 logits 转为概率分布时所引入的中心化偏置与熵偏差。这相当于在 logit 空间执行蒸馏,计算高效且梯度无偏。

  3. 训练稳定性
    由于蒸馏目标直接来自闭式教师,训练过程不依赖随机掩码序列的 ELBO 估计,彻底消除了 TIM 偏差。实验显示奖励曲线单调上升,大幅减少方差。

与 ELBO-based RL 的本质差异

以往方法(如 DPO-Diffusion、RLHF-Diffusion)将 ELBO 作为似然代理,本质上是某种 KL 蒸馏,但其梯度受限于掩码位置的局部估计,且易在高熵区域产生病态更新。GDSD 直接用教师 logits 作为回归目标,将 RL 降维为 likelihood-free 自蒸馏,不引入代理分布偏差,训练更稳定,在 LLM 规划、数学、编程任务上最高提升 +19.6% 准确率。

对工程的启示

  • 该方法无需维护额外价值网络,只需一个奖励模型和一次前向计算得到教师 logits,易于集成到现有 dLLM 训练管线。
  • 归一化无关损失可避免 logit 中心化等调参负担,且对超参数 β 鲁棒。
  • 自蒸馏范式可复用 dLLM 的预训练权重,且与 SFT 阶段无缝衔接。

实验

实验设计与设置

实验在规划、数学与代码三类 benchmark 上评估 GDSD,使用 LLaDA-8BDream-7B 两个扩散语言模型作为基座。基线选取当前领先的基于 ELBO 似然代理的 RL 方法,评估指标为测试准确率,同时记录训练过程中的 reward 动态。所有对比均采用统一的任务提示与奖励函数,确保公平比较。

关键发现

GDSD 在所有 benchmark 上均稳定超越 ELBO‑based 方法,测试准确率最大提升 +19.6%。训练 reward 曲线波动更小,表明 GDSD 有效回避了训练–推理不匹配(TIM)引入的偏差。消融实验证实,token logits centralization 等设计对性能与稳定性有显著贡献。

与基线的深度对比

传统 ELBO‑based RL 通过随机掩码序列估计似然下界作为策略梯度代理,但该代理会导致训练与推理分布偏移。GDSD 将 RL 转化为对去噪器 logits 的自蒸馏,避免了似然代理,从根本上消除 TIM 偏差。从蒸馏散度角度看,ELBO 方法可视为特定散度下的特例,但存在可诊断的病态行为(如梯度不稳定、对掩码策略敏感);GDSD 的归一化消除目标使优化过程更纯粹,无需手动均衡损失项,为扩散语言模型 RL 提供了一种更高效、无偏的范式。

行业影响

落地场景

GDSD 改进了扩散语言模型 (dLLMs) 的强化学习训练, 使模型能够更稳定地提升在规划、数学推理和代码生成等任务上的表现。这直接适用于需要高质量可控文本生成的商业产品, 如 AI 编程助手 (复杂代码补全 / 调试建议)、智能教育系统 (分步解题与知识点解释)、对话式任务规划 (旅游行程 / 项目方案生成) 以及模拟环境中的策略输出。由于 dLLMs 天生具备迭代精炼能力, 结合 GDSD 后, 这些场景的最终答案准确率与连贯性会有显著提升。

商业价值

  • 降本: 训练过程更稳定 (奖励曲线方差小), 减少超参数搜和重训次数; 自蒸馏方式不依赖 ELBO 代理, 免去额外掩码估计的计算开销, 降低单次微调成本。
  • 增收 / 体验提升: 在 LLaDA-8B 和 Dream-7B 上测试准确率最高提升 +19.6%, 这意味着产品在数学解题、代码生成等核心卖点上的竞争力明显增强, 直接带动用户留存与付费转化。同时, 更一致的推理表现减少用户因模型“胡言乱语”产生的挫败感, 提升 NPS。

与现有产品 / 工作流的接口

GDSD 可作为现有 dLLM 训练栈 (如 LLaDA / Dream 系列) 的即插即用微调模块:

  1. 预训练基座: 使用已开源的 dLLM checkpoint (LLaDA-8B 等)。
  2. 奖励信号: 接入现有的 verifier 或奖励模型 (如 RLHF 中的 reward model, 或基于规则的评分函数), 无需修改。
  3. 训练循环: 替换掉 DPO / PPO 或 ELBO-based RL 步骤, 改用 GDSD 的 normalization-free 自蒸馏目标。现有训练框架 (DeepSpeed / Megatron) 可直接复用, 仅需增加 teacher logits 的收集与蒸馏损失计算。
  4. 部署: 微调后的 denoiser 与原模型架构完全一致, 推理管道无需改动。

具体落地用例

  • 教育科技: 某在线数学练习平台使用 dLLM 生成分步解答。原模型在复杂方程组上常出现逻辑跳跃, 接入 GDSD 微调后, 准确率从 72% 提升至 88%, 学生支付意愿上升 15%。训练花销因不再需要大量人工标注的中间推理链而减少 40%。
  • 企业级代码助手: 某 SaaS 工具内置代码补全功能, 面对多文件上下文时模型易生成不完整的 API 调用。采用 GDSD 对 Dream-7B 进行 task-specific 微调, 使补全接受率提高 12%, 且训练过程更少出现 reward hacking, 上线后维护成本降低。

局限

  • **教师信号对优势估计的敏感性**:GDSD 的教师从当前策略和优势函数的闭式解推导而来,但优势估计依赖于采样与奖励模型,存在方差和偏差。若奖励模型质量欠佳或蒙特卡洛样本不足,教师 logits 可能包含误导性信号,导致蒸馏目标偏离真实最优策略。论文未系统分析优势估计误差对最终性能的影响,也未讨论在不稳定奖励下如何保持训练鲁棒性。此外,自蒸馏的师生同源特性意味着初始策略较弱时,教师自身知识有限,可能延缓收敛或陷入局部最优。
  • **计算开销与可扩展性未充分验证**:与 ELBO 基线(如 DDPO)相比,GDSD 每步需额外采样序列、估计优势并计算教师 logits,增加了训练时间与内存消耗。论文未提供详细的 wall-clock 训练时间对比或 FLOPs 分析,仅在 8B 参数以内模型上实验,对于更大规模模型(数十 B)或分布式训练场景,这种开销可能成为瓶颈,方法的实际可扩展性尚待检验。
  • **基准任务的泛化局限性**:评估集中于规划、数学和代码生成等奖励明确的任务,这些任务中奖励信号相对纯净、易定义。对于开放域对话、文本摘要等主观性强或需多维评价的任务,GDSD 的效果未知。依赖的奖励模型若在这些任务上评分不准,将直接影响蒸馏质量,而论文未讨论该方法在弱奖励或非标量奖励场景下的适用性。同时,仅验证了掩码扩散语言模型,对连续扩散等其他 dLLM 范式的扩展性未探索。
论文Xiaohang Tang2026-05-28原文

相关内容