论文

Nemotron-Labs-Diffusion: 一种统一自回归、扩散和自推测解码的三模式语言模型

Nemotron-Labs-Diffusion: 一种统一自回归、扩散和自推测解码的三模式语言模型

Nemotron-Labs-Diffusion 是一种三模式语言模型,统一了自回归解码(AR)、扩散解码和自推测解码。通过联合AR-扩散目标训练,模型可在不同部署场景和并发级别下切换模式,以维持高吞吐量。 研究表明:(1)AR和扩散目标互补:扩散增强前瞻规划,AR提供从左到右的语言先验。(2)在自推测模式下,扩散模型生成草稿,AR模型进行验证,在接受率和真实设备效率上均优于多token预测(MTP)方法。(3)光速分析表明扩散的长期潜力:在最优采样器下,每个前向传递可比自推测多产生76.5% 的token。 将模型扩展到3B、8B和14B参数,Nemotron-Labs-Diffusion 系列(包括基础、指令和视觉语言模型)在准确性和速度上均优于现有开源AR和扩散LM。例如,Nemotron-Labs-Diffusion-8B 每个前向解码的token数比 Qwen3-8B 多6倍,准确率相当;在SPEED-Bench上,使用SGLang在GB200 GPU上吞吐量提升4倍。

论文精读

TL;DR Nemotron-Labs-Diffusion 是一种三模态语言模型,统一自回归、扩散与自推测解码,通过联合训练灵活切换模式,8B 规模吞吐达同精度 Qwen3-8B 的 4 倍。

问题

当前大语言模型 (LLM) 的推理效率瓶颈集中在自回归 (AR) 解码带来的严格串行依赖性,导致 GPU 资源在低批量、交互式部署中严重利用不足。扩散语言模型通过并行去噪来生成多 token 块,成为提升吞吐量的新方向,但其独立建模方式牺牲了从左到右的语言先验,往往需要更多训练数据才能勉强追赶 AR 模型的精度。

现有方法局限主要体现在两方面:一是纯扩散模型(如 Dream、SDAR)在精度-效率权衡上仍显著弱于同等规模的 AR 模型,学习效率低;二是主流推测解码方案(如 Medusa、多头预测)的草稿模型要么依赖独立的小型 AR 模型,要么用并行预测头(MTP),其接受率实际设备上的加速比仍受限于单 token 预测的短视性。这些方法无法在同一个架构内灵活切换生成模式,以适应变化的部署并发度。

该问题的难度在于:(1)AR 与扩散训练的损失函数天然冲突 ——AR 依赖因果注意力,扩散需双向上下文——如何在单一模型中联合训练且不损害各自能力;(2)如何让扩散前瞻规划能力与 AR 的逐 token 验证形成互补,使自推测草稿质量超越传统 MTP;(3)在理论极限(speed-of-light)上,扩散的并行优势能否真正兑现为端到端加速。工业界对此高度关注,因为每降低一倍延迟、提升一倍吞吐,都可能直接节省数百万美元的推理成本。

类比于视频码率自适应:单一编码方案无法应对所有网络条件,需要实时切换清晰度以保证流畅播放;推理部署同样需要模型能动态在 AR、扩散或自推测模式间切换,以在多样化并发负载下持续保持高吞吐

核心洞察

  • **AR 与扩散的联合训练并非简单叠加,而是双向增强**:AR 损失为扩散提供自左向右的语言学先验,使扩散模型在保持并行生成优势的同时不丢失序列逻辑;扩散损失则提升模型的前瞻规划能力,缓解纯 AR 模型的长程依赖问题。这种互补性在以往工作(如 Dream、SDAR)中未被充分探索——它们通常把扩散作为独立解码器或后训练适配方案,而 Nemotron-Labs-Diffusion 证明了在预训练阶段统一两种目标可以产出既能逐 token 高精度解码,也能并行高速推理的单一模型。
  • **扩散驱动的自推测解码构建了不同于 MTP 的推测范式**:传统多令牌预测(MTP)本质仍是 AR 机制的延伸,草稿质量受限于单步前向的预测能力;Nemotron-Labs-Diffusion 改用扩散过程生成草稿,其并行去噪特性可一次性规划多个 token 的全局结构,再由 AR 验证,从而在 SPEED-Bench 上实现 6 倍于 Qwen3-8B 的每前向令牌数。这种“扩散草案 + AR 校验”的组合优越性在于无需额外草稿模型,且扩散本身的迭代优化空间为接受率提升提供更灵活的控制维度,达成实际设备上超越 MTP 的端到端效率。
  • **速度上界(speed-of-light)分析为扩散的极限效率提供了量化论据**:通过构建扩散解码的并行度理论边界,论文指出在最优采样器下扩散每前向可多生成 76.5% 的 token,即便当前硬件尚未完全适配,这一分析直接锚定了扩散 LMs 相对于 AR 及自推测的长期潜力上限。相较于此前工作对比时停留于经验性吞吐量数据,该分析为算法-硬件协同设计指出了方向:当未来 GPU 架构更擅长 non-causal 并行计算时,扩散模式有望进一步拉大效率优势。

方法

训练: 联合 AR-扩散目标

模型在标准 Transformer 基础上,采用联合自回归(AR)和扩散目标进行预训练。输入为文本序列,模型同时学习两个任务:

  • AR 目标: 经典的从左到右下一个 token 预测,提供语言学先验。
  • 扩散目标: 随机掩码部分 token 并加入噪声,然后学习去噪恢复原始 token,这迫使模型进行全局的“前瞻规划”(lookahead planning)。

训练时,两个损失项通过可调权重平衡,共享同一个 backbone。注意力模式经过特殊设计,以便在不增加额外参数的情况下兼容两种范式。消融实验证实,两种损失互补:AR 提升 token 级准确率,扩散增强长距离一致性和推理效率。

推理: 三种模式按需切换

单个模型支持三种推理模式,部署时可根据负载动态切换:

  1. AR 解码: 逐 token 生成,适合低并发、低延迟场景。
  2. 块级扩散去噪(Block-wise Diffusion): 一次前向传递去噪并解码多个 token(例如一个文本块),大幅提升吞吐,适合高并发、批量服务。
  3. 自推测解码(Self-Speculation): 由扩散模块首先生成草稿 token(可多个),然后由 AR 模块并行验证。该模式将扩散的快速草稿能力与 AR 的精确校验结合,接受率和实际设备效率均优于多 token 预测(MTP)方法。变体 Quadratic Self-Speculation 进一步推高单次前向生成的 token 数。

输出与效率

模型输出为完成的文本序列。在 SPEED-Bench 上,Nemotron-Labs-Diffusion-8B 单次前向传输的 token 数达对比模型(如 Qwen3-8B)的 6 倍,在 GB200 GPU 上实测吞吐量提升 4 倍,且精度相当。

与同类方法的差异: 与纯 AR 或纯扩散模型不同,Nemotron-Labs-Diffusion 通过一个统一架构实现了在生成质量和推理效率之间的动态权衡,且自推测解码无需额外的 draft 模型,即可显著优于现有的多 token 预测方案。

实验

实验设计

Nemotron-Labs-Diffusion 在 3B、8B、14B 参数规模上进行训练,覆盖基础模型、指令模型和视觉-语言模型。训练采用联合 AR-扩散目标,使模型能支持 AR 解码、块级扩散去噪及自推测解码三种推理模式。评估在 SPEED-Bench 上使用 SGLang 框架衡量吞吐量与延迟,并与强基线对比:Qwen3、MTP 方法等。

关键发现

  • AR 与扩散目标互补:扩散损失增强模型的前瞻规划能力,AR 损失提供有序的语言先验。
  • 自推测模式优于 MTP:扩散起草、AR 验证的流程在接受率和设备效率上均超过现有 MTP 方法。
  • 光速分析揭示扩散潜力:理想采样下,扩散每前向 pass 可比自推测多生成 76.5% token。
  • 吞吐量飞跃:Nemotron-Labs-Diffusion-8B 每前向可解码 6 倍于 Qwen3-8B 的 token 数,在 GB200 GPU 上实现 4 倍吞吐提升,且精度相当。

与基线对比解读

相比纯 AR 模型,三模式统一架构打破了顺序解码的瓶颈;相比纯扩散模型,保留了语言先验从而保证精度。在自推测解码这种投机推理场景中,扩散草案生成质量高、接受率高,验证了扩散作为高效生成器的能力。与 MTP 相比,扩散草案的并行特性带来更优的速度和精度权衡,预示未来大模型推理的演进方向。

行业影响

落地场景

Nemotron-Labs-Diffusion 的三模式切换能力覆盖了从低延迟交互到高吞吐批处理的多种部署需求:

  • 实时对话与助手:客服机器人、编程助手、游戏 NPC 等要求极低首 token 延迟的场景,可启用 自推测解码(Self-Speculation),利用扩散模型并行起草、AR 验证,在维持精度的同时大幅降低响应时间。
  • 批量内容生成:资讯聚合、商品描述生成、社交媒体文案等任务中存在大量独立请求,可切换到 块状扩散去噪(Block-wise Diffusion Denoising)模式,一次前向解码多个 token,提升吞吐量。以 8B 参数模型为例,在 GB200 GPU 上比传统 AR 模型吞吐高 4 倍。
  • 边缘与混合部署:在 IoT、移动端等资源受限环境中,可依据当前并发数与功耗预算,动态选择最节能模式,实现精度与效率的弹性折中。

商业价值

  • 降本:单次前向生成更多 token,显著减少服务同等请求量所需的 GPU 资源。例如,在 SPEED-Bench 上 Nemotron-Labs-Diffusion-8B 相比 Qwen3-8B 每前向解码 token 多 6 倍,推理集群规模可同比压缩,直接降低云服务成本。
  • 增收:吞吐量倍增使大规模个性化内容生成成为可能,如电商广告文案实时批量产出,加快内容上线速度,间接提升转化率与用户触达频次。
  • 体验提升:自推测模式下高接受率与低延迟的组合,使对话类应用(如智能教学、金融顾问)交互更流畅,减少用户等待焦虑,增强留存。

与现有工作流的集成

模型基于标准 Transformer 架构,权重可直接在 Hugging Face 上获取,兼容 SGLangvLLM 等主流推理引擎。实际集成只需更换模型 checkpoint,并利用推理配置传入模式切换参数:

  • 通过 Triton Inference Server 或自定义模型加速层,可构建动态路由器,根据实时负载查询(并发数、SLA 延迟要求)自动选择 AR、扩散或自推测模式。
  • 训练流程方面,联合 AR+扩散 目标仅需在现有预训练基础上继续训练,数据管道无需调整,可无缝融入 MLOps 流水线。

具体落地用例

  • 跨境电商平台:商品上架时需快速生成多语言描述。扩散模式并行处理,相比传统 AR 模型,每分钟生成量提升数倍,降低 GPU 开销;在买家咨询时,自推测模式保障对话实时性。
  • 编程教育平台:学员实时提问时,模型使用自推测模式输出代码建议,延迟与传统 AR 相当但一次可建议更多行;课后自动生成代码评语时切换扩散模式,避免占用交互时段算力。

局限

  • **训练成本与双目标平衡的挑战**:联合 AR 与扩散目标会使训练更复杂,论文虽提及互补性,但未详细披露训练过程中两个损失的权重调整策略及收敛稳定性。从方法设计看,扩散解码需要较长上下文作为草稿,可能对短序列生成效果不佳;且自推测解码依赖特定的验证器与采样器,其实现复杂度和内存开销高于标准推测解码。此外,模型目前仅扩展至 14B 参数,能否在百亿级以上保持训练稳定和推理效率仍有待验证。
  • **推理延迟与实时场景的适配性**:虽然扩散解码大幅提升吞吐量,但单次前向传播生成多个 token 时,端到端延迟可能高于逐 token 的 AR 解码,特别是在低并发、实时性要求高的场景。论文的速光分析基于最优采样器假设,实际部署中因硬件、批处理大小等因素,增益可能打折扣。另外,实验结果高度依赖 GB200 GPU 和 SGLang 框架,迁移到其他推理引擎或硬件时的性能一致性尚不明确。
论文Yonggan Fu2026-07-07原文

相关内容