论文

Discrete Diffusion Models: 从分词到生成的统一框架

Discrete Diffusion Models: 从分词到生成的统一框架

离散去噪扩散模型(DDMs)近期成为自回归(AR)建模在离散数据上的有力替代,具备并行生成和迭代全局优化能力。与状态空间固定的连续扩散不同,DDMs 的形态根本上由离散状态空间的构建方式决定:分词方案、词汇拓扑以及领域特定结构字母表。 本文引入一个统一概念框架,通过底层离散状态空间的构建来审视离散扩散模型。在该框架下,现有公式(包括转移矩阵、掩码/吸收状态和分数/比率方法)均表现为共同设计空间的不同实例。该框架进一步揭示了训练目标、推理算法、扩展行为、系统优化和评估协议方面的常见设计权衡,指出了若干有前景的未来研究方向。

论文精读

TL;DR 提出离散扩散模型的统一框架,从 tokenization 到状态空间构建,将多种方法纳入共同设计空间,系统分析训练、推理与扩展的权衡与未来方向。

问题

问题背景

离散数据(文本、代码、量化图像/音频、分子图等)的生成建模长期由自回归(AR)范式主导,但 AR 存在解码时顺序依赖、无法全局迭代修正的局限。离散扩散模型(DDM)凭借并行生成与逐步去噪的潜力,成为替代方案,近期在多种离散模态上展现出竞争力。

现有方法局限

现有 DDM 研究分散为相互孤立的子范式:

  • 转移矩阵扩散 (D3PM) 关注状态转移设计,但矩阵空间的构造原则(如均匀噪声、吸收态)缺乏系统关联;
  • 掩码/吸收态扩散 在实践中效果突出,但其成功要素为何、如何推广到更一般词汇拓扑尚不明确;
  • 连续时间离散扩散 (CTMC)评分/比率匹配 方法分别从随机过程和评分函数角度建模,与离散时间版本的对应关系模糊,导致训练目标(ELBO vs. 简化损失)、推断策略(置信重掩码 vs. 祖先采样)的选择缺乏理论指导。

更关键的是,所有上述方法都依赖于 离散状态空间的构建(即分词方案、词汇规模、领域结构字母表),但现有工作将其视为孤立预处理步骤,未能揭示状态空间拓扑如何从根源上决定模型容量、缩放行为及推理效率。设计空间的碎片化使从业者难以跨模态迁移经验,也无法有针对性地权衡质量、速度与内存。

为什么这个问题难/重要

离散状态空间的构建自由度极高:分词器可以是 BPE、VQ-VAE 码本、SMILES 规则等,词汇间可定义树状、网格甚至全连接关系。这些选择对扩散过程的马尔可夫转移矩阵施加了直接的结构归纳偏置,进而影响去噪网络的表征学习。若缺乏统一框架,每次新模态或新应用都需要重新探索设计空间,成本高昂。业界对 并行生成 + 全局迭代精修 的组合能力有强烈需求(例如 LLM 低延迟解码、科学序列编辑),离散扩散若能统一设计原则,有望打破 AR 的顺序瓶颈。

行业类比

类似于 Transformer 架构统一了原本割裂的 RNN、CNN、Attention 设计空间,离散扩散模型需要一个从 分词 (tokenization) 到生成 (generation) 的一体化视角,让算法选择、系统优化形成可直接复用的设计模板。

核心洞察

  • 离散扩散模型的性能根本上由离散状态空间的构造决定,而非仅由扩散过程设计。该论文首次将 tokenization 方案、词汇拓扑结构以及领域特定的字母表纳入统一框架,将现有离散扩散变体(如 D3PM 中的转移矩阵、掩码扩散、分数/比率模型)映射为同一设计空间中的不同实例。这一视角突破了以往将各方法视为独立分支的局限,揭示了它们之间隐藏的等价性与转化关系,为系统性比较和改进提供了理论基础。
  • Tokenization 是离散扩散模型中被低估的核心设计杠杆。传统上,扩散模型研究聚焦于前向过程、训练目标和采样策略,而 tokenization 常被当作预处理步骤被忽略。本文明确指出,离散状态空间的拓扑结构(如 codebook 的几何性质、序列长度、压缩率)直接影响扩散步长、条件依赖性和生成可控性,并在跨模态(文本、图像、音频、科学数据)中具有通用性。因此,面向任务的 tokenization 联合设计可能比单纯扩大模型规模更能提升效率和生成质量。
  • 离散扩散的统一数学表述暴露了训练、推理与系统实现之间的深层权衡。通过将离散时间/连续时间、ELBO/分数匹配等不同目标统一在共同框架下,该工作揭示了推理加速(如缓存、蒸馏)与模型容量利用之间的矛盾;也指出双向 Transformer 等架构在离散扩散中的扩展定律尚未被充分探索。这为算法与系统协同设计提供了清晰的路线图,避免了孤立优化单一部分的陷阱。

方法

统一设计空间:从标记化到生成

论文将离散扩散模型看作一个以 离散状态空间构造 为核心的设计框架。

输入:任意离散数据——文本、代码、图像/音频经 VQ 量化 得到的令牌序列,或蛋白质、图等自然离散结构。关键在于标记化(tokenization),它定义了词汇表、拓扑和语义,直接影响后续扩散行为。

关键模块

  • 前向腐蚀:通过一个参数化的 转移矩阵 (Q_t) 定义逐渐将数据转化为噪声的离散时间马尔可夫链;衍生出掩蔽扩散(吸收到 [MASK] 状态)、均匀替换、领域特定替换等多种腐蚀类型。连续时间版本则以速率矩阵取代转移矩阵,支持更细粒度的扩散。
  • 反向去噪:学习逆向模型 (p_\theta(x_{t-1}|x_t))。根据前向矩阵,可通过封闭形式后验、得分/比率匹配或简化降噪目标(如预测掩蔽位置的令牌)来训练。模型架构通常选用双向 Transformer 或状态空间模型,以 (x_t) 和时间 (t) 为条件,输出干净数据或转移分布。
  • 训练目标:包括离散 ELBO、加权降噪损失、得分匹配等。统一视角揭示它们本质上是同一设计空间的不同优化面
  • 推理策略祖先采样按逆过程逐步去噪;置信度重掩蔽并行解码,每步仅更新高置信度令牌;还可引入半自回归块更新、分类器自由引导及约束满足。加速手段包括少数步蒸馏、KV 缓存和并行推理。

输出:生成的离散序列,可以是文本、图像令牌、分子结构等,取决于标记化定义。

差异点:与以往孤立研究特定离散扩散变体(如 D3PM、MDM)的方法不同,本框架将标记化、腐蚀类型、训练目标、推理算法统一为相互关联的设计维度,强调令牌空间构造对全局性能的根本影响,并系统量化各维度间的权衡。

实验

本文未进行新的独立实验,而是通过统一框架对现有离散扩散模型的设计与评估进行系统性回顾。实验设计维度包括:

  • Tokenization 选择:文本(BPE/WordPiece)、图像(VQ-VAE 码本)、音频(量化频谱)、科学数据(图/分子 SMILES);
  • 前向过程:均匀替换、掩码(absorbing state)、混合噪声调度;
  • 训练目标:离散 ELBO、简化的交叉熵去噪、score/ratio-matching;
  • 推理策略:固定步数祖辈采样、置信度重掩码(迭代并行解码)、半自回归分块更新、分类器/无分类器引导。

关键发现

  • 掩码扩散(Masking/Absorbing) 在当前实践中占主导地位:训练稳定,似然和生成质量均具竞争力,且易适配缓存加速。
  • 连续时间离散扩散(CTMC) 在理论上更优雅,提供更紧的变分界,但需要模拟随机微分方程,工程复杂度较高。
  • Tokenization 质量 对最终生成效果影响显著——更好的量化器(如 FSQ)可缩小离散扩散与连续扩散在图像生成上的差距。
  • 缩放行为 显示离散扩散在长序列生成时具有并行优势,但短序列下自回归模型仍具竞争力。

与基线对比解读

与自回归模型(如 GPT、VQGAN-AR)相比,离散扩散在以下场景展现优势:

  • 需要并行解码的整体生成任务(如图像/视频),可大幅降低串行步数;
  • 允许灵活约束插入的引导生成(如可控文本、分子设计),逆向过程天然支持条件注入。

然而,在纯文本自回归基准上,离散扩散的似然度通常略低于等效规模的自回归模型,且需精细设计 token 选择策略才能达到 competitive 的推理速度。此外,不同损失函数(如自回归式交叉熵 vs. 离散 ELBO)之间的效果差异不如改进 tokenization 或架构带来的提升显著。整体上,本文构建的设计空间为统一评测和未来改进提供了清晰的对比维度。

行业影响

离散扩散模型(Discrete Diffusion Models, DDM)在文本、代码、图像、音频等离散 token 化数据上展现出并行生成与全局迭代精修能力,为工业界提供了自回归模型之外的规模化生成方案。

落地场景

  • 文本与代码生成:在对话系统、内容创作、代码补全等场景,DDM 可通过并行解码与可调节的迭代步数,在延迟敏感场景(如实时对话)与质量优先场景(如长文生成)之间灵活权衡,尤其适合需要 全局一致性 的文档级生成。
  • 多模态内容生成:结合 VQ-VAE 等 tokenizer,DDM 可统一处理图像、音频、视频,在创意工具(如 AI 辅助设计、音乐生成)中实现 跨模态联合生成,并能通过掩码策略支持可控编辑(如修复、风格迁移)。
  • 结构化数据生成:在药物分子设计、蛋白质序列生成等科学计算领域,DDM 可直接作用于离散的化学或生物 token,利用扩散过程的 逐步精修 特性提升生成样本的质量与多样性。

商业价值

  • 降低成本并行解码大幅缩短生成长序列的端到端延迟,同等硬件下可提升服务吞吐量,降低推理成本;更少的采样步数(如蒸馏后 4-8 步)可进一步压缩计算开销。
  • 提升体验:迭代式生成支持 可控性编辑(如遮罩部分重新生成),在内容创作工具中可提供“逐步细化”的交互范式,增强用户满意度;全局一致性改善长文本的连贯性,减少人工后编辑成本。
  • 差异化能力:DDM 在多模态与结构化数据上的天然适配,可帮助平台构建统一生成架构,避免为每种模态维护独立的自回归模型,降低系统复杂度与维护成本。

与现有产品/工作流的接口

  • 模型服务层集成:作为推理引擎插件,DDM 模型可部署在模型花园(如 NVIDIA Triton、Hugging Face TGI)中,暴露与自回归模型类似的文本生成 API,支持贪心解码、温度采样等参数,便于现有应用无缝切换。
  • 数据预处理流水线:需配套 tokenizer 服务(如 Byte-Pair Encoding、VQ 码本),可与现有特征提取管道通过 gRPC/REST 集成,并复用数据增强、batching 等组件。
  • 编排与监控:在 KubeFlow 等工作流引擎中,将扩散生成封装为可配置的步骤(支持调整步数、引导强度等),并监控步数/延迟等系统指标以优化资源分配。

具体落地 Use Case

  1. 电商产品描述批量生成:某全球电商平台需为海量 SKU 生成多语言商品描述,使用 DDM 的并行解码可在 5-8 步内生成 300-500 token 的连贯文本,延迟仅为自回归模型的 1/3,且通过掩码引导可强制包含特定属性词(如颜色、材质),降低人工审核成本。集成方式:将 DDM 服务化后接入现有内容管理系统的 A/B Test 框架,直接替换原有 AR 模型端点。

  2. 在线教育视频的交互式字幕编辑:教育平台允许教师上传课程录像,自动生成字幕,并支持 可控修整(如遮盖口误部分重新生成)。DDM 在该场景下可对字幕 token 序列进行局部 masking 和并行去噪,提供“选中-重写”的即时反馈,提升编辑效率。该功能作为视频处理管道的 微服务,接收选中时间段的 token ID 和上下文,返回修正后的序列,与现有转写服务(如 Whisper)通过消息队列解耦集成。

局限

  • - **缺乏实验验证与性能对比**:本文主要提出一个概念性统一框架,并未引入新的算法或进行标准基准测试。虽然框架将现有方法(如 D3PM、MaskGIT、MDLM)纳入统一视角,但没有通过实验证明该框架能够直接指导模型设计或带来性能提升。对于需要可操作改进的从业者而言,从抽象框架到具体实现仍有较大距离,其实用价值待评估。
  • - **对离散扩散核心挑战的深入解决有限**:框架更多是对已有工作的整合与再诠释,未针对离散扩散模型的关键痛点(如训练不稳定、推理效率低于自回归模型、长序列建模能力等)提出创新性解决方案。与聚焦于改进特定环节(如噪声调度、采样策略、架构设计)的工作相比,本文提供的设计权衡分析和未来方向虽具启发性,但缺乏可落地的技术贡献。
  • - **通用性可能掩盖领域特异性**:将文本、图像、蛋白质序列等不同模态的 tokenization 和离散扩散过程统一处理,虽有助于建立共性认知,但可能忽视各领域独特的拓扑结构和先验知识对模型性能的深刻影响。此外,框架对系统级优化(如 KV-cache、并行解码、蒸馏等)的讨论较简略,未能给出结合工程实现的端到端指导,其系统设计建议可能在实际部署时不够充分。
论文Ye Yuan2026-07-15原文

相关内容