论文

Sumi: 从头训练的开放统一扩散语言模型

Sumi: 从头训练的开放统一扩散语言模型

扩散模型已成为自回归模型的有前景替代方案。其中,统一扩散语言模型(UDLM) 允许任意 token 在任意步骤更新,原则上可实现更灵活的生成。然而,目前尚无从零开始在大参数规模和大 token 预算下预训练的 UDLM。自回归模型和掩码扩散模型已有大规模可用模型,但 UDLM 仍属空白。 为此,我们提出 Sumi(日语“墨水”),一个完全开放的 7B 参数 UDLM,从零开始在 1.5T tokens 上预训练。Sumi 在知识、推理和编程基准上表现与同等 token 预算的自回归模型具有竞争力,但在常识基准上表现不足,这可能与我们的教育重点数据混合有关。 我们公开了模型权重、检查点和完整训练方案,包括公开语料库数据混合的完整规范。希望这能促进社区对大规模原生统一扩散的研究。

论文精读

TL;DR Sumi 是一个从头预训练的 7B 统一扩散语言模型,在 1.5T tokens 上训练,性能可比自回归模型,并完全开源模型、检查点和训练配方,为研究统一扩散的扩展行为提供首个参考点。

问题

问题背景

生成式语言模型长期由 自回归 (Autoregressive, AR) 范式主导,但其从左至右的顺序生成限制了推理效率与灵活控制。扩散语言模型 (Diffusion Language Models) 作为替代方案,通过迭代去噪实现并行或半并行生成,在效率与可控性方面展现出潜力。当前,掩码扩散 (Masked Diffusion, MDLM) 已有千亿级参数的大规模预训练实践(如 LLaDA),但统一扩散 (Uniform Diffusion, UDLM) 在同等规模下仍是空白。

现有方法局限

MDLM 的生成过程类似填空:随机掩码部分 token,模型一次性预测被掩码部分,且一旦预测即固定,无法修订。这导致两个核心限制:

  • 缺乏迭代修正能力:早期预测错误无法在后续步骤纠正,对需要精准推理或事实一致性的任务不利。
  • 生成画布僵化:生成顺序由固定的掩码调度决定,不提供对生成顺序或局部修改的灵活控制。

UDLM 天然允许在任何扩散步更新任意 token,理论上支持自校正与更丰富的生成策略,但此前无一从零预训练的大参数量 UDLM:小规模学术实验无法表征扩散语言模型在真实扩展下的行为,例如收敛特性、损失变化、与 AR 模型在不同知识/推理基准上的对比。缺乏开源权重与训练配方,社区无法将 UDLM 作为可复现的基线,严重阻碍了对这一路径的系统性研究。

为什么这个问题难且重要

难题在于:

  • 训练稳定性:UDLM 的损失直接作用于高维离散状态,噪声调度、损失加权、采样策略均无成熟方案。
  • 计算资源与数据:大规模预训练需要 1.5T+ tokens 且需确保数据混合(data mixture)不与目标能力脱节,否则可能像本文的 Sumi 那样在常识推理上表现不佳(教育类数据过多导致偏斜)。
  • 缺乏先验:无参考点意味着必须从头探索最优超参组合。

重要性体现在:若 UDLM 能在知识、推理任务上与 AR 模型竞争,则它为下一代大模型架构提供了一条高效、可控且透明的技术路线。对于需要自我修正、条件生成、多轮交互的下游任务,UDLM 的内生重绘机制可能显著降低工程复杂度。开放模型将催化关于扩散生成动态、置信度采样、并行解码质量等关键问题的研究,加速社区理解扩散语言模型的本质优劣。

行业类比

这类似于图像生成领域从 GAN 转向 扩散模型 带来的可控性与多样性飞跃——语言生成也可能通过同样的范式升级,获得更自然的“试错-修正”式文本创作能力。

核心洞察

  • Sumi 作为首个从零预训练至 7B 参数的 uniform diffusion language model (UDLM),填补了大规模扩散语言模型的空白。与 autoregressive 和 masked diffusion 模型不同,UDLM 允许在任何去噪步骤更新任意 token,理论上支持更灵活的生成与自我纠错。这一干净参考点使得研究社区可以系统评估 UDLM 的 scaling 行为、生成动态与可控性,探索其相对于成熟范式的独特权衡。
  • Sumi 在 knowledge/reasoning/coding 上追平同预算自回归模型,却在 commonsense 基准上显著落后,推测是其 education-heavy 数据混合所致。这揭示了一个关键工程问题:UDLM 训练数据策展需区别于自回归模型,因为生成机制差异(例如迭代精炼而非单向生成)可能改变了模型对常识知识的吸收效率。该观察为未来调整数据配比和生成策略提供了方向。

方法

输入与扩散过程

Sumi 接收文本序列作为输入,训练时采用均匀掩码扩散 (uniform diffusion):在每一步 t 随机掩码序列中任意位置的 token,并逐步增加噪声直到序列完全随机;推理时则从纯噪声序列出发,通过迭代去噪重建文本。与 MDLM 不同,UDLM 允许任意 token 在任意步骤被更新 (而非仅填充固定掩码位置),这使模型天然具备自修正能力——后续步骤可修改早期生成的 token。

模型架构与训练

Sumi 基于标准 Transformer 架构 (7B 参数),从头预训练在 1.5T tokens 的公开语料上,数据混合侧重教育类文本 (education-heavy)。训练目标是让模型预测原始未被掩码的 token (即 uniform diffusion loss),覆盖所有位置而非仅掩码位置,这迫使模型学习全局一致性。全流程公开了模型权重、检查点及完整的训练配方 (包括数据混合规格),方便社区复现。

生成与解码

推理时采用迭代并行解码:每步模型对所有 token 位置计算置信度,通过置信度采样 (confidence sampling) 选择待更新位置,重新生成该位置的 token,其余 token 保持不变。这种机制可在固定修订预算下逐步提升生成质量,并能灵活控制生成步数。实验表明,并行解码不影响最终生成质量,且模型能主动修正自身产生的错误 token。

与同类方法的差异

与 LLaDA 等掩码扩散模型 (MDLM) 相比,Sumi 的均匀扩散解除了“已生成 token 不可修改”的限制,生成过程更灵活;与自回归模型 (AR) 相比,Sumi 支持非顺序、并行生成,在需要全局协调或后编辑的场景中具有潜在优势。

实验

实验设计

  • 在预训练后,使用标准 zero-shot / few-shot 评估协议,在涵盖知识(如 MMLU)、推理(如 ARC)、常识(如 HellaSwag)、编程(如 HumanEval)的基准上测试 Sumi-7B。
  • 对比基线包括相同 token 预算下训练的自回归模型(如 OLMo-7B),以及同规模掩码扩散模型(MDLM),以系统对比不同生成范式的差异。
  • 评估关注模型在标准准确率指标上的表现,并分析了置信度采样并行解码等扩散特有机制对生成质量的影响。

关键发现

  • 知识、推理、编程任务:Sumi-7B 达到与自回归基线相当的水平,证明均匀扩散语言模型在大规模预训练后也能有效吸收世界知识和逻辑推理能力。
  • 常识任务:性能明显落后于自回归模型,推测原因是训练数据混合中教育类文本比例偏高,缺乏足够的日常场景覆盖。
  • 生成动态:通过可控实验发现,不同任务对“可修改画布”(即允许 token 被修订的步数)的需求不同,代码生成需要更多修订步数,而知识问答可能更早固定答案。
  • 置信度采样:实验表明,高置信度 token 倾向于在生成早期就被确定,后续迭代主要修正低置信度 token,这为推理加速提供了方向。

与基线对比的深度解读

  • 在知识推理上的竞争力证明均匀扩散不再只是“玩具模型”,其非自回归生成范式在模型容量和数据量足够时可以弥补差距。
  • 常识任务的不足揭示了数据配方对扩散模型的敏感性尤甚于自回归模型,未来需要更均衡的数据混合策略。
  • 与掩码扩散相比,均匀扩散允许 token 反复修订,在需要多步推理或纠错的场景(如代码调试)可能更具潜力,但当前实际增益尚未充分体现,是值得探索的方向。

行业影响

落地场景

Sumi 作为首个大规模均匀扩散语言模型 (UDLM),其“任意步骤更新任意 token”的特性天然适合需要多轮迭代生成与自纠正的产品。典型应用包括:

  • 交互式内容创作:写作辅助工具可逐步从噪声中生成文章,用户能在任何时刻打断并修改中间 token,实现真正的实时协同创作。
  • 代码生成与调试:生成代码时可对特定行或符号进行后续修订,而不需重生成整个序列,降低推理成本,提升修复效率。
  • 电商与广告:商品描述生成中,先快速产出一个整体框架,再根据属性(价格、规格)局部优化,实现精细可控的生成。
  • 对话系统:在需多轮意图理解与修正的客服场景,模型能在不同轮次更新先前回复的特定部分,提升交互连贯性。

商业价值

  • 降本:扩散模型支持并行解码,在长文本生成中可减少串行推理延迟,降低服务侧 GPU 占用时间。同时,自纠正能力减少重新生成请求,节省 API 调用次数。
  • 增收:更高的生成质量和可控性可嵌入付费创意工具,如图文排版、广告文案自动优化服务,形成差异化功能卖点。
  • 体验提升:用户可以像编辑文档一样与模型交互,看到文本从模糊到清晰的过程,提升对生成结果的信任度和满意度。

与现有产品/工作流的接口

  • 部署方式Sumi 遵循标准 Transformer 架构,可使用 vLLMHuggingFace TGI 等已有推理框架加载,7B 参数也适合消费级显卡(如 L4/T4)部署。
  • 生成流程集成:扩散模型的采样过程可封装为迭代式 API,与现有自回归模型的“单次请求-响应”接口并存。开发者可通过 temperature 与置信度阈值控制质量-速度权衡。
  • 数据处理适配:该模型对教育类数据偏重,在知识密集型任务中更优,可直接插入现有 RAG 管线中作为答案生成器。

具体落地用例

  1. 在线教育平台的自动题库生成:基于课程大纲,先扩散生成题目框架,再迭代完善具体选项和解析,老师可中途调整知识点分布,避免重复生成全量内容。
  2. 全球电商平台的多语言商品详情优化:使用 Sumi 同时生成多种语言的描述,并在发布前对敏感属性(如价格、成分)进行局部修正,无需重新调用完整生成接口,确保合规与准确。

局限

  • **常识推理基准表现不佳**:论文指出 Sumi 在常识推理基准(如 HellaSwag 等)上弱于同等 token 预算的**自回归模型**(AR),作者推测其主要原因是训练数据中**教育类内容占比过高**,导致模型对日常常识的建模不足。这限制了 Sumi 在需要广泛世界知识的任务上的实用性,并提示数据配比对于扩散语言模型的关键影响。
  • **生成策略的亚线性与任务依赖性**:第 4 节讨论表明,**并行解码**(parallel decoding)带来的质量增益有限,且最优**生成画布长度**(usable canvas)高度依赖任务类型。**置信度采样**(confidence sampling)引入了隐式的 token 固化顺序,可能削弱统一扩散的灵活性。这些现象说明当前采样算法尚未完全释放 UDLM 的理论优势,需要进一步优化。
  • **与自回归模型的系统性差距**:尽管在知识、推理和代码基准上取得竞争性成绩,Sumi 仍未能全面超越同规模 AR 模型,尤其在需要长程连贯性的生成任务上(如长文本故事生成)尚未评估。此外,**扩散模型**的迭代去噪过程在推理时计算开销较高,虽然可通过减少步数权衡,但会损失质量,这可能会影响实时应用的部署。
论文Mengyu Ye2026-06-17原文

相关内容