改进版大规模语言扩散模型
现代大规模语言模型主要采用自回归分解和因果注意力进行训练。我们提出了 iLLaDA,一个拥有完全双向注意力的 8B 参数掩码扩散语言模型,从头开始训练。 方法:iLLaDA 在整个预训练和监督微调(SFT)阶段均保持掩码扩散目标,预训练数据量达 12T tokens,并在 25B tokens 的指令语料库上微调 12 个epoch。此外,采用变长生成以提高效率,并引入基于置信度的评分用于多选评估。 结果:与 LLaDA 相比,iLLaDA 在通用、数学和代码基准上均有全面提升。例如,iLLaDA-Base 在 BBH 上提升 21.6 分,在 ARC-Challenge 上提升 14.9 分;iLLaDA-Instruct 在 MATH 上提升 14.5 分,在 HumanEval 上提升 16.5 分。尽管是非自回归训练,iLLaDA 在多个基准上与 Qwen2.5 7B 保持竞争力。 结论:这些结果表明,从头开始的完全双向扩散训练是通往强语言模型的一条具有竞争力的路径。
论文精读
TL;DR iLLaDA 是 8B 全双向 masked diffusion 语言模型,从头训练,在 BBH、ARC、MATH、HumanEval 等基准上显著优于自回归基线,证明双向扩散可成为 LLM 训练的可行范式。
问题
问题背景
当前,大语言模型(LLM)几乎完全由自回归分解与因果注意力主导,这种单向生成范式虽然在许多任务上表现优异,但其固有的顺序依赖性在逆向推理、双向理解与全局规划等场景中效率受限。扩散语言模型,尤其是采用掩码扩散(masked diffusion)与全双向注意力的架构,作为一种非自回归生成路径正受到越来越多的关注。
现有方法局限
传统的自回归模型(如 GPT 系列)通过因果注意力强制从左到右的生成顺序,导致:
- 无法同时利用双向上下文,在需要回看或全局一致性的任务(如数学证明、代码补全中间的缺失部分)上计算浪费严重;
- 长序列规划能力弱,因为每一步只能基于已生成的片段,缺乏对未来的整体建模。 早期扩散语言模型(如 LLaDA)虽然证明了从零开始的全双向训练是可行的,但受限于预训练规模(约 2.3T tokens)和监督微调深度,其性能明显落后于同等参数量的自回归模型,尤其在高难度推理基准(如 BBH、ARC-Challenge)上存在巨大差距,且推理效率低下。
为什么这个问题难/重要
扩散模型要真正挑战自回归范式,必须解决三个核心挑战:
- 规模化训练:如何在不破坏双向注意力的前提下,高效扩展到 10T 级别 tokens?
- 生成质量与速度:掩码扩散的迭代去噪过程比自回归逐 token 生成更慢,如何平衡?
- 评测适配:自回归的困惑度指标不适用,需要新的打分机制。 解决这些问题意味着语言智能可能脱离自回归依赖,打开一条全新且可能更优的架构路径,对下一代 LLM 的设计具有根本性影响。业界对非自回归方法的关注度持续上升,因其可能更自然地统一理解和生成任务。
行业类比
类似于文本到图像生成领域从 GAN 彻底转向扩散模型,语言扩散模型若证明在规模定律下能匹敌甚至超越自回归模型,将可能引发文本基础模型架构的代际更替。
核心洞察
- 全流程保持 masked diffusion 目标的一致性,证明了非自回归训练同样能锻造出强指令跟随与推理能力。与多数工作仅在预训练阶段使用扩散、微调或推理时切换为自回归范式不同,iLLaDA 在预训练和 SFT 中均使用完全双向注意力的扩散损失,避免了目标不匹配造成的性能折损。这种端到端的统一让模型在数学推理(MATH)和代码生成(HumanEval)等需要非因果推理的任务上大幅超越此前扩散模型,并逼近同规模自回归基座,揭示扩散训练范式的潜力在于一致性,而非仅作为预训练替代。
- 变长生成与置信度评分等工程创新,弥合了扩散模型从研究原型到实用基准的关键鸿沟。扩散语言模型长期受限于固定长度生成带来的冗余算力和多项选择评测的不便。iLLaDA 的可变长度生成(variable-length generation)大幅提升推理效率,而置信度评分(confidence-based scoring)使扩散模型能直接参与如 ARC-Challenge 等基准的定量对比,无需自回归辅助。这些设计并非核心理论的改进,却直接推动了 iLLaDA 在 BBH 等复杂基准上相对 LLaDA 提升超 20 个点,证明算法工程化能显著释放模型架构的原有上限。
方法
iLLaDA 是一个 8B 参数的 掩码扩散语言模型 (masked diffusion LM),从头预训练并使用 全双向注意力。
训练流程
- 输入与掩码:给定原始文本序列,按一定比例随机替换为
[MASK]令牌,形成噪声版本。 - 双向建模:模型以被掩码的序列作为输入,通过 全双向 Transformer 编码所有未掩码令牌的上下文,预测每个被掩码位置的真实令牌。该过程不使用因果掩码,每个位置都能感知完整上下文。
- 扩散目标:训练采用 离散掩码扩散目标,逐步去噪——前向过程依概率掩码令牌,反向过程学习还原被掩码内容。这一目标在预训练(12T tokens)和监督微调 SFT(25B token 指令数据,12 epochs)阶段保持一致,避免训练-推理不匹配。
推理生成
- 可变长度生成:从全掩码序列出发,逐步替换部分
[MASK]为预测令牌,生成过程可动态控制步数,平衡质量与速度。 - 置信度评分:对于多选题等场景,不依赖完整自回归解码,而是利用每个选项下模型对掩码位置的预测置信度直接评分,高效完成评估。
与同类方法的差异
与主流的 自回归模型(如 GPT 系列) 不同,iLLaDA 完全抛弃了因果注意力,通过从空白开始的迭代去噪生成文本,证明了非自回归的全双向扩散训练可以端到端产出强竞争力的大语言模型,尤其在数理与代码任务中表现突出。
实验
实验设计
iLLaDA 是一个 8B 参数的 masked diffusion 语言模型,完全使用双向注意力从零开始训练。预训练阶段保持纯粹的 masked diffusion 目标,在 12T tokens 上进行;监督微调(SFT)使用 25B tokens 指令语料训练 12 个 epoch。推理时引入 可变长度生成以提升效率,并针对多项选择评估设计了 基于置信度的评分。
关键发现
- iLLaDA-Base 相比 LLaDA 在 BBH 上大幅提升 21.6 分,在 ARC-Challenge 上提升 14.9 分。
- iLLaDA-Instruct 在 MATH 上提升 14.5 分,在 HumanEval 上提升 16.5 分。
- 尽管采用非自回归训练范式,iLLaDA 在多个基准上与 Qwen2.5 7B 保持竞争力,甚至在某些指标上可比肩。
对比解读
iLLaDA 彻底抛弃了主流的自回归分解与因果注意力,证明全双向扩散训练从零开始能够构建强语言模型。与 LLaDA 的对比直接展示了缩放预训练和数据规模带来的显著收益,特别是在数学与代码等需要双向推理的任务上。与 Qwen2.5 7B 的对比则打破了“语言智能必须依赖自回归”的固有观念,为扩散语言模型的实际应用提供了有力证据。
行业影响
落地场景
iLLaDA 作为双向注意力扩散语言模型,其核心优势在于天然支持非因果的上下文理解与并行解码。在需要全局语义推理的任务中展现独特价值:
- 代码智能:双向注意力允许模型同时考虑前后文,对代码补全、bug 修复、跨文件重构等场景更友好,可集成至 IDE 插件或代码审查工具。
- 数学与科学推理:在 MATH、BBH 等基准上的大幅提升表明,iLLaDA 适用于教育科技产品中的自动解题、分步讲解生成。
- 长文档处理:合同审查、学术论文摘要、医疗报告分析等需统揽全文的任务,可从双向建模中获益。
- 多轮对话与指令跟随:经过 SFT 的 iLLaDA-Instruct 在 HumanEval 等测试中表现突出,适合构建客服机器人、企业知识库问答等应用。
商业价值
- 推理加速与成本优化:iLLaDA 的
variable-length generation可通过一次性预测多个 token 实现生成加速,降低单次推理的 GPU 消耗,直接减少 API 服务成本或边缘部署的延迟。 - 体验升级:在需要强逻辑一致性的场景(如数学辅导、法律文书生成),双向模型可能产生更精确的输出,减少人工复核成本,提升用户信任。
- 差异化竞争:作为非自回归路线,iLLaDA 避开同质化的 GPT 系生态,为云厂商或企业自研模型提供技术多样性,可能成为垂直领域高性价比的基座。
与现有产品/工作流的接口
iLLaDA 的接口兼容性取决于其输入输出格式。由于仍采用文本序列形式,可通过标准 REST API 或 gRPC 服务与现有 LLMOps 栈集成,替换或并列于自回归模型。具体方式:
- 模型服务层:将 iLLaDA 注册为 Hugging Face TGI / vLLM 的自定义模型后端(需适配扩散采样逻辑),复用现有负载均衡与缓存策略。
- Prompt 工程:由于训练范式不同,需重新设计 System Prompt 与 Few-shot 示例格式,建议通过 A/B 测试平台对比效果。
- 任务分流:在推理密集型业务(如代码分析、数学解答)中调用 iLLaDA,而在简单闲聊或续写场景保留轻量自回归模型,降低总体成本。
具体落地 Use Case
用例一:电商平台智能客服 用户咨询复杂退换货政策时,iLLaDA 可一次性读完所有政策条款,生成精确回答,减少因自回归模型的“左到右”遗忘造成的规则遗漏。并行解码还能在高并发场景下降低 p99 延迟,改善用户体验。
用例二:金融投研报告自动生成 分析师上传多份财报、新闻后,iLLaDA 利用双向注意力快速抽取矛盾点或关键趋势,生成结构化摘要。相比逐 token 生成的传统模型,其全局建模能力有助于发现跨段落隐含关联,提升报告质量与生成效率。
局限
- **推理效率与生成速度**:作为非自回归模型,iLLaDA 在生成时需通过迭代去噪过程(即使采用了可变长度生成策略),其推理延迟和计算开销仍可能高于同等规模的自回归模型。论文未提供与自回归基线在推理吞吐量或延迟上的系统对比,这在工程部署中是一个关键考量。扩散模型的多步解码特性可能限制其在低延迟场景(如实时对话)中的直接应用。
- **规模扩展与模型上限**:虽然 8B 参数的 iLLaDA 已能接近 Qwen2.5 7B 等成熟自回归模型,但其性能尚未超越更大规模的模型(如70B级别),且对于扩散语言模型在更大规模数据与参数下的扩展行为缺乏讨论。此外,在需要长程连贯性、多轮指令遵循等复杂场景下的表现评估不够充分,其生成质量是否具备与自回归模型同等的文本平滑度和逻辑一致性仍需进一步验证。