行业新闻

研究提出BadDLM,首次系统揭示扩散语言模型后门风险

研究提出BadDLM,首次系统揭示扩散语言模型后门风险

首个面向扩散语言模型的通用后门攻击框架,揭示其易被注入与用户请求自适应的恶意内容,威胁开源模型安全。

扩散语言模型(DLM,一种通过逐步去噪生成文本的新范式)存在后门风险。研究提出BadDLM框架,统一建模多种生成式后门目标(如概念植入、对齐绕过),攻击成功率比传统方法高约25%,且隐蔽性强,威胁开源模型供应链。

正文摘录

![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimga67512e33f.png) 新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg3b253ef414-131.png) 扩散语言模型(Diffusion Language Models, DLM)正逐渐成为自回归(Autoregressive, AR)语言模型之外一种新兴的建模范式。 不同于 AR 模型严格从左到右逐词生成,DLM 通过 迭代去噪 对整条序列并行地逐步精修,从而天然支持并行生成、双向上下文建模与更灵活的解码控制。 Gemini Diffusion、SEED Diffusion 以及 LLaDA、Dream 等开源模型的出现,使其受到学界与工业界的广泛关注。 然而,与高期待相伴的是被忽视的安全风险。由于从零训练一个高质量 DLM 成本高昂,使用者通常会下载第三方开源的模型、微调后部署,这正是 后门攻击(Backdoor Attack) 存在的场景。 后门模型在干净输入上表现正常,但一旦输入包含隐藏的 触发器(Trigger) ,便会输出攻击者预设的内容。 由于开源模型被广泛复用,一次被植入后门的发布甚至可能波及大量下游用户,形成 模型供应链风险(Model Supply-chain Risk) 。 真实威胁中的后门究竟想要什么样的输出? 一个容易被忽略、却至关重要的问题是:后门的目标输出不应是「一条固定文本」。 若攻击者只让模型对任意请求都输出同一句固定文本,则该方式在现实中实用性有限:输出高度同质、与上下文语义无关,较易被基于输出一致性的检测手段识别。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-07-16原文

相关内容