研究提出BadDLM,首次系统揭示扩散语言模型后门风险
首个面向扩散语言模型的通用后门攻击框架,揭示其易被注入与用户请求自适应的恶意内容,威胁开源模型安全。
扩散语言模型(DLM,一种通过逐步去噪生成文本的新范式)存在后门风险。研究提出BadDLM框架,统一建模多种生成式后门目标(如概念植入、对齐绕过),攻击成功率比传统方法高约25%,且隐蔽性强,威胁开源模型供应链。
正文摘录
 新智元报道  扩散语言模型(Diffusion Language Models, DLM)正逐渐成为自回归(Autoregressive, AR)语言模型之外一种新兴的建模范式。 不同于 AR 模型严格从左到右逐词生成,DLM 通过 迭代去噪 对整条序列并行地逐步精修,从而天然支持并行生成、双向上下文建模与更灵活的解码控制。 Gemini Diffusion、SEED Diffusion 以及 LLaDA、Dream 等开源模型的出现,使其受到学界与工业界的广泛关注。 然而,与高期待相伴的是被忽视的安全风险。由于从零训练一个高质量 DLM 成本高昂,使用者通常会下载第三方开源的模型、微调后部署,这正是 后门攻击(Backdoor Attack) 存在的场景。 后门模型在干净输入上表现正常,但一旦输入包含隐藏的 触发器(Trigger) ,便会输出攻击者预设的内容。 由于开源模型被广泛复用,一次被植入后门的发布甚至可能波及大量下游用户,形成 模型供应链风险(Model Supply-chain Risk) 。 真实威胁中的后门究竟想要什么样的输出? 一个容易被忽略、却至关重要的问题是:后门的目标输出不应是「一条固定文本」。 若攻击者只让模型对任意请求都输出同一句固定文本,则该方式在现实中实用性有限:输出高度同质、与上下文语义无关,较易被基于输出一致性的检测手段识别。