DiSCO: 通过分布引导的对比提示优化防御文本到图像生成
随着文本到图像生成模型的进步,安全威胁日益突出,尤其是暴力、色情等不符合工作场所(NSFW)内容的生成,而红队对抗攻击进一步加剧了这一问题。现有防御主要基于白盒假设,依赖文本编码器优化、权重编辑或推理时干预,因此无法扩展至专有模型。基于大语言模型提示重写的黑盒方案虽具有更广的适用性,但在我们识别的“良性对抗问题”上失效——即,提示在语言上看似安全,却因模型学习到的数据分布而触发有害生成。 我们提出 DiSCO,一种零样本、严格黑盒的防御方法,完全在提示层面作为即插即用模块运行,无需重新训练、微调或访问模型内部。DiSCO 通过束搜索执行分布引导的后缀扩展,并利用目标模型自身生成的安全与不安全图像池进行对比评分优化,迭代自适应反馈直至生成安全内容。 在 I2P 基准测试与多种红队攻击下,DiSCO 持续提升未防御及已防御模型的安全性,分别实现了 37.7% 与 25.13% 的攻击成功率(ASR) 下降,同时保持语义保真度并提升图像一致性。作为黑盒、架构无关的模块,DiSCO 可随时应用于任何文本到图像系统,而无需修改模型本身。
论文精读
TL;DR DiSCO 以纯黑盒、零样本方式优化提示后缀,通过对比安全/不安全图像分布引导搜索,无需改模型即可显著降低 NSFW 生成(ASR 降低 25%~37.7%)。
问题
问题背景
文本到图像(T2I)生成模型发展迅速,但存在生成 NSFW 内容的风险,红队攻击可进一步绕过安全过滤。
现有方法局限
- 白盒防御(文本编码器优化、权重编辑、推理时干预)依赖模型内部参数或梯度,无法应用于闭源 API 服务。
- 黑盒 LLM 提示重写 虽可修改输入提示,却面临良性对抗问题:提示语言表面安全(如 “teenager”),但模型训练数据分布使其与有害内容关联,导致重写失效;重写还可能改变原始语义,且无法消除分布层面的隐性关联。
为什么难/重要
- 严格黑盒设定下,防御方只能通过输入输出交互,无法获取梯度或内部表征。
- 需在保持语义忠实的条件下降低攻击成功率(ASR),同时应对未知攻击变体,对生成模型安全部署至关重要。
- 业界对生成式 AI 的内容合规要求日益严格,安全防御必须插件化、架构无关,以适应多样化的模型与服务。
类似推荐系统中在查询侧注入安全约束而不改动排序模型:必须零侵入、保意图、抗对抗。
核心洞察
- DiSCO 识别并命名了“良性对抗问题”:提示词在语言层面安全、但模型因训练分布偏差仍生成有害内容,这是现有 LLM 提示重写防御的盲区。DiSCO 不做语义改写,而是通过分布引导的后缀扩展(beam search 优化)直接调整条件生成分布,利用目标模型自身生成的安全与不安全图像池进行对比评分,使生成偏向安全区域。这一路径区分了基于文本过滤或通用重写的防御,能够处理更隐蔽的对抗样本。
- DiSCO 是严格黑盒、零样本、架构无关的提示级防御模块,仅需目标模型输出的图像作为反馈,不访问模型权重、梯度或内部表征,因此可即插即用地部署到任何文生图系统,包括专有模型。与白盒防御(如文本编码器优化、权重编辑、推理干预)相比,它无需修改模型;与基于 LLM 的提示重写相比,它避免了语义漂移并针对具体模型的数据分布进行自适应优化,通过在模型自身生成的安全/不安全参考池上对比评分,实现更高的 ASR 降低且保持语义保真度。
方法
输入
DiSCO 接收用户原始提示(可能是 benign adversarial prompt),该提示在文本层面安全,但目标 T2I 模型可能生成 NSFW 内容。
关键模块
分布引导的对比参考池构建:利用目标模型自身,针对一组安全提示和一组不安全提示分别生成图像,构建
safe pool和unsafe pool。这些池代表模型输出分布中安全/不安全区域。对比后缀优化:在原始提示后追加后缀,通过 beam search 搜索候选后缀序列。对每个候选后缀,将其生成的图像与参考池进行对比评分,目标同时最大化与安全池的相似度、最小化与不安全池的相似度。
迭代自适应反馈:若当前优化后的提示仍生成不安全图像,则根据反馈调整搜索方向,继续迭代直至产出安全内容。
输出
最终输出为原始提示加上最优后缀的安全提示,可直接输入任意 T2I 模型生成安全图像,无需修改模型权重或架构。
与同类方法的差异点:与基于 LLM 提示重写的黑盒方案不同,DiSCO 利用目标模型自身的图像分布反馈进行对比优化,不依赖外部语言模型判断,能更有效地应对 benign adversarial problem。
实验
实验设计
DiSCO 在 I2P 基准上评估,覆盖多种 red-teaming 攻击。作为黑盒防御,直接接入目标 T2I 模型,通过 beam search 生成候选后缀,利用目标模型自身生成的安全/不安全图像池计算对比得分,迭代优化直到生成安全内容。实验设置包括无防御模型 和 已防御模型 两组,评估 ASR 降低、语义保真度和图像一致性。
关键发现
- 在无防御模型上,DiSCO 实现 37.7% 的 ASR 降低;
- 在已防御模型上,进一步实现 25.13% 的 ASR 降低;
- 同时保持语义保真度并提升图像一致性,证明其在防御与生成质量之间的平衡。
- 消融实验(采样大小、参考池规模、对比评分必要性、beam search 参数)提供了效率-防御权衡的指导。
基线对比解读
相比白盒防御 (文本编码器优化、权重编辑、推理时干预),DiSCO 无需模型内部访问,可即插即用,适用于专有模型。相比基于 LLM prompt rewriting 的现有黑盒方法,DiSCO 解决了良性对抗提示 问题——那些语言上安全但触发有害生成的提示。DiSCO 通过分布引导的对比后缀扩展,将优化目标从单纯语言安全转向视觉输出安全,从而在真实世界部署中更具鲁棒性。
行业影响
落地场景
DiSCO 作为零样本、纯黑盒的 prompt 级防御模块,可直接嵌入任何文本生成图像(T2I)服务。适用场景包括:
- UGC 图片生成平台:用户输入自由文本生成图片,DiSCO 在 prompt 进入模型前自动改写,避免生成 NSFW 内容。
- 企业级创意工具:广告公司、电商商家使用 T2I API 批量生成素材,DiSCO 保证输出符合品牌安全规范。
- 模型托管服务:云厂商提供 T2I API 时,可在网关层集成 DiSCO,作为合规附加组件。
商业价值
- 降本:大幅减少人工审核与内容风控团队的工作量,尤其对海量 UGC 场景,检测成本从每图人工审核降至毫秒级自动改写。
- 风险规避:避免因生成不当内容导致的法律诉讼、平台下架或品牌声誉损失,这是模型提供商和内容平台的主要合规成本。
- 体验提升:DiSCO 保持语义保真和图像连贯性,对正常用户几乎无感,不会因为过度防御而降低创作自由。
与现有产品/工作流的接口
DiSCO 可封装为独立的 无状态 prompt 优化微服务,置于 T2I 模型 API 之前:
- 用户原始 prompt 先经过 DiSCO 模块,进行分布引导的 suffix 扩展与对比评分。
- 优化后的安全 prompt 再送入目标 T2I 模型。
- 可与现有 LLM 重写模块 串联:先由 LLM 做语义安全检查,再对边界案例交给 DiSCO 处理。
- 支持与 内容审核系统 协同工作,当 DiSCO 无法保证安全时,回退到人工审核或拒绝生成。
具体落地 Use Case
- 全球图片分享社区:用户输入“a group of teenagers in a bedroom”可能触发不安全生成。DiSCO 在 prompt 中追加安全语境后缀(如“in a bright, family-friendly setting”),确保生成内容安全且不改变核心语义。
- 电商广告素材生成平台:商家输入“lingerie model”生成产品展示图,DiSCO 自动调整为“elegant lingerie on a mannequin, tasteful studio lighting”,既满足广告投放合规,又保留商品信息。
局限
- 计算开销显著。DiSCO 需要为目标模型构建安全与不安全参考池,并在推理时执行 beam search 迭代生成。参考池构建需多次调用目标模型生成图像,推理阶段每次防御也可能需多轮生成,导致延迟和成本增加,不适合实时应用。论文在 supplementary 中承认计算开销问题,虽然提供了优化(如 confidence-aware pool),但本质仍依赖模型多次前向,对 API 速率限制或成本敏感场景不友好。
- 参考池的分布代表性受限。对比打分依赖于预构建的安全/不安全图像池,其分布可能与实际攻击分布偏差。如果攻击样本与参考池中的不安全图像风格或语义差异较大,对比分数可能无法正确引导后缀优化,导致防御失效。论文在 4.3.2 节分析了池大小影响,但仅用 I2P 基准内的类别,泛化到未知 NSFW 类型仍存疑。
- 对更强的自适应攻击鲁棒性未知。当前评估主要针对固定攻击(如 APT、MMA 等),但攻击者若知晓 DiSCO 的存在,可能设计针对后缀优化的攻击(例如在提示中植入对抗性 token 干扰对比打分)。论文在 supplementary 中讨论了 APT vs. DiSCO 的压力测试,但尚未覆盖白盒指导下的自适应黑盒攻击,实际部署风险仍待验证。