论文

通过速度编辑实现安全少步生成

通过速度编辑实现安全少步生成

Flow matching 近期成为先进文本到图像生成(T2I)的强范式,能以少量采样步生成高质量图像。然而,随着这些模型被集成到实际应用中,确保安全和无敏感内容生成成为关键需求。但将安全性和概念移除方法适配到这一新生成框架仍面临挑战:先前方法大多依赖跨去噪步的迭代轨迹控制或基于 CLIP 的提示嵌入操作,这些设计假设在 flow matching 的 T2I 生成中存在根本瓶颈——有限采样步限制了迭代校正,而现代上下文感知文本编码器降低了嵌入层干预的有效性。 本文提出 VESFlow,一种无需训练的安全方法,专为极少采样步的 flow matching 设计。利用 flow matching 模型学习边际速度的特点,我们通过安全条件后验直接编辑速度场。VESFlow 将轨迹转向安全输出,同时保持提示不变。基于观察到 VESFlow 在良性提示下输出不变,我们进一步引入基于风险分数的过滤,在减少计算开销的同时保留良性提示生成。在此基础上提出 VESFlow+,它不仅在安全方向上编辑速度,还推离不安全方向。 实验表明,在 4 步 MeanFlow 模型上,VESFlow+ 移除目标概念,将 NudeNet 的攻击成功率在 Ring-A-Bell 上降至 6.3%,在 MMA-Diffusion 上降至 6.8%,同时保持良性提示的保真度。

论文精读

TL;DR VESFlow 通过直接编辑流匹配模型的速度场,在极少量采样步下无需训练即可实现安全生成,将攻击成功率压至 6.3%,同时保持良性提示的保真度。

问题

问题背景

基于流匹配 (Flow Matching) 的文本到图像 (T2I) 模型可在极少采样步数下生成高质量图像,正快速进入实际产品管线。然而,面向生产环境的安全内容过滤(如移除裸露、暴力等不当概念)仍缺乏与这种新范式适配的有效方案。

现有方法的局限

传统训练自由的概念移除方法主要分为两类:

  • 迭代轨迹引导类 (如 Safe Latent Diffusion、SafeGen):依赖于多步去噪过程的逐步校正,但流匹配的采样步数通常极少(例如 4 步),导致校正信号累积不足,安全控制失效。
  • 嵌入空间干预类 (如 SLD、Concept Ablation):通过操纵 CLIP 文本嵌入来抑制不安全概念。然而,现代流匹配模型大多采用上下文感知更强的编码器(如 T5),对嵌入层次的扰动不敏感;此外,直接修改提示嵌入会破坏泛化能力,在良性提示下造成严重保真度损失。

技术挑战与重要性

流匹配模型的核心是学习边际速度场 (或 MeanFlow 中的平均速度),而非逐步去噪轨迹。因此安全干预必须从“修改概率流轨迹”转向“编辑速度场”这一更底层、更直接的机制。尤其当采样步数压缩到极限时,任何额外计算开销或对速度场的微小偏离都可能导致生成崩塌。业界亟需一种不依赖特定编码器、不增加推理成本、且对良性提示无副作用的安全方案,从而在图像生成的后端管线中实现低摩擦部署。

行业类比

类似自动驾驶中 4 帧决策的实时控制——在极短时间窗口内,安全介入必须直接修改控制信号(如方向盘转角),而非依赖高延迟的轨迹重规划或语义过滤。

核心洞察

  • - **速度场编辑取代多步轨迹导向**: VESFlow 直接编辑 flow matching 模型学到的 marginal velocity 场,通过安全条件后验的贝叶斯分解引导生成朝向安全区域。这不同于以往依赖大量去噪步长进行迭代轨迹矫正的方法,因为 flow matching 仅需极少步采样,传统迭代校正无法有效发挥。本方法在保持提示词不变的情况下实现安全对齐,填补了少步生成框架下训练免安全干预的空白。
  • - **基于风险评分的按需安全干预**: VESFlow 利用良性提示下速度编辑几乎不影响输出的观察,引入轻量风险评分过滤,仅在检测到不安全概念时触发速度编辑,否则直接跳过。这避免了全量样本的安全编辑计算,既保证无害内容生成质量,又将安全开销降到最低。与一刀切的嵌入修改或全程引导不同,该机制在实用效率与安全之间实现了更精细的权衡。
  • - **双向速度编辑强化概念移除能力**: VESFlow+ 在将速度推向安全方向的同时,主动推离不安全方向,形成双向约束。相比于仅单方向引导,这种双重编辑策略显著提升了移除敏感概念的强度,在 4 步 MeanFlow 上将 NudeNet 攻击成功率降至 6.3%–6.8%,证明了少步 flow matching 模型中更强、更可靠的安全生成可行性。

方法

方法概述

VESFlow 是一套无训练(training-free)的安全生成方法,专为流匹配少步采样(如 4 步)设计。其核心思想是直接编辑流匹配模型的速度场(velocity field),而非修改提示嵌入或依赖多步迭代纠正。

输入与关键模块

  • 输入:文本提示 (p),以及预训练的流匹配 T2I 模型(如 MeanFlow),该模型提供从噪声到图像的速度场 (v_{\theta})。
  • 速度场编辑:利用贝叶斯分解构造安全条件后验,将原始速度场与一个安全引导项融合。具体而言,后验速度由先验速度 (v_{\theta}) 乘以安全似然得到,该似然由独立的安全评分器提供。编辑过程不改变提示嵌入,仅调整速度方向,将生成轨迹推向安全区域。
  • 风险评分过滤:引入一个轻量风险评分器,对提示进行安全性评估。若提示被判定为良性,则完全跳过速度编辑,直接使用原始速度生成,以此降低计算开销并保持安全提示的原生保真度;仅对高风险提示触发编辑。
  • VESFlow+ 变体:在 VESFlow 基础上,编辑项不仅将速度推向安全方向,还额外添加一个推离不安全方向的排斥项。该变体同样基于风险评分选择性启用,以更低的攻击成功率换取轻微计算增加。

输出

经编辑后的速度场替换原始速度,参与少步采样(如 4 步 Euler 或 DPM-Solver)生成图像。在良性提示下输出与原始模型几乎无异;在恶意提示下,生成内容被显著净化。

与同类方法的差异

传统概念移除方法依赖迭代轨迹引导CLIP 嵌入操纵,在流匹配少步场景下面临迭代不足和现代 T5 编码器下嵌入干预失效的瓶颈。VESFlow 专门针对流匹配的边际速度特性,通过一次性的速度场修正实现安全控制,无训练、低计算,且对提示内容完全保留。

实验

实验设计

VESFlow 及 VESFlow+ 在 4-step MeanFlow 模型上进行评估,使用 Ring-A-BellMMA-Diffusion 两个基准数据集测试不安全概念移除能力。评估器选用 NudeNet 计算攻击成功率(ASR),同时监测良性提示下的图像保真度。实验对比了多种训练免费的基线方法,包括基于迭代轨迹引导和 CLIP 嵌入操纵的经典安全方案,以及在 flow matching 场景下的适配版本。

关键发现

VESFlow+ 在极低采样步数下显著抑制了不安全内容生成:Ring-A-Bell 上 ASR 降至 6.3%MMA-Diffusion 上 ASR 降至 6.8%,而保持对良性提示的高质量生成。消融研究证实,风险评分过滤 有效减少了不必要的速度编辑,降低了计算开销,且 Stability Scorer 的鲁棒性对性能影响有限。编码器层面分析表明,现代 T5 编码器相比 CLIP 更抗拒单点嵌入操纵,凸显了速度编辑的必要性。

与基线方法的对比解读

相比依赖大量去噪步进行迭代修正的传统方法,VESFlow 直接作用于 marginal velocity field,无需迭代即可在 少步 flow matching 中实现有效安全引导。这一优势来自对 flow matching 物理特性的深刻利用:速度场天然编码了轨迹方向,因此 Bayesian 后验分解能够精准、低计算开销地重定向生成过程。同时,VESFlow 避免修改文本嵌入,绕过了 T5 等上下文感知编码器对嵌入级干预的屏蔽效应,从根本上解决了 flow matching 时代的安全适应难题。

行业影响

落地场景

  • 内容创作与社交平台:为全球创作者提供 T2I 工具,自动屏蔽裸露或暴力输出,规避平台法律风险。
  • 电商与广告:自动生成商品场景图,确保模特姿态与服饰合规,避免品牌形象受损。
  • 企业级 AI 设计工具:集成至 Canva、Adobe Firefly 等,提供安全默认生成,降低人工审核负担。
  • 游戏与影视资产生成:在角色、场景设计中过滤成人内容,适应全球不同地区分级要求。

商业价值

  • 降本:无需模型重训或人工复审,推理时直接编辑速度场,计算开销可控(配合风险过滤后大部分良性提示直接跳过编辑)。
  • 增收:安全合规使产品打入严格场景(教育、金融),扩大用户群,减少因生成不当内容导致的用户流失与诉讼赔偿。
  • 体验提升:不改动提示词,保留用户意图,避免"误杀"良性内容,维持生成质量与多样性。

与现有产品/工作流的接口

VESFlow 作为可插拔安全模块,嵌入生成器推理管道:

  1. 输入提示词 → 风险评分器(如 NudeNet 或定制分类器)判断风险等级。
  2. 低风险 → 直接原版生成;高风险 → 激活速度场编辑,调整 ODE 轨迹指向安全后验。
  3. 生成后可选加一层后验安全校验,形成多层防御。

仅需在现有 PyTorch 或 ONNX 推理代码中调用编辑函数,不修改模型权重,无额外依赖,特别适合部署于少步流匹配模型(如 MeanFlow)的云服务或边缘节点。

具体落地 Use Case

  1. 全球图像素材平台:如 Shutterstock 的 AI 生成功能,用 VESFlow 确保订阅者生成图像不含裸露,保持内容合规,同时维持高质量输出。
  2. 医疗影像教学资料生成:自动生成解剖图解时,通过概念移除精确保留医学信息,过滤不必要的露骨元素,保障教育材料专业性与伦理合规。

局限

  • **泛化受限于 Flow Matching 变体与评分器**:VESFlow 在 MeanFlow 模型上验证,其核心速度编辑依赖模型提供的边际速度估计。不同 flow matching 变体(如 Rectified Flow、Consistency Models)的速度场结构及可用性差异可能影响方法直接迁移。同时,风险评分基于外部安全评分器(如 **NudeNet**),评分器的检测盲区或过敏感会直接导致安全编辑失效或过度抑制良性内容,该耦合增加了工程落地的不确定性。
  • **极少步数下的语义保真权衡**:方法在 4 步采样下工作,速度编辑仅沿安全方向推进,但未显式约束与原始提示的语义一致性。在高度抽象或组合概念移除时,有限的编辑步数可能无法精细解耦安全属性与目标语义,造成**语义漂移**或细节丢失。论文实验主要关注攻击成功率降低,对良性提示的细节保留评估仅沿用通用指标(如 CLIP score),未深入分析复杂场景下的概念混淆。
  • **与训练式方法的深度比较欠缺**:VESFlow 属于训练免费后处理,对比基线多为基于提示嵌入操纵的方法。但近期一些工作(如 **ESD**、**SPM**)可通过微调模型权重永久移除概念,在多次生成中更鲁棒。论文未与这类训练式概念移除方法在 flow matching 框架下进行对比,无法判断在相同计算预算下(一次性训练 vs 每次推理编辑)的长期效率与效果优劣。
论文Yujin Choi2026-06-22原文

相关内容