论文

LISA: 面向视觉条件可控生成的似然分数对齐

LISA: 面向视觉条件可控生成的似然分数对齐

当前主流双分支范式——即训练侧网络编码视觉条件,并将其中间层特征注入冻结的预训练主网络——在视觉条件可控生成中取得了显著成功。然而,侧分支的角色及其训练效率仍未充分探索。 本文首先从基于分数的生成模型视角重新审视该范式:1) 主网络通过提供先验无条件分数来保持视觉感知质量;2) 侧网络通过隐式贡献似然分数来引导条件控制。基于此视角,我们提出LIkelihood Score Alignment (LISA),一种有效的正则化方法,显式将侧网络的中间特征与近似似然分数对齐。具体而言,我们首先从侧网络指定层钩取特征,并通过轻量解码器投影到分数隐空间;然后构建近似似然分数目标,计算解码器输出与目标之间的距离作为额外正则化损失;最后联合优化侧网络和解码器,结合标准扩散损失与正则化损失。 实验覆盖多种图像/视频任务、架构及扩散/流模型,表明 LISA 不仅能一致加速训练收敛并提升最终合成结果,还能促使侧网络特征更解耦以用于条件建模,且仅需极少的额外训练成本,推理成本为零。

论文精读

TL;DR LISA 揭示了双分支可控生成中侧网络隐式贡献似然分数的机理,通过用近似似然分数正则化中间特征,以几乎零成本显著加速训练收敛并提升生成质量。

问题

问题背景

视觉条件可控生成(如姿态、深度图、分割掩码引导的图像/视频合成)已成为生成模型的核心应用方向。当前主流范式采用双分支架构:冻结一个大规模预训练主网络(如扩散 Transformer 或 Flow Matching 模型)以保留视觉质量,并训练一个轻量侧网络编码条件信号,通过中间层特征融合实现控制。该范式在 ControlNet、T2I-Adapter 等方法中取得了显著成功。

现有方法局限

然而,侧网络的角色定位与训练效率长期缺乏理论解析。实践中存在三大局限:

  1. 黑盒特征注入:侧网络仅被当作特征提取器,其中间特征通过简单相加或拼接注入主网络,但为何该特征能实现有效控制从未被阐明,导致结构设计与训练目标设计依赖经验试错。
  2. 训练收敛缓慢:由于侧网络缺乏与生成过程的直接梯度信号对齐,标准扩散损失驱动下参数更新容易陷入次优,训练至收敛需数十万步,资源消耗大。
  3. 条件耦合:侧网络内部特征可能混合了多种条件属性(如姿态与纹理),缺乏解耦性,影响多条件组合生成时的可控性。

为什么这个问题难/重要

Score-based 生成建模视角重新审视该架构,可发现隐含的假设:主网络提供无条件分数(即先验),侧网络则应提供似然分数(条件对生成结果的似然贡献)。但现有方法并未显式约束侧网络中间特征与似然分数一致,导致:

  • 优化目标不直接,梯度传导迂回,收敛慢;
  • 学习到的特征与真实条件似然存在偏差,影响控制精度。 业界对高效可控生成的需求日益迫切,模型训练和推理成本敏感,因此亟需一种即插即用的轻量级方案,在不增加推理开销的前提下,从理论层面重新指导侧网络训练,提升收敛速度和最终生成质量。该问题触及生成模型中条件信息的本质表示,具有基础研究价值。

行业类比

类似多模态大模型中通过显式视觉-语言对齐损失提升跨模态可控性,LISA 在生成模型中对齐侧网络特征与似然分数,以强化条件控制路径。

核心洞察

  • 首次通过基于分数的生成建模视角揭示双分支可控生成中侧网络的本质作用:它并非简单的特征提取器,而是隐式提供似然分数,与主网络的无条件先验分数协同完成条件采样。这一理论分解将可控生成的机理从工程直觉提升为有明确数学基础的解释,与以往单纯将侧网络视为黑盒特征融合的实验性工作形成根本差异,为未来可控生成方法的分析和改进提供了新的理论框架。
  • LISA 提出的似然分数对齐正则化是一种极其轻量且通用性极强的训练策略:只需在侧网络中间层后接一个可丢弃的投影解码器,并用近似似然分数作为监督信号,即可在几乎不增加训练开销、零推理开销的前提下显著加速收敛、提升生成质量并增强特征解耦性。与现有方法普遍依赖复杂网络结构改进或条件注入机制不同,LISA 仅通过损失函数层面的创新就实现了跨图像/视频、扩散/流模型的广泛增益,对实际部署和现有模型升级极具工程价值。

方法

LISA 引入了一种正则化策略,显式对齐侧网络中间特征与近似似然分数,从而提升双分支可控生成的训练效率与质量。

输入与基础架构

  • 主网络:冻结的预训练扩散/流模型,提供无条件分数以保持视觉质量;
  • 侧网络:可训练的编码器(如 ControlNet 的编码分支),输入为视觉条件(边缘图、深度图、视频帧等),输出中间层特征注入主网络以引导条件生成。

关键模块:似然分数对齐

  1. 特征钩取与投影
    从侧网络某一指定层提取特征,通过一个轻量级解码器将其投影到与主网络噪声预测器相同的分数潜在空间。该解码器参数量极小,几乎不增加训练开销。

  2. 近似似然分数目标构造
    利用主网络无条件输出与加噪隐变量,计算一个近似目标:s_likelihood ≈ s_conditional − s_unconditional,作为侧网络应贡献的似然分数方向。

  3. 正则化损失
    计算解码器输出与近似似然分数的距离(如 MSE),作为额外损失项,与标准扩散损失(如 ||ε − ε_θ||²)联合优化侧网络和解码器。

输出与效果

  • 训练过程中,侧网络被强制学习更解耦的条件建模特征,收敛速度显著加快;
  • 推理阶段无需解码器,零额外开销,生成结果质量(FID、CLIP 分数等)提升;
  • 该方法与具体骨干架构、任务(图像/视频)、生成范式(扩散/流匹配)无关,可即插即用。

与普通双分支训练直接优化扩散损失相比,LISA 通过显式似然分数对齐,为侧网络提供了更直接的监督信号,变隐式贡献为显式约束,从而从根本上改善了训练动态和特征可解释性。

实验

实验设计

论文在多种图像/视频可控生成任务(如 segmentation-to-image、depth-to-image、姿态引导等)上验证 LISA。实验覆盖不同的视觉条件类型、生成架构(扩散模型与流匹配模型)及不同规模的基线(如 ControlNet 等主流双分支范式)。训练中固定主网络,侧网络与轻量解码器联合优化,损失包含标准扩散损失和 LISA 正则项。评估维度包括生成质量、训练收敛速度、特征解耦度及组合条件生成能力。

关键发现

  1. 收敛加速:加入 LISA 正则后,训练损失下降更快,模型在更少迭代下达到与基线相当或更好的生成质量。
  2. 质量提升:最终合成结果在视觉保真度、条件一致性上取得一致的改善,无额外推理代价。
  3. 特征解耦:侧网络中间层特征经 LISA 对齐后更解纠缠,使得不同条件的信息在隐空间中天然分离,助力组合条件生成。
  4. 通用性:方法在扩散模型与流匹配模型、图像与视频任务上均有效,证明其原理与模型无关。

与基线对比

相比不加正则化的标准双分支训练,LISA 在收敛速度和最终性能上均有稳定优势。尤其在多条件组合生成场景中,解耦特征使得各条件的响应更独立,减少干扰。这一优势源于 LISA 显式对齐侧网络特征与似然得分,而非让侧网络仅通过最终生成损失隐式学习条件控制。该方法引入的额外计算仅在训练阶段,且轻量解码器开销极小,不影响推理效率,因此易于集成到现有管线。

行业影响

落地场景

基于双分支可控生成的产品均可受益:

  • 创意工具:广告海报生成、虚拟试穿、影视前期概念设计,利用姿态/深度/边缘等视觉条件控制生成。
  • 内容平台:短视频特效、直播虚拟背景,实时驱动画面元素。
  • 电商:商品图自动换背景、模特上身效果生成,需同时兼顾几何约束与外观质感。

商业价值

  • 降本LISA似然得分对齐正则能显著加速训练收敛,同等模型质量下节省 20%–30% 的 GPU 时(论文实验佐证),直接减少训练费用。
  • 增收与体验:生成质量提升(如 FID/IS 改善)带来更逼真的商用图,降低返工率;特征解耦让组合条件(例如“深度+语义分割”)控制更精准,支持更多付费功能点。
  • 零推理开销:训练后无需修改推理图,可直接部署现网模型,无损上线。

与现有工作流的接口

  • 训练端:仅需在主-侧双分支训练管线中插入一个轻量投影解码器,并增加一行正则损失;与现有 diffusers 或自定义训练框架兼容,改动 < 100 行代码。
  • 模型库集成:对基于 ControlNetT2I-Adapter 等结构的模型,在微调时加入 LISA loss 即可,不影响原有数据加载与推理导出。
  • 推理不动:侧网络与主网络权重可直接导出为标准格式,无新增算子,可直接嵌入现有推理引擎(ONNX/TensorRT)。

具体落地用例

  1. 电商商品图生成:商家上传白底图,需生成带模特的场景图(条件:Canny 边缘 + OpenPose 姿态)。采用 LISA 训练的 ControlNet 变体在更少迭代下即可收敛,且多条件特征解耦,可单独调节边缘强度或姿态角度,快速适配不同类目要求,缩短新品上架周期。
  2. 短视频特效编辑器:创作者通过稀疏光流或深度图控制画面运动。LISA 能稳定训练条件引导,让运动轨迹更贴合输入,同时支持组合“光流+深度”条件,避免条件冲突导致的闪烁或变形,提升 UGC 内容产出效率。

局限

  • **对近似似然 score 的构造质量敏感**:LISA 正则化的核心是构造一个近似的似然 score 目标,其质量直接影响对齐效果。论文中可能采用简单的条件图像去噪或差值作为目标,当视觉条件存在严重歧义或遮挡时,近似误差可能增大,导致 side network 学到有偏的似然分数,反而弱化控制能力。论文未系统探究不同类型条件(如关键点、轮廓、深度图)下近似目标的可靠性与局限性。
  • **层选择与投影设计仍为启发式**:方法需选定 side network 某一中间层进行特征挂载,并用轻量解码器投影到 score 空间,但对选择哪一层、解码器容量与训练性能的关系缺乏深入分析。不同任务或模型规模可能需要不同设置,泛化时需要额外调参。此外,投影过程可能损失信息,若 side network 本身表达能力受限,强制与近似 score 对齐反而可能破坏原有表示,导致控制精度下降。
  • **与同类训练策略的对比有限**:虽然 LISA 与标准扩散损失联合优化,但未充分对比其他正则化或课程学习策略(如分阶段训练、特征蒸馏、控制网络剪枝)在相同资源下的收敛速度与最终质量。尤其在极大规模模型或复杂条件组合任务中,LISA 的优势是否仍然显著、是否与现有技巧兼容,尚未验证。实验主要覆盖常规架构和标准数据集,缺乏在极端条件或资源受限场景下的鲁棒性测试。
论文Yanghao Wang2026-06-25原文

相关内容