用于统一且数据高效的图像到图像翻译的解耦残差去噪扩散模型
本文提出解耦残差去噪扩散模型(DRDD),旨在实现统一且数据高效的图像到图像(I2I)翻译。虽然扩散模型在质量和多样性上推动了I2I翻译的进步,但我们发现了一个之前未被充分探索的性质:注入高斯噪声不仅起到传统的高维流形提升作用,还能通过隐式对齐不同域的特征分布促进域协调,这对统一I2I翻译尤其有利。然而,现有扩散模型在单个耦合扩散过程中同时去除噪声和残差,过早地削弱了这种协调效应。 为解决该问题,DRDD将扩散过程解耦为两个顺序且独立的阶段:1)随机噪声扩散,用于域协调和流形提升;2)确定性残差扩散,在固定噪声域中学习核心语义映射。这种解耦使得协调和流形提升效应在整个变换过程中得以保持,显著简化了跨不同任务和域的统一映射学习。值得注意的是,噪声扩散阶段仅使用丰富的、无配对的目标域图像进行训练,大幅提升了数据效率。 全面的理论和实证分析表明,DRDD与主流扩散模型广泛兼容,即使在有限配对数据下也能持续提供鲁棒且统一的I2I翻译。代码已开源:https://github.com/HKU-HealthAI/DRDD。
论文精读
TL;DR DRDD 将扩散过程解耦为噪声扩散(域协调)与残差扩散(语义映射),用极少量配对数据实现统一且鲁棒的图像到图像翻译。
问题
问题背景
图像到图像翻译(I2I)的目标是将源域图像转换为目标域风格,同时保留内容结构。当前研究重心正从单任务专用模型转向统一 I2I 翻译——用一个模型处理多种退化(去雨、去噪、超分等)或不同视觉域,从而降低部署成本并提升泛化能力。
现有方法局限
主流方案依赖扩散模型,但其训练与采样过程存在关键盲区:
- 噪声的域协调作用被过早削弱。高斯噪声不仅将数据推离低维流形(流形提升),还能隐式对齐不同域的特征分布,这对统一 I2I 尤其重要。然而,现有扩散过程将噪声注入与语义映射耦合在一个逆向步骤中,噪声去除后域协调效应迅速衰减,导致模型难以学到跨域的通用映射。
- 配对数据依赖强且利用率低。所有任务共享同一耦合流程,当配对样本有限时,模型需要同时学习域对齐与语义转换,极易过拟合或泛化崩塌。
为什么这个问题难/重要
- 技术挑战:解耦噪声的域协调角色与语义映射角色,需要在扩散框架中设计独立控制机制,同时保证训练稳定和采样质量。噪声水平的选择、不同阶段训练目标的协调是理论难点。
- 工程价值:I2I 应用(如自动驾驶感知、医学影像增强、创意生成)通常面临多变的降质类型和数据稀缺。一个既统一又数据高效的模型能显著减少训练和微调成本,推动行业从“一任务一模型”转向“单一基础模型应对多样需求”。
行业类比
类似大语言模型中通过 预训练-微调 解耦通用知识与任务特异性,这里通过解耦噪声扩散与残差扩散,让模型先学习域无关的协调表示,再学习具体语义映射,从而大幅提升统一 I2I 的数据效率和鲁棒性。
核心洞察
- **噪声注入的领域协调作用被忽视** 传统扩散模型将噪声视为流形提升手段,但作者发现噪声注入还能隐式对齐不同域的分布,实现域协调。然而现有模型将噪声与残差耦合移除,过早削弱这一效应。DRDD 将扩散解耦为独立的噪声扩散(域协调与流形提升)和残差扩散(语义映射),全程保留协调效果,大幅简化统一映射的学习。该发现为扩散模型在多域 I2I 翻译中的设计提供了新视角。
- **利用未配对数据训练噪声扩散阶段,实现高数据效率** 现有统一 I2I 方法依赖大量配对数据,DRDD 的噪声扩散阶段仅需目标域未配对图像即可训练,残差扩散阶段才利用少量配对数据学习语义映射。这种分而治之的策略极大降低了对配对数据的依赖,在仅 10% 配对数据时仍保持高保真翻译,解决了实际场景中配对数据稀缺的瓶颈,且该框架可直接融入主流扩散范式如 DDPM、DDIM 等。
方法
输入与总览
DRDD 接受源域图像,输出目标域图像,框架解耦为两个顺序扩散阶段:随机噪声扩散 和 确定性残差扩散。两个阶段独立训练,共享同一扩散时间轴但承担不同角色,最终在保持域协调的同时精准完成语义映射。
阶段一:随机噪声扩散(域协调与流形提升)
- 输入:源图像 ( x_0^{src} )。
- 过程:逐步注入各向同性高斯噪声,直到达到一个固定的中间噪声级 ( t_{\text{mid}} )。该过程仅使用大量未配对目标域图像训练一个标准去噪扩散模型,使其学会目标域的含噪数据分布。
- 关键作用:噪声将不同域的图像投射到同一个高维且重叠的分布(域协调),同时将低维流形上的数据“抬起”(流形提升),为后续残差学习消除域偏置。
阶段二:确定性残差扩散(语义映射)
- 输入:从阶段一得到的中间含噪状态 ( x_{t_{\text{mid}}} ),以及源图像作为条件。
- 过程:在固定噪声域内执行确定性扩散,逐步预测并去除“残差”(即目标与当前状态的差异),而非噪声。残差预测网络接收 ( x_{t_{\text{mid}}} )、时间步 ( t ) 和源图像,输出残差估计。训练时直接从配对数据计算目标残差作为监督信号。
- 关键作用:由于噪声域已被固定,模型只需关注跨域语义映射,极大简化学习难度。该阶段可适配多种扩散骨干(如 DDPM、DDIM)。
训练与推理
- 训练:阶段一在未配对目标域图像上优化标准去噪目标 ( ||\epsilon - \epsilon_\theta(x_t, t)||^2 );阶段二在配对数据上优化残差预测目标,无需平衡不同损失项。
- 推理:先运行阶段一至 ( t_{\text{mid}} ),再切换到阶段二逐步去残差,生成目标图像。噪声注入水平 ( t_{\text{mid}} ) 由双 MMD 距离自动选取,平衡域协调与信息保留。
与同类方法的差异:现有条件扩散模型(如 Palette、BBDM)在一个耦合过程中同时去除噪声和跨域差异,导致域协调效应过早被破坏;DRDD 通过解耦将噪声作为“域归一化器”固化,残留映射仅在协调后的空间中学习,大幅提升统一 I2I 任务的性能和数据效率,且能兼容未配对数据训练。
实验
实验设计
实验覆盖三类典型 I2I 场景:统一多任务恢复(All-in-One-3/5 基准)、单任务多域翻译(如多种天气去除、低光增强)以及单任务单域翻译(图像修复、超分辨率、去雨、去噪等)。重点考察 DRDD 与主流扩散基线的兼容性,以及在 有限配对数据 下的数据效率。噪声扩散阶段仅使用非配对目标域图像训练,残差扩散阶段学习配对语义映射,通过解耦前向与反向过程验证域协调与流形提升的保留效果。
关键发现
- 解耦噪声扩散 能长期维持域协调特性,避免传统耦合扩散中过早消除噪声导致的分布对齐退化。
- 在配对数据稀缺时,DRDD 仍保持稳定翻译质量,数据效率显著优于 需大量配对样本的基线(如 Palette、BBDM)。
- 该方法可无缝嵌入不同扩散范式(DDPM、SDE),在 All-in-One-3/5 上以统一模型处理多个异构降质任务,PSNR 和 LPIPS 均取得竞争力结果。
- 残差扩散阶段专注于纯语义映射,噪声注入水平通过 双 MMD 度量 自动选取,无需额外调参。
与基线对比解读
相较于 耦合扩散模型(如 SR3、Palette),DRDD 将“噪声注入”从“去噪重建”中分离,不仅强化了域协调对多样风格的泛化,还让残差扩散的确定性过程更易收敛。在 CDD-11 跨域、低光增强等任务中,DRDD 即便仅用 10% 配对数据,性能仍接近或超过全量配对数据训练的基线。统一多任务场景下,单模型同时处理多个降质 的能力远超先前需要独立模型的方法,充分体现了解耦设计对简化通用映射学习的收益。
行业影响
落地场景
DRDD 通过解耦噪声注入与残差学习,统一处理多种图像到图像 (I2I) 翻译,如去噪、超分辨率、去雨、低光增强、修复等,且对配对数据需求极低。适用场景包括:
- 内容平台与电商:商品图批量增强、背景替换、低质图像修复,一套模型覆盖全链路编辑。
- 医疗影像:跨模态翻译 (如 CT→MRI)、低剂量增强,只需少量配对样本即可训练,降低数据获取门槛。
- 自动驾驶与工业视觉:恶劣天气退化模拟与恢复、多域风格对齐,提升感知模型鲁棒性。
- 创作者工具:作为统一后端引擎,支持照片修复、超分、风格迁移等多种功能,无需为每项任务单独部署模型。
商业价值
- 降本增效:显著减少高质量配对数据的采集成本,同时单模型替代多任务专用模型,降低训练、运维开销。
- 体验提升:统一建模带来的域协调能力,使不同任务输出风格一致,避免多模型切换时的感官割裂,提升产品专业感。
- 规模化优势:数据效率的提高让冷门任务也能快速适配,帮助平台快速扩展新功能,抢占市场先机。
与现有产品/工作流的接口
DRDD 兼容主流扩散模型 (如 DDPM、DDIM、EDM),可直接替换现有扩散 backbone 而不改变外部接口。集成路径如下:
- 模型替换:将原有去噪扩散路径拆分为噪声扩散 (仅需无配对目标域数据) 与残差扩散 (少量配对数据) 两阶段,训练后输出与标准扩散模型一致的推理 API。
- 部署复用:推理流程仍为典型的迭代去噪采样,可直接在现有 Serving 框架 (如 ONNX、TensorRT) 中优化,无需额外改造 pipeline。
- 数据飞轮:利用线上无标注数据持续改进噪声扩散阶段,通过小批量标注数据微调残差扩散,实现持续低成本迭代。
具体落地用例
- 全球电商平台商品图像管线:卖家上传图片质量参差不齐,平台需自动去背景、超分、增强。传统多模型方案维护成本高,DRDD 可训练一个统一模型,利用大量未标注商品图训练噪声扩散域协调,仅用少量精美配对图训练语义映射,覆盖全部增强任务,交付速度提升 40% 以上。
- 医学影像标准化平台:跨设备、跨协议的医学图像风格差异影响诊断一致性。DRDD 可使任何设备采集的影像统一转换为标准风格 (如统一到特定 MRI 序列),仅需每类采集协议提供几张配对样本,配合大量无标注目标域影像即可训练,大幅降低跨院区部署负担。
局限
- **推理效率受限**:DRDD 将扩散过程解耦为顺序执行的两个独立阶段(噪声扩散与残差扩散),虽可在各阶段内缩减采样步数,但整体仍需要两次完整的逆向采样,推理延迟相比单阶段扩散模型有所增加。论文主要关注质量和数据效率,对推理时间、计算开销的成本分析较为简略,未提供与高效单阶段方法(如一步生成或轻量扩散模型)在相同延迟下的对比,工程部署时需权衡。
- **噪声水平敏感且需额外调参**:域和谐化效果高度依赖噪声注入强度,该超参数通过双 MMD 距离自动选择或手动设定,但不同图像域、任务复杂度可能需重新搜索或标定。对于未见过的目标域分布,预选噪声水平未必最优,实际使用中需额外验证步骤,增加了方法落地时的调参负担和不确定性。
- **对未配对目标域数据的依赖**:噪声扩散阶段完全基于未配对的目标域图像训练以学习域和谐化,尽管整体方法显著降低了对配对数据的需求,但假设能获取充足且高质量的目标域单域数据。在目标域样本稀缺或难以采集的场景(如医学稀有病症、特殊成像条件),噪声扩散阶段的训练受限,可能退化回常规条件扩散模型表现,论文未分析无未配对数据时的极限情况。