论文

UniDDT: 用解耦扩散变换器统一多模态理解与生成

UniDDT: 用解耦扩散变换器统一多模态理解与生成

统一多模态模型(UMMs)面临三大挑战:视觉理解与生成任务之间的学习冲突,导致两者建模效果欠佳;不同的理解与生成视觉空间阻碍可扩展性;过度依赖任务特定数据,忽视了图文理解与生成的内在对偶性。 针对这些问题,提出UniDDT,利用Noisy ViT编码器与LLM统一视觉生成和理解任务的语义编码,同时采用独立的扩散解码器将扩散解码与文本解码解耦。通过Noisy ViT编码器,UniDDT将潜在空间作为统一视觉表示,实现理解与生成任务的无缝兼容,从而在生成任务的可扩展性与理解任务的语义表达力之间取得平衡。此外,从相同图像-文本对构建双重数据结构,增强生成与理解数据的相互依存,充分挖掘其内在对偶性。 大量实验表明,UniDDT有效统一了多模态理解与生成,提升了语义一致性与可扩展性。在视觉生成任务中,GenEval得分0.87、DPG总体得分86.9;在多模态理解任务中,MME基准1699.5、SEEDbench总体得分76.5。

论文精读

TL;DR UniDDT 用 Noisy ViT 编码器统一视觉表示、扩散解码器解耦图文解码,解决多模态理解与生成的学习冲突,在生成(GenEval 0.87)和理解(MME 1699.5)双任务上达到领先水平。

问题

问题背景

统一多模态模型(UMMs)正成为通用多模态智能的关键方向,试图在单一框架内同时实现视觉理解(如图文问答、视觉蕴含)与视觉生成(如文本到图像合成)。业界亟需能够无缝切换理解与生成能力的模型,以减少部署成本并提升语义一致性。

现有方法的局限

当前 UMMs 普遍面临三个核心瓶颈:

  1. 学习冲突:理解任务追求语义抽象与判别性特征,生成任务要求像素级细节重建,共享的视觉编码器在梯度上相互抵触,导致双方均无法收敛到最优解。
  2. 视觉空间不兼容:理解常用的语义空间(如 CLIP 潜在空间)与生成依赖的感知空间(如 VAE 潜在空间)分布差异显著,强行对齐会牺牲生成的可扩展性或理解的语义表达能力。
  3. 数据利用低效:大多数方法将理解数据与生成数据割裂训练,忽视图文对天然具有的对偶性——一个句子既可被生成(图像→文本)也可被理解(文本→图像),单一任务训练浪费了这种互信息。

为什么这个问题难且重要

  • 技术挑战:视觉表示需要同时具备语义区分度(理解)和结构保真度(生成),二者的优化目标在特征空间中几乎正交。现有方案如向量量化(VQ)或扩散桥接往往以牺牲一方性能为代价。
  • 业界关注度:从 GPT-4o 到 Gemini,闭源巨头已展示统一理解的趋势,但开放社区仍缺乏高效、可伸缩的架构。低成本的 UMM 能赋能内容创作、自主代理等多模态应用,其研发具有极高的工程与产品价值。

行业类比

就像自动驾驶模型需要同时理解交通标识(理解)与预测周围车辆轨迹(生成),统一多模态模型也需在同一表征上平衡两种冲突需求,否则只能像早期两阶段系统那样拆分模块、损失联动效率。

核心洞察

  • UniDDT 的核心洞察是将视觉编码器 ViT 暴露在噪声下,使其输出既能承载语义理解又兼容扩散生成的统一潜在空间。与传统方法分别维护理解与生成两个视觉空间不同,Noisy ViT 通过调节噪声强度,在单一编码器中实现语义表达力与生成可扩展性的平衡,避免了任务间特征冲突,从而在不牺牲模型容量的前提下,让同一个视觉表示同时服务于理解与生成。
  • 通过将扩散解码从 LLM 文本解码中解耦,UniDDT 消除了生成过程中扩散噪声对语言理解的干扰。这种架构让 LLM 专注于条件语义建模,而独立的扩散解码器负责视觉 token 的迭代去噪,不仅提升了生成质量,还保证了多模态理解任务上的性能稳定性,为统一模型提供了一种低冲突、可扩展的设计范式。
  • 利用同一图像-文本对构造双向数据——从文本到图像生成、从图像到文本理解——UniDDT 挖掘了图文对的天然二元性,使理解与生成数据相互增强。这种做法不同于单纯堆砌任务专用数据,而是通过结构性数据复用,提升了语义一致性,让模型从有限样本中学习到更紧密的跨模态映射,显著减轻了对大规模独立标注的依赖。

方法

UniDDT 方法采用编码器-解码器框架,统一多模态理解与生成。其核心流程如下:

输入与数据准备

  • 基于图文对 (image-text pairs),构造双数据结构:同一图文对同时服务于图像生成(如文本到图像)和图像理解(如视觉问答),利用任务间的二元性相互增强。

关键模块

  1. Noisy ViT Encoder:接收图像并映射到统一潜在空间。训练时注入噪声,使表示既能支持扩散生成的噪声鲁棒性,又保留理解任务所需的语义细节。这避免了传统方法中理解与生成对视觉空间的不同要求导致的冲突。
  2. LLM Backbone:作为语义骨干,整合文本 token 与视觉编码,进行跨模态推理。它直接输出理解答案,同时为生成任务提供条件信号。
  3. Diffusion Decoder:与文本解码完全解耦,专门负责从潜在表示生成图像。它接收 Noisy ViT 的输出和 LLM 的条件,通过扩散过程逐步去噪,合成最终图像。

训练策略

  • Warmup 阶段:分别预训练 Noisy ViT Encoder 和 Diffusion Decoder,降低联合训练的不稳定性。
  • Joint Training:联合所有模块,在多任务混合数据上优化,使视觉表示兼顾理解与生成。
  • Post Training:在理解或生成特定数据上微调,进一步提升单任务表现。

输出

  • 对理解任务:输出文本回答或类别预测;对生成任务:输出高保真图像。

与同类方法差异:UniDDT 通过 Noisy ViT 与解耦的 Diffusion Decoder,将扩散噪声限制在生成路径中,避免干扰 LLM 的语义推理,从而更有效地平衡理解与生成,同时利用双数据结构增强跨任务协同。

实验

实验设计

评估覆盖多模态理解视觉生成两大方向。理解任务在 MMESEEDbench 等基准上测试;生成任务在 GenEvalDPG-Bench 上衡量。模型以 Noisy ViT 编码器提取含噪视觉特征,经 LLM 统一语义编码,再由独立扩散解码器生成图像。训练采用 双数据策略,从同一图文对构造理解与生成样本,并在预热、联合训练、后训练三阶段优化。

关键发现

  • 理解与生成兼顾:MME 得分 1699.5,SEEDbench 整体 76.5;GenEval 0.87,DPG 整体 86.9,均达到先进水平。
  • 统一视觉空间 缓解了任务间的学习冲突,使两个任务在同一模型内协同增益。
  • 解耦扩散解码 将扩散生成与文本解码分离,避免生成噪声干扰理解,同时保持生成图像的高语义一致性。

与基线对比解读

相比此前统一模型(如 Unified-IOOFA 等),UniDDT 在生成和理解指标上未出现明显的“跷跷板”效应:生成质量未因兼容理解而明显下降,理解能力也未因共享编码器而受损。这主要得益于带噪编码器提供的可伸缩隐空间,使得扩散生成与语义理解共享表征但不相互制约。在实际工程中,该设计为多模态模型在单一架构下同时支持 OCR、VQA 与文生图等任务提供了可行路径,对部署和迭代更为友好。

行业影响

落地场景:统一多模产品的新引擎

UniDDT 将视觉理解与生成整合进单一框架,意味着内容平台、电商系统、创作工具和企业自动化可部署一个模型同时完成“识图”与“作图”。例如:

  • 电商商品管理:输入一张服装白底图,同时输出结构化属性(颜色、款式)并生成多角度模特试穿图,极大缩短上架链路。
  • 在线教育与培训:对解剖图或机械图,模型既能回答学员的提问(理解),又能根据描述生成示意变体或标注图(生成),提供交互式学习。
  • 数字人/虚拟客服:在对话中既看懂用户上传的图片,又能直接生成所需的反馈图像,提升沉浸式体验。

商业价值:降本、增效、体验升级

传统视觉系统需维护两个独立模型(例如 ViT + LLM 做理解,diffusion model 做生成),UniDDT统一视觉空间解耦扩散解码器可将复杂度裁半:

  • 降本:减少模型推理实例,显著降低 GPU 资源消耗与运维成本。
  • 增效:单一模型避免数据在不同模态间转换,降低延迟,适合实时互动场景。
  • 体验升级:理解与生成共享语义空间,保证图像内容与文本描述高度一致,例如生成的图文保证同一实体外观不变,提升用户信任度。

接口与集成:无缝融入现有 LLM Stack

UniDDT 架构天然兼容主流 LLM 推理框架(如 vLLM、TGI),因为其 LLM backbone 部分与标准大模型无异。Noisy ViT 编码器可作为前置视觉 tokenizer,扩散解码器则为后置模块。集成路径:

  1. 替换现有视觉编码器为 Noisy ViT,以统一 embedding。
  2. LLM 输出 hidden states 给扩散解码器,实现生成指令的分离。
  3. 通过 dual data structures 训练数据加载器,同时提供理解(QA)和生成(去噪)信号。

工程团队可用单一 Hugging Face 格式权重部署,对外暴露统一 API,下游应用只需区分 task_type=understandinggeneration,简化微服务架构。

具体 use case:电商内容工厂与医疗影像

  • 电商内容工厂:某全球时尚平台用 UniDDT 接收设计师草图,模型立刻返回产品文案(理解)与多风格渲染图(生成)。同一件衣服的纹理、logo 在所有视角和场景中保持绝对一致,因为视觉空间已对齐,杜绝传统 pipeline 中“理解出的属性与生成图像不符”的痛点。
  • 辅助医疗影像:医学影像存档系统接入 UniDDT,医生上传 CT 切片,模型既可自动输出结构化报告(病灶位置、尺寸),又能根据文字描述生成增强标注图或手术导航参考图。所有输出共享同一病灶表示,避免误判风险,并满足合规要求的可追溯性。

局限

  • 训练流程复杂,依赖多阶段策略(warmup、联合训练、后训练),对工程化落地和超参调优带来额外负担。此外,Noisy ViT encoder 需要注入噪声以统一视觉空间,这引入了对噪声大小设定的敏感性,可能影响生成质量或理解精度。
  • 论文主要在中等规模模型(如基于 LLaMA 或 Vicuna 的架构)上验证,未展示在百亿级以上参数规模下的扩展性。统一架构可能在极大模型时面临梯度冲突加剧、训练不稳定等问题,限制了其在高资源场景中的推广。
  • UniDDT 依赖于精心构造的双重数据(对同一图文对生成理解和生成两条训练样本),在实际爬取数据中难以自动构造,增加了数据预处理成本。与纯理解或纯生成的专用基础模型相比,统一架构在各自绝对指标上仍有小幅差距,可能无法满足对单一任务极致性能的需求。
论文Shuai Wang2026-06-15原文

相关内容