论文

RepFusion: 利用多模态先验在表示空间中进行去噪

RepFusion: 利用多模态先验在表示空间中进行去噪

大型语言模型(LLM)广泛应用于文本到图像(T2I)系统,但通常仅用于文本编码,去噪任务由新训练生成骨干网络处理。表示自编码器(RAE)的出现将生成目标转向语义结构化的视觉表示,创建了与预训练LLM先验更兼容的潜在空间。 受多模态大语言模型(MLLM)启发——其中MLP投影器足以对齐干净视觉表示与预训练LLM——我们将MLLM本身重新用作噪声表示编码器,将此机制从干净输入扩展至噪声输入。我们提出RepFusion,利用MLLM输出作为扩散Transformer的条件信号。在相似推理预算的受控对比中,RepFusion优于将可比容量投入新初始化去噪器的基线方法。 实验结果证明:MLLM为去噪视觉表示提供了强先验,且通过以演化中的噪声表示为条件,在现代T2I系统中可将测试时计算高效用于重复的MLLM条件化。

论文精读

TL;DR RepFusion 将多模态大语言模型直接用作噪声表示的去噪编码器,为扩散 Transformer 注入强视觉先验,在同等推理预算下超越传统从零训练的去噪器。

问题

问题背景

文本到图像(T2I)生成领域正从传统 VAE 潜在空间向语义更丰富的表示自编码器(RAE) 转变,这为直接利用大语言模型(LLM) 的先验知识创造了条件。现有系统虽已将 LLM 作为文本编码器,但其去噪过程仍由全新训练的扩散 Transformer(DiT) 独立承担,LLM 的多模态理解能力未能注入生成核心。

现有方法局限

主流管线(如 PixArt、Flux)中,LLM 仅输出一次静态文本嵌入,后续去噪轨迹完全依赖随机初始化的 DiT,造成两方面的浪费:

  • 知识断层:LLM 在预训练中习得的视觉-语义对齐(例如布局常识、物体属性)在去噪阶段被丢弃,DiT 需从零学习这些先验。
  • 表示鸿沟:传统 VAE 潜在空间与 LLM 的文本表示空间缺乏显式对齐,使得文本条件往往以交叉注意力的浅层形式注入,难以实现深度语义融合。

为什么这个问题难且重要

将去噪过程融入 LLM 先验面临多重技术挑战:

  1. 噪声输入适配:扩散过程中的加噪表示与 LLM 所见的干净视觉表示分布差异巨大,需设计稳健的编码器将噪声表示映射到 LLM 能理解的空间。
  2. 计算与架构权衡:让 LLM 参与迭代去噪可能带来高昂的推理成本,如何在保持生成质量的前提下复用固定 LLM 权重而非重复训练是关键矛盾。
  3. 条件化新范式:LLM 的输出需作为 DiT 的条件信号,要求新的注意力或调制机制来利用 LLM 内部的动态语义状态,这涉及表示学习与生成模型的协同设计。 一旦突破,能极大降低对去噪网络参数量的需求,使同等算力下生成质量显著提升,同时对资源受限的边缘端生成任务具有工程吸引力。

行业类比

这一思路类似于多模态对话系统借助预训练 LLM 的零样本推理能力直接处理视觉输入——去噪网络不再“重新发明轮子”,而是像调用一个强大的语义先验库,将生成任务变为对噪声输入的“条件化解释”,典型地体现了“预训练一次,在多种任务中复用”的工程哲学。

核心洞察

  • 将多模态 LLM 重新用作噪声表示编码器,打破了 LLM 仅处理干净文本或视觉特征的惯例。传统 T2I 流水线中,LLM 仅充当静态文本编码器,去噪完全由新训练的扩散主干承担。RepFusion 证明,通过简单的 MLP 投影器,预训练的 MLLM 可以直接处理扩散过程中的噪声视觉表示,并提供强大的语义先验作为条件信号。这意味着冻结的 MLLM 本身即可作为高性能的去噪先验源,无需为生成任务重新训练庞大的去噪模型,为复用数十亿参数的多模态模型提供了新范式。
  • 在表示空间而非像素或 VAE 潜在空间进行去噪,利用了表示自编码器 (RAE) 产生的语义结构化特征,使得扩散过程与 LLM 的 token 空间更兼容。这一选择让 MLLM 的条件信号能更直接地指导语义合成,改善了文本-图像的对齐和推理生成能力。对比使用 VAE 潜在的传统方法,RAE 表示空间可能更易于表达组合性、计数和关系等复杂语义,降低了从语言到视觉的映射难度。
  • 测试时计算通过重复 MLLM 条件化得到有效利用:随着扩散步数增加,系统可反复调用轻量 MLLM 前向传递来更新条件,而不必显著增加整体推理预算。这与单纯扩大模型参数或增加训练计算不同,提供了一种灵活的推理时 scaling 策略,使得在资源受限或需要快速迭代的场景下,仍能获得高质量生成。实验表明,在相似总计算量下,这种动态条件化优于将算力全部分配给新初始化的去噪器。

方法

输入与表示空间

RepFusion 的输入包含两部分:文本提示 与当前扩散时间步的 带噪视觉表示。视觉表示由预训练的 表示自编码器(RAE) 编码得到,RAE 将图像压缩为语义结构化、与 LLM 隐空间更兼容的连续潜变量,代替传统 VAE 潜变量。带噪表示由该潜变量依扩散过程加噪生成。

多模态 LLM 作为带噪表示编码器

核心模块是 多模态大语言模型(MLLM),其原本设计用于对齐干净图像表示与文本。RepFusion 将 MLLM 的输入从干净表示扩展至带噪表示:先将带噪表示通过一个 MLP 投影器 映射到 MLLM 词嵌入维度,再与文本嵌入拼接送入 Transformer 主干。MLLM 对内部表征进行跨模态融合,输出隐层特征。这一过程在每个去噪步骤重复执行,MLLM 成为动态的条件编码器,而非仅静态文本编码。

扩散 Transformer 条件生成

MLLM 的输出(例如最后层 hidden states 或其池化表示)被用作 条件信号,注入 扩散 Transformer(DiT) 的去噪网络。DiT 以此条件信号和当前噪声表示预测噪声,逐步还原干净视觉表示,再由 RAE 解码为图像。

训练与推理

训练时,MLLM 参数可保持冻结或部分微调,MLP 投影器与 DiT 从零训练。推理阶段,RepFusion 在每个去噪步重新调用 MLLM 进行条件编码,充分利用测试时计算(test-time compute),替代传统方法中仅靠独立训练的去噪器的做法。

与同类方法的差异点:传统 T2I 系统将 LLM 固定为文本编码器,去噪网络需从零学习视觉先验;RepFusion 则重用多模态 LLM 的跨模态理解能力作为带噪表示的先验,将计算从训练侧转移到推理侧,在同等推理预算下取得更优的提示对齐和生成质量。

实验

实验设计

  • 任务与评估:文本到图像生成,重点考察 prompt alignment(文本-图像一致性)及 reasoning-based generation(需复杂推理的场景)。
  • 对比基线:在相同推理预算下,与将同类容量分配给全新初始化去噪器(如标准 DiT、Transfusion)的现有 T2I 系统对比。
  • 控制因素:总参数量与计算量相当,RepFusion 的容量主要投向预训练 MLLM(作为 noisy representation encoder),基线则将匹配的容量分配给新训练的去噪网络。
  • 数据:未在摘要中具体列出基准数据集,但明确包含了需要推理能力的生成场景。

关键发现

  • 预训练先验有效:MLLM 输出的表示作为动态条件信号,使扩散 transformer 在同等推理预算下生成质量更高,复杂提示与推理任务表现尤为突出。
  • 测试时计算扩展性:可在去噪轨迹中多次调用 MLLM,通过增加推理计算换取质量提升,展现出良好的 scaling behavior
  • 表示空间去噪优势:在语义化视觉表示(由 RAE 提供)上执行去噪,与 MLLM 的预训练特征空间更兼容,优于传统 VAE 隐空间。

与基线对比解读

基线模型(如 SD3、Flux 变体)中,LLM 仅作为静态文本编码器输出固定嵌入,生成网络须独自完成噪声到图像的复杂映射。RepFusion 将 MLLM 的角色扩展为 noisy representation encoder,让生成模型直接利用 MLLM 内丰富的多模态先验(图像-文本对齐、世界知识),从而减轻对去噪网络自身容量和训练数据的需求。这一改变类似将视觉理解中的纯文本 LLM 升级为能“看见”噪声表示的多模态模型,条件信号随去噪过程动态演化。实验表明,在同等推理计算量下,这种“先验注入”更高效,且支持测试时计算灵活扩展,为将大规模预训练能力迁移至生成模型提供了新范式。

行业影响

落地场景

RepFusion 通过复用多模态大语言模型(MLLM)作为带噪表示编码器,为扩散 Transformer 提供更强的语义条件,可直接应用于对 文本对齐精度与推理级生成 要求高的产品中。典型场景包括:

  • 电商与广告:根据复杂营销文案生成高一致性商品图、场景图,减少多次人工精修,尤其适合需要计数、空间关系、逻辑组合的创意素材(如“三只猫围坐在生日蛋糕旁”)。
  • 内容平台与游戏:在故事板生成、概念设计阶段,利用 MLLM 的常识推理能力快速迭代多种构图,缩短从文案到原画的生产周期。
  • 企业服务:为 AI 设计工具(如 Figma 插件、Adobe Firefly 类产品)提供更强的文本理解后端,使非专业用户能通过自然语言直接控制画面细节。

商业价值

  • 降本:无需为每个新图像风格或领域从头训练大型去噪器,可直接利用已预训练的 MLLM 作为先验,显著降低训练算力与数据采集成本。相比同等预算下全新初始化的去噪器,RepFusion 取得更优的 prompt 对齐效果,意味着更低 TCO(总拥有成本)实现同等或更佳生成质量。
  • 增收:提升广告素材的点击转化率(CTR),通过更精准的文本-图像匹配减少素材废稿率;为创意工具增加差异化功能,支撑更高订阅 tier 或附加服务定价。
  • 体验提升:消费者获得更贴合描述的搜索结果/商品图,创作者获得更灵敏的“文字素描”工具,反馈循环加快,提高平台留存与活跃度。

与现有产品/工作流的接口

  • 表示自编码器(RAE)插件式集成:现有 T2I 管线若已采用 RAE 作为视觉表征,可将冻结的 MLLM 作为带噪编码器插入扩散条件接口,替代原本随机初始化的条件嵌入网络。少量适配层(如 MLP projector)即可完成对齐,无需改动扩散 Transformer 主体。
  • 测试时计算调度:在推理阶段,通过多次采样并使用 MLLM 对带噪表示重复编码,可有效分配测试时计算资源,增强细节可控性,这可以与现有的重调度器(如 DPM-Solver)和平行解码策略正交叠加。
  • 微调策略:对于特定品牌视觉要求,可仅微调 MLLM 的适配层或低秩适配(LoRA),保留模型原有的世界知识与推理能力,实现低成本领域适配。

局限

  • **依赖大规模预训练 MLLM**:RepFusion 的核心优势源自预训练多模态大模型(MLLM)提供的强大先验,但这也意味着方法效果严重依赖 MLLM 的规模与质量。实际使用中,推理阶段需要反复运行 MLLM 对变化中的噪声表示编码,导致显存占用和延迟显著高于传统 DiT,即便对照实验已按推理预算约束进行,资源受限场景仍难以部署。
  • **对 RAEs 表示空间的敏感性**:方法建立在表示自编码器(RAE)产生的语义结构化视觉表示之上,该空间的质量和泛化能力直接影响去噪先验的效用。如果底层 RAEs 未能充分捕捉图像内容或存在域偏移,MLLM 的条件信号可能失效,限制其在非标准图像生成任务中的适用性。
  • **实验范围局限**:论文主要验证文本到图像生成的提示对齐和推理式生成能力,并未广泛测试其他生成任务(如视频、3D)或多模态条件的鲁棒性。此外,对噪声输入特性(噪声调度、类型)的敏感性分析不充分,尚不清楚在实际扩散采样中,模型对分布偏移的容忍程度。
论文Xichen Pan2026-06-12原文

相关内容