论文

学习解读 Diffusion Transformers 中的上下文 token

学习解读 Diffusion Transformers 中的上下文 token

Multimodal Diffusion Transformers (MM-DiTs) 在生成过程中联合处理视觉与文本表示,并通过多模态注意力反复更新文本 token,形成功能尚不清楚的动态 contextual tokens。本文提出一个通过自然语言询问来解读该上下文空间的框架。 具体而言,作者训练一个轻量 bottleneck network,将中间层 contextual tokens 映射到冻结 LLM 的输入空间,使其能直接从这些隐藏表示回答关于正在生成图像的问题。 解读结果显示,contextual tokens 编码了正在生成场景的丰富全局表示:包括 prompt 未充分指定属性在内的生成语义在去噪早期即可获取,而更细粒度的细节随时间变得可读。即使 MM-DiT 接收空 prompt,这些信息仍可解码,说明 contextual tokens 会从演化的视觉表示本身积累大量图像特定信息。此外,上下文表示可读性更高的生成样本往往获得更高的人类偏好分数。 基于这些观察,作者提出 Contextual Alignment,一种显式强化 contextual tokens 中视觉语义信息的训练技术,可提升生成质量与分布覆盖度。该工作将 contextual tokens 确立为既可解释 MM-DiT 内部动态、又能改进生成模型的有效目标。

论文精读

TL;DR 训练一个轻量 bottleneck 将 MM-DiT 中的 contextual tokens 映射到冻结 LLM,实现生成过程的自然语言解读;发现 token 早期即编码丰富全局语义,并据此提出 Contextual Alignment 提升生成质量与覆盖。

问题

问题背景:多模态扩散 Transformer(MM-DiTs)已成为文本到图像生成的主流架构,但其内部文本 token 在生成过程中的动态语义角色尚不明确。

现有方法局限:此前研究大多聚焦于视觉特征可视化或交叉注意力图分析,缺乏对 MM-DiTs 中不断更新的上下文 token(contextual tokens)的直接解读。线性探针等方法难以解耦这些跨模态、时序变化的表示;而基于外部 VLM 的事后描述无法触及生成过程中逐步形成的语义。此外,现有生成质量优化多依赖采样策略或数据增强,未显式利用上下文 token 中已编码的丰富信息。

为什么这个问题难/重要:上下文 token 是文本与视觉特征经过多层多模态注意力融合后的产物,与视觉 token 高度耦合,且随去噪步骤动态演化,这使得语义提取和定量评估极具挑战。但若能“读取”这些 token,不仅能揭示模型如何将提示与图像内容对齐,还能为生成过程提供可解释性审计,甚至直接监督该空间以提升生成质量。业界对扩散模型的可控性和透明度需求日益增长,这项工作提供了一种可操作的范式。

行业类比:类似于在大语言模型中通过探针读取中间层知识以诊断和引导行为,该方法为扩散模型提供了一种“思维读取”接口,可类比于自动驾驶中对中间感知特征的语义审计。

核心洞察

  • Contextual tokens 不仅是文本条件的载体,而是动态累积图像语义的可读表示。通过将中间 contextual tokens 映射到冻结 LLM 的输入空间,论文实现了对生成过程中隐式语义的自然语言查询。与以往只解读视觉 token 或 cross-attention 图的工作不同,该方法直接暴露文本 token 在每次 multimodal attention 后的动态更新,揭示其编码了 prompt 未指定的场景属性,且这些信息在去噪早期即可解码。这为理解 MM-DiT 内部表征提供了新视角:文本 token 在生成中扮演了类似“工作记忆”的角色,而非静态条件嵌入。
  • Contextual Alignment 将可读性作为监督信号,显式强化 contextual tokens 中的视觉语义,从而提升生成质量与分布覆盖。此前可解释性研究通常停留在分析层面,本工作进一步将发现的规律转化为训练目标:利用 reader 网络和冻结 LLM 的语义对齐能力,引导 contextual tokens 编码更丰富、更一致的图像信息。实验表明,这种轻量级监督不仅能提升人类偏好分数,还能改善生成样本的多样性,说明“可读性”本身是一个有价值的优化维度,为扩散模型的条件机制设计提供了新的正则化思路。

方法

方法概览

输入:多模态扩散 Transformer (MM-DiT) 在去噪过程中每一层产生的 contextual tokens(即文本令牌经多模态注意力更新后的中间表示),以及一组自然语言问题(如询问图像中物体的颜色、数量、位置等)。

关键模块

  1. 特征提取
    从指定去噪步与 Transformer 层中收集所有 contextual tokens,通过一个 轻量级 bottleneck 网络(由小型 MLP 或注意力池化构成)将其压缩为固定长度的向量,作为 LLM 的输入前缀。

  2. 语言接口
    该压缩向量被映射到一个 冻结的大语言模型 (LLM) 的输入嵌入空间,与问题文本嵌入拼接后送入 LLM。训练时仅优化 bottleneck 网络,使用 问答对损失(交叉熵)引导网络从 contextual tokens 中提取与问题相关的语义信息。

  3. Contextual Alignment(监督上下文空间)
    在观察到可读性与人类偏好正相关后,作者引入训练技巧:用一个 Aligner 网络 从 contextual tokens 预测一个全局图像语义嵌入(来自 CLIP 等教师模型),通过 回归损失 显式强化 contextual tokens 中的视觉语义信息;同时采用 null-condition weighting 平衡有条件与无条件生成,避免过拟合文本条件。

输出

训练后的 reader 可在任意去噪时刻回答关于生成图像的问题,输出自然语言答案;而 Contextual Alignment 作为额外监督项,提升 MM-DiT 的生成质量与分布覆盖。

与同类工作的差异

不同于以往仅从潜空间或注意力图中间接解释扩散模型,本方法直接用自然语言查询动态 contextual tokens,并将其作为可优化的监督目标,同时提供可解释性与生成改进。

实验

实验设计

论文以通用 Multimodal Diffusion Transformers (MM-DiTs) 为对象(未明确具体模型版本),设计了一个 Contextual Reader:在冻结的 MM-DiT 中间层插入轻量 bottleneck 网络,将动态演化的 contextual token 映射到冻结 LLM 的输入空间,从而用自然语言问题直接“读取”隐藏表征。训练数据由成对的生成图像与针对图像内容的问题构成,使 LLM 能回答关于生成场景的语义、属性与细节。分析维度包括:

  • 不同去噪步数下的可读性变化
  • 空 prompt 条件下的信息积累
  • prompt 未明确指定但模型自行补充的属性

关键发现

  • Contextual token 在去噪早期即可编码全局场景表征,包括 prompt 未指定的生成特有语义,说明信息并非仅在后期才形成。
  • 随去噪推进,可读细节逐渐细粒度化;甚至当 MM-DiT 接收空 prompt 时,contextual token 仍能从演化中的视觉表征积累大量图像特定信息。
  • 可读性更高的生成结果往往获得更高的人类偏好评分,表明 contextual token 的语义质量与最终输出质量正相关。

与基线对比解读

与仅依赖视觉 token 或原始文本 token 的表征相比,contextual token 融合了跨模态注意力后的动态信息,提供了更接近最终场景的全局语义视图;论文据此提出 Contextual Alignment 训练技术,显式强化 contextual token 中的视觉-语义信息,在不改变推理架构的前提下提升生成质量与分布覆盖度。摘要未给出具体数值提升,但该方法将可解释性发现转化为可优化的训练目标,区别于单纯的事后归因工作,对工程实践具有直接指导意义。

行业影响

落地场景

多模态扩散模型(MM-DiT)在图像/视频生成产品中广泛应用。该研究提供的上下文可读性能力可直接用于:

  • 生成内容质量监控:在电商商品图生成、广告创意生成等场景,实时读取中间 contextual tokens,用 LLM 判断生成图是否准确反映 prompt 中的属性(如颜色、数量、空间关系),提前拦截不合格输出。
  • 模型调试与可解释性工具:AI 开发平台可集成此 reader 作为可视化诊断工具,帮助工程师理解模型在生成早期已捕获哪些语义,定位 prompt 遵循失败的原因。

商业价值

  • 降低人工审核成本:自动化评估生成图与文本一致性,减少人工抽检比例,提升内容审核效率。
  • 提升用户体验与转化:通过 Contextual Alignment 强化 contextual tokens 的视觉语义信息,模型生成质量与多样性提高,直接改善生成内容的相关性,降低用户反复重绘的流失率。
  • 增强模型差异化竞争力:提供可解释的生成过程,有助于企业客户信任和合规审计。

与现有工作流集成

  • 推理侧:将轻量 bottleneck network 作为附加模块,插入现有 MM-DiT 的中间层,无需改动原始权重;输出送入 frozen LLM 进行自然语言问答,可作为质量评分器或内容过滤器。
  • 训练侧:Contextual Alignment 可作为辅助损失函数,与原有 denoising loss 联合优化,只需额外的特征提取器和 aligner 网络,可适配不同 MM-DiT 架构。
  • 产品形态:可封装为 API 服务,为内容生成平台提供“生成前语义检查”或“生成后归因分析”。

局限

  • 读取器的可解释性受限于冻结 LLM 的预训练知识与问题模板。训练数据通过模板自动生成,覆盖的语义类型有限,导致读取器对未见过的问题形式或概念泛化能力存疑。此外,将隐藏表示映射到 LLM 输入空间的过程可能丢失部分信息,且 LLM 本身的推理偏见会影响读出的语义准确性,难以保证完全还原上下文token中的原始信息。
  • Contextual Alignment 需要额外的教师嵌入(如 CLIP 或 VLM 特征)作为监督信号,增加了训练阶段的计算与存储开销;同时该方法与特定 MM-DiT 架构耦合,迁移到其他 backbone 时需要重新设计特征提取与对齐网络。论文仅在有限模型规模与数据集上验证,未充分测试在大规模多模态模型或更长推理链场景下的稳定性,也未讨论对生成多样性或文本-图像对齐度的潜在负面影响。
  • 论文主要采用相关性读取与下游质量指标来验证上下文token的可读性,缺少因果干预实验(如消融特定token维度的方向或编辑token内容)来证明这些表示确实在生成中发挥功能性作用。对于空提示条件下仍能解码出场景信息这一反直觉现象,仅给出描述性解释,未深入探究其形成机制与对生成动力学的影响,限制了结论的理论深度。
论文Omer Dahary2026-10-05原文

相关内容