论文

视觉生成中文本条件化的缩放属性

视觉生成中文本条件化的缩放属性

我们研究了视觉生成中文本条件的经验缩放属性。这些属性很少被测量,因为 扩散损失 不会随着自然语言提示中的 token 数量而缩放。令人惊讶的是,我们发现收敛的扩散损失随提示中结构化语言的数量而缩放。为了量化结构化语言,我们采用了两种互补的度量:白盒似然度量(GPG)和黑盒属性度量(ED)。在受控训练运行中,收敛的扩散损失大致随 GPG 线性下降,并遵循 ED 的幂律。 在这些缩放属性的指导下,我们通过构建带有从图像派生的语义和几何注释的结构化提示来提高 可扩散性,并通过监督微调、冷启动和验证器门控的在线策略蒸馏来训练提示器以提高 可提示性。由此产生的系统在几乎所有组合、推理和世界知识基准上优于所有评估的开权重模型,同时在大多数评估中匹配或超过最强的闭权重模型。

论文精读

TL;DR 发现文本条件在扩散模型中的缩放定律,并据此构建结构化提示和在线策略蒸馏的提示器,实现开源模型在组合推理等基准上超越多数闭源模型。

问题

问题背景

视觉生成领域正从单一的美学质量转向对复杂文本条件的精准遵循,组合性生成、空间推理 与 世界知识 等能力成为核心关注点。然而,文本条件本身的缩放特性——即更丰富、更结构化的语言如何系统性地影响生成质量——始终缺乏量化理解。

现有方法局限

当前文本到图像的扩散模型主要依赖自然语言提示,但扩散损失并不像语言模型那样随 token 数量自然缩放,导致两个关键盲区:

  1. 无法度量结构化语言的增益:普通自然语言与高度结构化描述(如包含空间坐标、属性标签)对收敛损失的影响没有可比较的标尺。
  2. 缺乏指导提示优化的原则性工具:现有的提示工程多依赖试错或启发式规则,无法根据缩放规律预先判断提示的信息密度是否有效。

为什么这个问题难且重要

难点在于结构化语言的测量:需要同时捕捉语言表面的统计特征(如语法复杂性)和语义的丰富度,且这些度量必须与扩散损失的缩放行为强相关。本文借用 GPG(基于白盒似然的度量)和 ED(基于黑盒属性的度量)首次建立起收敛扩散损失与这两种度量之间的线性与幂律关系。这类似于在 LLM 中发现计算量与损失之间的可预测缩放曲线,其重要性在于:

  • 可以指导构建高信息密度提示(如融入语义、几何标注),直接提升模型可扩散性;
  • 能够系统训练一个提示优化器,通过 SFT、冷启动与验证器门控策略蒸馏,将模糊输入转化为更易被模型遵循的提示。

行业类比

就像在 LLM 中通过 Chinchilla 缩放定律指导数据与参数量的分配,视觉生成也需要一套基于文本条件度量的缩放理论,来科学地提升复杂指令的遵循能力。

核心洞察

  • 扩散模型的收敛损失随提示中结构化语言量增加而可预测地下降,这为视觉生成中的文本条件作用建立了首个可量化的 scaling law。与以往主要将扩散损失视为与文本 token 数无关的观点不同,该工作通过 GPG 和 ED 两种互补指标,揭示了提示的语义与几何结构才是决定生成质量的关键因素,这对如何构建训练数据与优化推理提示有直接工程指导意义。
  • 通过从图像自动构建含语义与几何标注的结构化提示,并结合冷启动、监督微调与验证器门控的在线蒸馏来训练 prompter,该工作将“可扩散性”(diffusability)与“可提示性”(promptability)解耦并协同优化。这种方法区别于单纯扩大模型或依赖手工提示工程的范式,为提升组合性、推理与世界知识等复杂基准上的性能提供了一条可工程化、可复现的路径,且在全开源模型中取得了领先结果。

方法

该方法旨在通过 文本条件缩放规律 提升视觉生成模型的可控性,流程覆盖 结构化提示构造 → 度量标准建立 → 提示器训练 三个核心阶段。

输入:从图像到结构化文本

  • 给定图像,提取 语义标注(如物体类别、属性)和 几何标注(如边界框、关键点),组合成包含明确结构化语言的自然语言提示。这类提示比自由文本更富含信息,能够稳定提供可测量的语言“量”。

关键模块 1:缩放规律度量

研究者定义了两个互补指标量化提示中的结构化程度:

  • GPG (Generative Perplexity Gain):白盒似然度量,利用预训练扩散模型计算提示带来的对数似然增益,反映模型对提示的“理解”程度。
  • ED (Edit Distance):黑盒属性度量,通过检测生成图像是否满足提示中指定属性来计算编辑距离,衡量任务完成度。

在受控训练中,观察到收敛后的扩散损失随 GPG 近似线性下降,随 ED 呈幂律下降。这一发现首次将文本条件量与生成性能直接关联,引导后续结构化提示设计。

关键模块 2:提示器训练

为提高任意图像的可提示性,训练一个 prompter 模型,其训练分三步:

  1. 监督微调 (SFT):用构建的结构化提示对作为初始监督信号。
  2. 冷启动:在强化学习初期,引入部分预训练权重或辅助目标,避免随机策略崩溃。
  3. 验证门控在线策略蒸馏:仅当生成图像通过属性验证(达到预设 ED 阈值)时,才将该提示-图像对用于策略蒸馏,形成在线自我改进循环。该机制确保了探索稳定性与数据质量。

输出:高性能生成系统

最终 prompter 能自动为输入图像生成高结构化文本,驱动扩散模型生成符合复杂组合、推理和世界知识要求的图像。在多个基准上,系统性能全面超越所有开源模型,并与最强闭源模型持平或更优。

与同类方法差异:传统方法多依赖人工 prompt 工程或单纯扩大模型规模,而本工作 首次定量揭示了文本结构化的缩放规律,并基于此规律设计了带验证门的在线学习 prompter,将语言结构化从经验技巧提升为可度量的驱动信号。

实验

实验设计

作者通过一系列 受控训练运行 系统研究了文本条件的缩放规律。核心设置是固定模型架构与训练数据,仅改变提示中 结构化语言 的数量。为了量化结构化程度,引入两种互补度量:

  • GPG(白盒似然度量)
  • ED(黑盒属性度量)

实验发现,收敛扩散损失 随 GPG 大致线性下降,而随 ED 呈 幂律关系。基于这一规律,作者从图像中提取语义与几何标注来构建结构化提示,以提升 diffusability(扩散模型的可控性);同时通过 SFT、冷启动与基于验证器的在线策略蒸馏来训练一个 prompter,以提升 promptability(提示的可优化性)。最终系统在组合性、推理与世界知识等多项基准上与闭源模型对比。

关键发现

  • 缩放规律存在且可度量:文本的结构化程度(而非单纯 token 数量)决定了扩散损失的改善趋势,这打破了“扩散损失不随提示长度缩放”的直觉。
  • 结构化提示优于长提示:使用从图像派生的语义/几何标注构建的 prompt,比同长度的自然语言 prompt 带来更低的扩散损失。
  • 训练 prompter 可超越人工 prompt:经 SFT 与策略蒸馏的 prompter 在多数基准上匹配甚至超越最强闭源模型,表明文本条件可以脱离对人工精心设计的依赖。

与基线对比

  • 与所有评估过的 开放权重模型 相比,本系统在几乎每一项组合性、推理和世界知识基准上都取得更优表现。
  • 与 最强闭源模型 相比,在多数评测中达到持平或超越,显示出结构化提示和可学习 prompter 在实用生成任务上的竞争力。
  • 该方法不依赖特定模型架构,可推广至各类扩散模型,为文本到图像生成中的 提示工程自动化 提供了新的理论依据与工程路径。

行业影响

落地场景

这项工作可直接赋能 文本到图像 / 视频生成产品,尤其适合以下场景:

  • 内容平台:自动生成配图、海报、社媒素材,提示质量提升可大幅降低人工筛选与重试成本。
  • 电商:商品图生成与虚拟棚拍,通过结构化提示精确控制物体关系、材质与光照。
  • 教育 / 医疗:根据教学文本或病例描述自动生成解剖图、流程图等专业可视化内容。
  • 自动驾驶仿真:用自然语言描述复杂交通场景,生成高保真训练图像,补充 corner case 数据。

商业价值

  • 降本:结构化提示的自动构建与 prompter 蒸馏,可减少专业提示工程师的人力依赖,并降低推理时的反复试错算力浪费。
  • 增收:在广告创意、游戏美术等需要批量生成高质量视觉资产的业务中,产出效率与一致性提升直接加快交付周期,提高接单能力。
  • 体验提升:更强的组合性与推理能力意味着生成结果更贴合用户意图,降低“词不达意”导致的挫败感,提升产品留存与付费转化。

与现有产品 / 工作流的接口

  • 即插即用的 prompter 模块:可将论文训练的 prompter 作为前置微服务,接收用户简短意图,输出结构化长 prompt,再送入现有扩散模型(如 Stable Diffusion、Flux)。
  • 图像标注驱动的提示增强:利用对象检测、分割模型从参考图像中提取语义与几何标注,自动构造高结构化提示,集成到现有的图生图或风格迁移管线。
  • 在线强化反馈闭环:在商业 API 中部署 verifier 模型,对生成结果进行评分,在线蒸馏优化 prompter,持续提升提示可扩散性。

具体落地 Use Case

  1. 电商虚拟模特与商品图生成
    用户上传服装平铺图,系统自动提取版型、颜色、材质等属性,结合“模特在咖啡店街拍”等场景描述,生成结构化提示(如 [几何]:模特居中,服装覆盖上半身,背景虚化;[语义]:棉质连衣裙,蓝色条纹,午后自然光),大幅提升生成图的可控性与真实感,减少棚拍成本。

  2. 自动驾驶 Corner Case 合成
    工程师用自然语言描述罕见场景:“雨夜,三轮车逆行,路面有积水反光”,prompter 将其转为带有物体边界框与空间关系的结构化提示,送入扩散模型生成高保真训练图像,快速扩充长尾数据,提升感知模型鲁棒性。

局限

  • 论文提出的结构化语言度量(GPG、ED)高度依赖人工或半自动标注,例如几何标注、语义树等,这在实际非受限场景中难以大规模获取,限制了方法在任意自然语言提示上的普适性。
  • 实验主要在自建的数据管道和模型家族上进行,并未在更广泛的公开 baseline 或更大规模的多样数据集上验证 scaling 规律的泛化性,部分结论可能受限于特定的训练配置与数据分布。
  • 尽管生成质量提升显著,但方法引入了额外的 prompter 训练流程(SFT、冷启动、验证器门控蒸馏),增加了系统复杂度和计算开销,对于资源有限的团队可能不友好,且 prompter 性能对下游任务的影响尚未充分消融。
论文Zilong Chen2026-07-31原文

相关内容