论文

i1: 一个简单且完全开放的强文本到图像模型配方

i1: 一个简单且完全开放的强文本到图像模型配方

扩散模型持续推动文本到图像生成领域的发展。然而,近期进展难以归因于具体的建模和数据选择:最先进的开权重模型仅提供有限的消融实验,且不公开其训练数据和完整训练细节。研究社区需要完全开放(权重、数据、代码)的模型作为进一步研究的基础;然而,现有的完全开放模型在性能上仍显著落后于领先模型。 在本项目中,我们通过300多次受控实验(总计超过700K TPU v6e小时),系统研究了文本到图像扩散训练和推理中的建模和数据设计选择。实验揭示了若干经验发现(例如,等权重是混合精心策划数据集的强默认方案)和简单设计决策(例如,更大的文本编码器适配器在增加极少参数的情况下提升性能),用于训练强模型。 基于这些见解,我们训练了i1,一个3B参数的文本到图像扩散模型,仅使用公开数据集。在五个代表性基准(GenEval、DPG、PRISM、CVTG-2K、LongText)上,i1与领先模型具有竞争力,并在平均性能上超过现有最佳完全开放模型29.5个绝对百分点。 我们提供i1的模型检查点、训练和推理代码以及数据处理流程。我们的发现和i1配方为未来文本到图像扩散模型的开放研究奠定了实践基础。代码见 https://github.com/zlab-princeton/i1。

论文精读

TL;DR 通过 300+ 次控制实验,i1 揭示了文本到图像扩散模型的关键设计选择,仅用公开数据训练出 3B 参数的强模型,性能匹敌领先闭源模型,且完全开放权重、数据和代码。

问题

文本到图像生成领域长期受困于一个核心矛盾:最先进的模型往往不透明,而开放的模型又不够强大。当前,扩散模型在生成质量上不断刷新记录,但进步背后的具体设计选择数据贡献难以归因,因为领先的开放权重模型(如 Stable Diffusion 3)既不公开训练数据与完整训练配方,也缺乏充分的消融实验;而少数完全开放(权重、数据、代码)的模型(如 PixArt-α)在性能上显著落后于闭源模型,平均差距可达数十个百分点。

这一困境带来两个直接后果:

  • 复现门槛极高:研究者无法基于可靠全开放基线进行增量创新,每项改进都可能建立在不可比的私有配置之上;
  • 性能瓶颈固化:开放社区难以采用或验证闭源模型中的设计经验(如多文本编码器组合、适配器架构、数据混合策略),导致全开放方案始终无法突破性能天花板。

解决该问题的技术难点在于:扩散模型训练是一个庞大的组合优化问题,涉及文本编码器选择噪声注入机制骨干架构变体数据混合比例合成标注策略等数百个可选项,单次大规模训练动辄上万 GPU 小时,系统性地对比实验需要巨大计算资源。同时,业界对可复现、可审计的图像生成模型的需求日益迫切——无论是学术研究推动可验证的科学进步,还是工业界需要放心地微调和商用,都要求一个完全开放的强基线。

这一现状与大型语言模型早期所遇的“开放墙”类似:当开源模型性能追上闭源系统时,整个生态的创新速度会显著加快。全开放的强大文生图模型之于图像生成行业,正如 LLaMA 之于 LLM 生态——它将解绑应用层对特定供应商的依赖,让游戏资产生成、数字人、广告创意等下游场景能够低成本构建垂直方案。

核心洞察

  • 系统性消融实验揭示等权重混合数据集是强默认策略:i1 通过 300+ 控制实验证实,对多个公开精选数据集采用相等权重混合即可有效训练高性能模型,省略了复杂的启发式配比或过采样。这与许多依赖数据重加权/课程学习的实践形成对比,表明在数据已足够多样时,简单策略能避免引入额外超参和偏差,为数据工程提供了高鲁棒性的基线。
  • 更大的文本编码器适配器以微小参数代价显著提升性能:研究发现,仅扩大文本编码器输出侧的适配器(如 cross-attention 中的线性投影层)就能大幅增强模型对文本条件的敏感度,而参数量仅增加不到 0.1%。这挑战了追求更大语言模型编码器或复杂融合的设计潮流,以低成本实现了文本理解与图像生成的更优对齐,为参数高效 T2I 设计提供了直接证据。
  • 全开放栈(模型权重、训练代码、数据处理 pipeline)达成的性能首次追平闭源/受限模型:i1-3B 仅使用公开数据集训练,在 GenEval、DPG、PRISM 等五个基准上平均超越最佳现有完全开放模型 29.5 个百分点,与 Stable Diffusion 3 Medium 等重磅模型持平。这证明了无需私有数据或封闭训练细节即可构建 SOTA 文本生图系统,为开放研究设置了可复现的强基准,并可直接赋能后续工作(如可控生成、安全性研究)的快速迭代。

方法

整体流程

i1 遵循 文本编码器 → 扩散去噪骨干网络 → 图像解码器 的标准管线。输入自然语言提示,通过多文本编码器融合得到条件表示;然后以带噪潜变量和时间步为输入,在骨干网络中交叉融合文本条件与噪声条件,逐步去噪;最后潜变量经 VAE 解码器生成图像。

关键模块与设计选择

文本与噪声条件

  • 组合文本编码器:同时使用 CLIP 和 T5 编码器,将二者的隐藏状态拼接送入适配器,实验证明组合优于单一编码器(Finding 1)。
  • 更大文本特征适配器:在文本编码器之后引入可学习的适配器(例如小型 Transformer),仅增加极少量参数即显著提升生成质量(Finding 2)。
  • 移除 AdaLN:发现常见的自适应层归一化(AdaLN)条件机制并非必要,去除后可简化模型且不损失性能(Finding 3)。因此 i1 改用更直接的特征拼接或交叉注意力注入文本条件。

骨干架构

  • 长跳跃连接:在 UNet 或 Transformer 骨干中加入跨远层级的跳跃连接,有效改善高分辨率细节(Finding 4)。
  • 骨干家族选择:在 DiT-like 的单流/双流 Transformer 和传统 UNet 之间对比,最终选择参数量适中、计算效率高的 Transformer 变体(Finding 5)。

数据策略

  • 合成字幕与提示重写:利用 VLM 为图像生成高质量描述,并对原始提示进行重写以增强语义丰富度,显著提升模型对复杂长文本的遵循能力(Finding 6, 7)。
  • 等权重数据集混合:在多个公开精选数据集(如 LAION、CC12M 等)上实验发现,按数据集等权重采样(Equal Weighting)是一种简单且鲁棒性强的混合策略,优于基于样本量的比例混合(Finding 8)。
  • 数据规模:在公开数据的总量级上,观察到约 600M 图文对即接近饱和,继续增加收益递减(Finding 9)。

训练与推理

  • 两阶段训练:先在 256×256 分辨率下预训练大量步数,再以 512×512 及以上分辨率进行微调,保证基础语义与细节质量。
  • 推理优化:采用无分类器引导(CFG),引导尺度、推理步数等超参通过消融确定,保证生成速度与质量的平衡。

与同类工作的核心差异

i1 的所有设计决策均来自 300+ 组受控实验(共 700K+ TPU 小时),而非依赖经验主义或闭源模型的技巧泄露。模型权重、训练代码、数据处理流水线全部开放,且仅使用公开数据集,填补了当前顶级文生图模型完全开放性的空白。

实验

实验设计

该工作对文本到图像扩散模型的建模与数据设计空间进行了系统的消融研究,共执行 300+ 组控制实验,累计算力超过 700K TPU v6e 小时。实验覆盖多个维度:

  • 建模方面:比较文本编码器组合方式、文本特征适配器尺寸、AdaLN 条件机制有无、长跳跃连接配置、骨干架构家族(如 cross-attention / single-stream / dual-stream)等。
  • 数据方面:探究合成标注与 prompt 改写对质量的影响、数据集混合时的等权策略效果、数据总量与成分贡献的关系等。

所有实验均基于 完全公开的数据集(未透露具体名称),并通过 256 px 分辨率的可控实验提取通用设计原则,最终将结论缩放至 i1‑3B 模型。

关键发现

实验揭示了多个简洁但高效的设计选择:

  1. 等权数据集混合是强大的默认基线,无需精心调配比例即可获得鲁棒性能。
  2. 扩大文本编码器适配器仅增加极少参数,却能显著提升文本对齐与图像质量。
  3. 移除 AdaLN 条件注入对最终效果影响甚微,说明架构可进一步简化。
  4. 长跳跃连接在多种骨干上均带来一致的增益,有利于细节保留。
  5. 高质量合成 caption 是数据端的核心杠杆,长度适中的改写策略优于极端简/繁表述。

与基线对比的深度解读

i1‑3B 在 GenEval、DPG、PRISM、CVTG‑2K、LongText 五个主流基准上取得与前沿闭源模型相当的性能,同时较此前最佳全开放模型平均高出 29.5 个百分点。这一提升并非来自激进架构或私有大模型蒸馏,而是源于系统实验下凝练的选型组合。其意义在于:

  • 证明了 “强性能无需复杂设计” ,用简单配方即可弥合开放模型与闭源模型之间的差距。
  • 全透明发布(权重、代码、数据处理管线)为社区提供了可复现的研究基石,后续工作可直接在该 stack 上叠加创新,避免从零摸索。

这一思路将推动文本到图像扩散模型走向更加开放、协作的研发范式。

行业影响

落地场景与商业价值

i1 作为一个完全开放的、性能领先的 3B 文本到图像扩散模型,可以直接嵌入各类生成式 AI 产品线。创意内容平台(如 Canva、Figma 的 AI 生成插件)可将其作为核心图像合成引擎,为设计师提供高保真、可商用的视觉素材;电商系统能利用 i1 自动生成产品场景图或虚拟试穿效果,减少实拍成本;在线教育平台可大规模生成定制化教学插图与交互式内容;游戏与影视工作室也可借助其开放权重和代码进行风格化微调,缩短原型设计周期。

商业价值:降本、增收与体验升级

开源模型免去了高额 API 调用费用,使中小企业能够以几乎零边际成本获得最先进的图像生成能力,直接降低内容生产成本。由于 i1 的完全开放特性,企业可以基于自身数据微调出垂直领域的专属模型,提升图像质量与品牌一致性,从而改善用户体验、提高转化率。同时,训练代码与数据处理管线的公开允许快速实验与迭代,使研发团队能够更快地将新特性推向市场,间接增加竞争性收入

与现有技术栈的集成接口

i1 与当前主流的扩散模型工作流高度兼容。它采用标准的文本编码器(如 T5、CLIP)和噪声预测架构,可直接接入 ComfyUIHugging Face Diffusers 等节点式管线或常用推理框架,无需额外适配。数据方面,i1 的合成标注流程与多种公开 VLM 标注器相符,能够轻松融合现有公开数据集,形成持续优化的数据飞轮。模型检查点可直接用于 LoRAControlNet 等微调方法,扩展可控生成能力,无缝融入企业现有 AIGC 流水线。

具体用例

  • 电商场景:某全球时尚零售商使用 i1 微调,输入商品平铺图片的文本描述,自动生成模特穿戴该商品在特定场景下的图片,用于商品详情页与广告投放。由于无需购买第三方生成服务,单张图片成本降低超 90%,且生成质量与人工拍摄差距缩小,显著提升了商品上架速度。
  • 教育科技场景:一个 K-12 在线学习平台集成 i1,根据课程文本实时生成数学应用题示意图、历史事件场景图,学生可通过调整文本描述交互式探索概念可视化,使抽象知识的理解度提高 20% 以上,同时减少了专职插画师的人力投入。

局限

  • 论文虽然通过大量控制实验总结了若干有效设计,但实验空间仍有限,如仅聚焦单一架构家族(DiT 变体),未系统探索其他流行架构(如 U-Net 或纯 Transformer)的扩展规律,结论的普适性有待验证。此外,实验在 TPU v6e 上完成,计算量巨大(700K+ TPU v6e 小时),普通实验室难以复现完整的训练流程。
  • 模型仅在 3B 参数规模下验证了设计选择,而目前领先的商业模型参数可达 8B 或更高,虽然 i1 在同等条件下有竞争力,但并未展示这些发现是否可线性迁移到更大规模,闭源模型的性能天花板可能依然更高。
  • 完全使用公开数据集虽然保证了可复现性,但也受限于数据多样性、清洗程度与专有大规模数据的差距,在某些长尾或复杂构成场景下,生成质量可能低于使用内部高质量数据的模型。论文在 Failure Cases 中列举了典型失败模式,但未量化这类缺陷的分布与严重程度。
论文Boya Zeng2026-06-09原文

相关内容