From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation
大规模图像生成受益于数据规模、质量、再平衡和重标注的进步,但传统流程通常孤立地优化任务特定数据集。核心挑战不仅在于如何整理每个任务语料库,还在于如何根据生成能力之间的依赖关系组织异构监督。我们提出一种能力驱动数据基础设施,将能力特定监督构建与能力对齐的课程调度相结合。 三个专用且可互操作的数据引擎为文本-图像对齐、图像间变换和图像-知识关联构建互补的关系监督,而标注专家跨任务和粒度对齐T2I与编辑监督。多阶段课程沿着能力获取的依赖顺序共同演化任务组合、视觉概念分布、数据质量和图像分辨率,并且能力感知评估通过针对性检索、专家构建和缺口感知重采样闭环反馈。 在规模上,该框架整理了4.4亿图像T2I语料、1.2亿编辑对和2700万图像-实体对。利用该基础设施,我们从头训练了3B和6B两种规模的多模态扩散模型。我们在CPI-Bench上进行定量评估,并在多种文生图和编辑场景中进行定性评估。实验结果呈现了广泛的视觉覆盖、多功能的渲染以及跨生成能力的有效迁移。
论文精读
TL;DR 以能力为中心的数据基础设施,将文本-图像、图像编辑、知识关联异构监督按依赖关系组织成多阶段课程,训练 3B/6B 扩散模型,实现通用图像生成与编辑能力的协同进化。
问题
问题背景
当前通用图像生成模型正从单一文生图(T2I)向同时承载文本-图像对齐、跨图编辑 与 知识关联 的多能力系统演进,业界关注如何高效组织海量异构监督数据。
现有方法局限
主流数据管线通常将 T2I、编辑、知识增强等任务的数据集独立采集、独立清洗、独立优化,例如分别用 CLIP 相似度过滤图文对、用合成编辑对做局部增强、用实体链接构建知识图像对。这种隔离带来三个具体问题:
- 监督信号割裂:不同任务间的依赖关系(如先有 visual grounding 才能稳定做 inter-image transformation)未被显式建模,导致模型难以迁移已学能力。
- 课程与数据不匹配:现有课程学习大多只调整分辨率或数据量,未联合调度任务组合、概念分布、质量阈值,造成能力习得顺序错乱。
- 评估闭环缺失:常用 FID、CLIP score 等独立指标,无法定位具体能力缺口并驱动针对性补数据。
为什么这个问题难/重要
难度在于多能力联合优化:数据引擎必须同时保证异构监督的互补性与可互操作性,例如caption experts 需要在不同任务和粒度间对齐语义,避免 T2I 的 recaption 破坏编辑对中的关系描述。其次,数据规模极大(如 440M 图像、120M 编辑对、27M 实体对),任何环节的噪声都会在课程调度中被放大。业界高度关注该问题,因为它直接决定从数据集扩展 到 能力协同演进 的范式转换能否落地。
行业类比
就像训练一个通用具身智能体需要按“感知→操作→规划”的顺序逐步引入多模态技能,通用图像生成也需要用依赖感知的数据课程 让模型先学会对齐语义,再学会变换关系,最后关联结构化知识。
核心洞察
- 该论文提出从“任务数据独立优化”转向“能力依赖驱动的数据组织”,显式建模生成能力之间的获取顺序,并用多阶段课程调度按此顺序演进任务组合、视觉概念分布、数据质量与分辨率。与常规多任务数据混合或单任务最优 pipeline 不同,这种方法把异构监督组织为能力依赖的序列,使得文本-图像对齐、图像编辑和知识关联能力可以协同演化,而不是简单拼合,从而提升跨任务迁移效率。
- 三个专用数据引擎分别构建 text-image grounding、inter-image transformation 和 image-knowledge association 的互补关系监督,并通过 caption experts 对齐不同任务和粒度,消除任务间监督信号的不一致。对比以往各任务独立标注、缺乏统一语义桥梁的做法,该框架把异构数据统一为关系型监督,让共享的 diffusion 模型能够同时吸收视觉语义、变换和知识关联三种互补信号,这是规模化多任务生成数据工程的关键差异。
- 能力感知评估反馈闭环通过定向检索、专家构建与 gap-aware resampling 动态调整数据分布,使训练不再依赖静态数据集。与基于损失或简单难度采样的课程学习不同,该机制以生成能力差距作为重采样信号,能针对模型当前短板定向补充数据,在 440M 图像规模下实现更高效的数据利用和持续能力演化,对大规模生成模型的迭代训练具有直接工程借鉴价值。
方法
输入与核心挑战
传统大规模图像生成数据管线通常 孤立优化 各任务数据集,忽视了生成能力间的依赖关系。本方法以 异构监督 为输入,包括原始图文对、图像编辑对、图像-实体知识对。
关键模块
- 能力特定数据引擎:三个专用且互操作的引擎构建互补的关系监督:
- T2I 数据引擎 生成文本-图像 grounding 监督;
- 图像编辑数据引擎 生成图像间变换关系监督;
- 知识数据引擎 生成图像-知识关联监督。
- Caption 专家桥接:通过 caption experts 对齐 T2I 与编辑监督,实现跨任务、跨粒度的语义一致性。
- 能力对齐课程调度:多阶段课程按能力获取依赖顺序,逐步演化任务组合、视觉概念分布、数据质量和图像分辨率。例如从
256pxT2I 预训练开始,经复杂 T2I、联合 T2I&Edit、持续训练到1024px监督微调。 - 能力感知评估闭环:通过目标检索、专家构建、差距感知重采样,动态调整数据分布,形成反馈优化。
输出与差异
最终产出大规模训练数据集(440M 图文对、120M 编辑对、27M 图像-实体对),用于从零训练 3B/6B 多模态扩散模型。与以往按任务孤立优化数据的方法不同,本框架以能力依赖为中心组织数据设计与调度,实现生成能力的协同进化。
实验
实验设计
论文构建了 capability-driven data infrastructure,通过三个专用数据引擎分别构建文本-图像对齐、图像间变换和图像-知识关联的监督信号,并用 caption experts 对齐多任务监督。训练采用 multi-stage curriculum:从 256px T2I 预训练逐步过渡到 512px/1024px 的 T2I 与编辑联合训练,共 5 个阶段,遵循能力依赖顺序。最后使用 capability-aware evaluation 进行 gap 检测和重采样,形成闭环。实验训练了两个从头开始的模型(3B 和 6B),在 CPI-Bench 上做定量评估,并在多样 T2I 与编辑场景进行定性评估。
关键发现
- 模型展现广泛视觉覆盖与多样渲染能力,跨生成任务(T2I、编辑)的迁移有效。
- 能力依赖顺序的课程设计对最终泛化能力至关重要:先建立 text-image grounding,再引入 inter-image transformation 和 image-knowledge association,比孤立优化各任务数据更高效。
- 数据规模达到 440M T2I 图像、120M 编辑对和 27M 图像-实体对,支撑了通用图像生成模型。
与基线对比
摘要未给出具体基线数值,但强调传统 pipeline 往往孤立优化各任务数据集,忽略能力间依赖关系。本框架通过 共享 caption 对齐 和 课程调度 建立跨任务监督,并利用 capability-aware evaluation 动态调整数据分布,预期在综合生成能力上优于单任务优化方法。定量结果需参考 CPI-Bench 上的具体分数,论文中未展示,故无法做数值级对比。
行业影响
落地场景
该工作可直接支撑生成式视觉平台、电商商品图生产、在线广告创意工具与知识配图系统。其多任务能力(文生图、图像编辑、实体对齐)适合作为统一底座,服务需要批量生成并快速迭代视觉内容的业务。
商业价值
- 降本:单一模型覆盖 T2I、编辑、知识关联,减少多模型维护与数据标注成本;能力驱动数据筛选提升样本效率,降低训练开销。
- 体验提升:多阶段课程与闭环节点改善生成多样性、编辑一致性与视觉覆盖,直接提升用户留存与转化。
- 增收:更高吞吐与自动化程度支持按量计费的 API 服务,或赋能自有产品增值功能。
接口与集成
可拆分为三个组件嵌入现有 stack:
- 数据引擎层:对接数据湖 / 标注管线,输出结构化 supervision(如
text-image pairs,edit pairs,entity-image pairs)。 - 课程调度器:作为训练编排插件,与 PyTorch / JAX 训练循环协作,按能力依赖顺序送入数据。
- 能力评估模块:通过 CPI-Bench 等基准做在线回归,触发 gap-aware 重采样。
具体落地 use case:
- 电商场景:全球电商平台利用该框架统一驱动商品图生成、背景替换/风格编辑、商品实体与知识库对齐(如面料类型与图像关联),减少人工拍摄修图成本,提升 listing 上架速度。
- 内容平台:社交媒体 / UGC 平台使用其编辑能力实现用户图片的一键风格化、对象移除或增补,同时文生图引擎生成配图,知识关联提升搜索与推荐标签质量。
局限
- **评估基准覆盖不足**:论文仅在 **CPI-Bench** 上提供定量结果,未与 **GenEval**、**T2I-CompBench**、**EditBench** 等主流基准对比,难以全面反映模型的通用生成与编辑能力。CPI-Bench 可能由作者构建,其设计偏向于验证 capability-driven 数据管线,存在过拟合自身评估目标的风险。此外,定性评估仅展示样例,缺少用户研究或自动指标(如 CLIP Score、FID)报告,难以量化实际性能差异。应补充独立基准测试和人类偏好评估以增强结论可信度。
- **数据引擎规则与课程策略的泛化性**:框架依赖专家定义的分层 taxonomy、过滤规则和多阶段课程,这些设计在特定大规模数据下有效,但迁移到新领域(如视频生成、3D 生成)时需大量人工调整。课程阶段划分基于依赖顺序的经验假设,缺乏自动化搜索或理论保证,可能导致次优的学习顺序。此外,capability-aware 评价的循环可能引入偏差:针对评估漏洞的重采样仅在评估集上优化,模型可能过拟合特定 gap,而不是真正提升能力。需要更系统的消融实验来验证各组件贡献。
- **训练成本与可复现性问题**:训练 3B 和 6B 扩散模型涉及 **440M 图像**、**120M 编辑对**、**27M 实体对**,计算资源开销极大,但论文未报告 GPU 小时数、碳排放或详细超参数。同时,未声明是否开源数据、代码和模型权重,这使得独立复现和验证困难,制约了方法在社区中的影响和后续改进。建议提供更多训练配置细节和开源计划,便于其他研究者构建类似系统。