DataEvolver: 自我进化的多智能体数据构建用于文本丰富图像生成
文本丰富图像生成是图像生成中最具挑战性的场景之一,因为模型需同时生成视觉逼真的图像和清晰、语义对齐、布局一致的文本。现有数据流水线通常遵循静态的“爬取-过滤-冻结”范式:收集候选样本,单次过滤后冻结接受的数据用于训练。然而,被拒绝的样本通常被丢弃,尽管它们常包含有用的失败信号(如 OCR 错误、语义不匹配)。这导致后续构建轮次可能重复相同的失败模式。 针对这些局限,我们提出 DataEvolver——一个自我进化的多智能体框架用于文本丰富图像数据构建。DataEvolver 将数据构建视为反馈驱动的构建策略进化:Retriever 收集候选样本,Verifier 分配质量分数和拒绝原因,Critic 将轮次级反馈总结为语义反馈,Generator 通过目标合成补全覆盖不足的区域。更新后的反馈记忆指导下一轮构建。 在文本丰富图像生成基准上的实验表明,在相同数据预算下,DataEvolver 产生比固定数据集基线更有用的训练数据。在 PixArt-alpha 的 0.75M 规模下,DataEvolver 在 TextScenesHQ 上将 OCR-F1 提升 85.3%,在 LongTextBench 上提升 35.3%,且改进在另一个下游生成器 Show-o2 上同样一致。这些结果表明,被拒绝的样本可为改进文本丰富图像数据构建提供可操作的反馈。
论文精读
TL;DR DataEvolver 将文本丰富图像的数据构建建模为多智能体自演进过程,利用被拒样本中的 OCR 错误等失败信号驱动迭代策略,在同等数据预算下大幅提升生成文本的准确率。
问题
问题背景
文本丰富的图像生成(Text-rich Image Generation)是视觉生成领域的核心挑战之一。模型需同时输出视觉真实的图像与清晰可读、语义对齐、布局合理的文字,这直接决定了生成内容在广告、UI 原型、教育材料等场景中的实用性。
现有方法局限
当前数据管线普遍采用**静态“爬取—过滤—冻结”**范式:从网络爬取候选样本,通过一次性质量审核后,将入选数据冻结为训练集。被拒绝的样本直接丢弃,即使它们富含 OCR 错误、字体畸变或语义不匹配等失败信号。
- 缺乏反馈回路:过滤策略固定,后续构建轮次无法从过往失败中学习,容易重复同类错误,导致数据效率低下。
- 忽略负样本价值:丢弃的数据中包含关键失败模式,本可作为改进检索与合成策略的明确信号,却被浪费。
为什么这个问题难且重要
- 技术挑战:文字渲染需联合优化视觉真实性与文本语义,二者常相互制约。高质量标注数据稀缺且昂贵,而失败数据中的信号未被利用,使得模型难以覆盖长尾文字场景。
- 业界关注度:AIGC 正加速渗透至商业设计、自动排版等领域,能否可靠生成文字已成为衡量模型实用性的硬指标。因此,提升数据构建效率和质量对降低训练成本、加速产品迭代至关重要。
行业类比
这类似自动驾驶的数据闭环优化:不再丢弃罕见场景的误检样本,而是将其注入主动学习管道,驱动数据采集与标注策略演进,从而系统性提升模型的长尾鲁棒性。
核心洞察
- 将数据构建从一次性静态过滤转变为基于反馈的策略进化,使被拒样本从废弃物变为改进信号源。传统方案在过滤后直接丢弃低质量样本,而 DataEvolver 通过 Verifier 对拒绝原因(如 OCR 错误、语义不匹配)进行结构化诊断,再由 Critic 提炼为语义级反馈,用于更新检索和生成策略。这种闭环设计让后续轮次主动规避已知失败模式,而非简单重复过滤,从根本上改变了数据构建的优化范式。
- 多智能体分工协作形成自我迭代的数据飞轮,在固定数据预算下显著提升模型对文本渲染的鲁棒性。 Retriever、Verifier、Critic、Generator 各司其职,分别负责候选召回、质量评估与原因标注、策略总结、以及覆盖不足区域的定向合成。与仅依赖固定数据集或单步过滤的方法相比,该框架能持续挖掘困难样本中的学习信号,实验中 0.75M 数据规模下 OCR-F1 指标提升最高达 85.3%,且收益可跨 PixArt-α 与 Show-o2 两个下游模型迁移,表明其通用性不只是特例适应。
方法
整体流程
DataEvolver 将文本丰富图像数据的构造视为一个 反馈驱动的迭代策略优化 过程。输入为原始候选池和初始构造策略,通过四个多智能体角色循环协作,最终输出逐轮增强的高质量训练数据集。
关键模块
- Retriever(检索代理):根据当前 反馈记忆 中的语义需求,从候选池中检索相关样本作为原始候选。
- Verifier(验证代理):对每个候选样本进行多维度质量评分(如 OCR 准确度、语义对齐度、布局合理性),并分类拒绝原因(如 OCR 错误、语义不匹配)。同时为通过样本生成质量标签。
- Critic(批评代理):汇总当轮所有验证反馈,通过大语言模型总结为 语义级反馈,更新到长期 反馈记忆 中。该记忆捕获高频故障模式及缺失的文本-视觉组合。
- Generator(生成代理):针对 Critic 识别出的覆盖不足区域,调用文本到图像生成模型进行 定向合成,生成补充样本,扩增数据分布的多样性。
迭代与输出
每轮结束后,更新后的反馈记忆指导下一轮 Retriever 的查询策略,使构造过程自我进化。多轮循环后,输出一个动态筛选与合成结合的高质量文本丰富图像数据集。
实现要点
- Verifier 可基于多模态大模型(如 GPT-4V)或轻量级评分器,输出结构化反馈。
- Critic 利用大语言模型将大量实例级拒绝原因归纳为高层语义缺陷类别。
- Generator 的合成过程可结合 ControlNet 等技术,精确控制文本渲染和布局。
与同类方法的差异
区别于传统的 静态爬取-过滤-冻结 范式,DataEvolver 将 被拒样本中的失败信号 转化为可操作的反馈,形成持续优化的数据构造闭环,显著提升文本渲染图像生成的 OCR-F1 指标,且跨生成模型可迁移。
实验
实验设计
DataEvolver 在 0.75M 规模的 PixArt-α 生成器上验证数据构建质量,与固定数据集的静态爬取-过滤基线对比。实验从通用候选池出发,通过 Retriever–Verifier–Critic–Generator 多智能体闭环迭代优化数据选择与合成策略。评估聚焦文本渲染质量,使用 OCR-F1(文本识别准确率)作为核心指标,在 TextScenesHQ(场景文本)和 LongTextBench(长文本)两个基准上测试。此外在 Show-o2 上进行迁移实验,检验数据效益的泛化性。消融实验分析了各智能体组件的贡献,并考察不同数据预算下的缩放趋势。
关键发现
- OCR-F1 大幅领先:在 0.75M 预算下,DataEvolver 相较最强静态基线,TextScenesHQ 提升 85.3%,LongTextBench 提升 35.3%,表明反馈驱动进化有效克服了传统管线丢弃失败样本导致的缺陷重复。
- 跨模型迁移:在 Show-o2 上同样取得一致增益,说明 DataEvolver 构造的数据质量不依赖特定下游生成器,具备通用性。
- 消融证据:Critic 总结的语义反馈和 Generator 的定向合成协同作用,缺失任一组件均会导致性能下降,验证了多智能体协作的必要性。
- 缩放性:随着数据预算增加,DataEvolver 的优势持续扩大,显示出良好的数据效率,使有限标注或检索预算下的高质量文本图像生成成为可能。
与基线对比的深度解读
传统静态数据管线在单轮过滤后固化数据集,被拒样本中的 OCR 错误、语义不符 等失败信号完全浪费。DataEvolver 将这些信号转化为 轮次级反馈,驱动 Critic 提炼策略记忆,指导下一轮 Retriever 和 Generator 更精准地补全覆盖缺口。这种闭环进化使得数据分布动态适配下游生成器的薄弱区域,避免了重复采样同质化错误。相比仅增加数据量的粗暴做法,DataEvolver 以 同量级预算 获得显著更优的文本渲染质量,揭示了 数据智能 比 数据规模 更关键的现实工程启示:针对性地利用负样本反馈,可以指数级提升数据效用。
行业影响
落地场景
DataEvolver 直接服务于文本丰富图像生成(Text-rich Image Generation),应用场景覆盖电商商品图生成、自动化海报与广告设计、信息图与图表制作、社交媒体视觉内容创作。凡是要求图像中嵌入文字且文字必须清晰、准确、语义对齐的业务,都可受益。该框架通过反馈驱动的自演进数据构建,使生成模型在渲染长文本、处理复杂布局时更可靠,降低人工校验成本。
商业价值
传统数据管线采用“爬取-过滤-冷冻”模式,大量被拒样本因 OCR 错误或语义不匹配而被丢弃,浪费了潜在反馈信号。DataEvolver 将失败样本转化为建设性失败信号,通过多智能体(Retriever / Verifier / Critic / Generator)闭环迭代,显著提升同等数据预算下的模型表现。在 PixArt-α 上,0.75M 规模即比最强基线提升 OCR-F1 达 85.3% (TextScenesHQ) 和 35.3% (LongTextBench),且可迁移至 Show-o2。这直接转化为:1)降本——减少无效数据采集与人工标注开支;2)增效——让相同数量训练数据产出更高精度模型,加速产品迭代;3)体验提升——最终用户生成图像的可读性大幅增强,降低返工和投诉。
与现有产品 / 工作流的接口
DataEvolver 定位为数据构建策略层,与具体下游生成模型解耦。它可以作为 Data Engine 的一个可插拔模块,接入现有的文生图(Text-to-Image)训练流水线:
- 上游:对接已有的候选数据池(如 LAION、自定义爬取库),利用 Retriever 查询并召回样本。
- 中游:通过 Verifier(可集成已有 OCR 引擎、视觉语言模型)进行质量评估与归因,输出拒绝原因。
- 下游:Critic 产出的语义反馈(semantic feedback)可直接转化为检索与生成策略的更新,指导下一轮数据构造,而不需修改生成模型架构。
- Generator 可调用现有合成模型(如 ControlNet/Stable Diffusion)进行覆盖不足区域的定向生成补充。
具体落地 use case
- 电商视觉生成平台:自动生成带促销文案、价格、品牌标识的商品海报。要求金额、日期等信息绝对准确。DataEvolver 构造的训练数据集能强化模型对数字和专有名词的渲染能力,减少人工二次修图。
- 社交媒体内容创建工具:用户输入文案,AI 生成风格化图片。需保证长文本不会出现乱码、错位。通过 DataEvolver 的多轮反馈机制,模型可学会规避常见字形断裂与语义错配,提升模板化内容的直出率。
局限
- **迭代成本与可扩展性**:DataEvolver 需要多轮构建,每轮都调用 OCR 引擎和语义模型等外部模块进行逐样本校验,计算开销远高于静态数据管线。论文未提供资源消耗对比或扩展到百万级以上数据时的效率分析,反馈经验库的累积和查询在大规模场景下可能成为瓶颈。
- **Verifier 偏差与错误传播**:数据质量完全依赖 Verifier 的评分和拒因标注,当 Verifier 本身出现 OCR 漏检或语义误判时,错误会输入 Critic 形成有偏的反馈,并在后续迭代中放大。论文仅通过集成多个判别器来提升可靠性,但缺乏对 Verifier 故障模式及容错机制的深入分析。
- **下游模型泛化验证有限**:主要实验以 PixArt-α 为核心下游生成器,Show-o2 仅作迁移验证,未覆盖更广泛的架构(如 DiT、自回归生成器)。不同生成范式对数据噪声的敏感性可能差异显著,因此 DataEvolver 构建的数据在不同模型上的增益普遍性尚需更多证据。