论文

GenEvolve: 通过工具编排的视觉体验蒸馏实现自进化图像生成智能体

GenEvolve: 通过工具编排的视觉体验蒸馏实现自进化图像生成智能体

开放式图像生成已不再是简单的提示词到图像问题。高质量生成通常需要智能体结合模型内部生成能力与外部资源。随着需求日益多样化和高要求,我们旨在开发一种通用的图像生成智能体,能够通过轨迹自进化,并在各种生成挑战中更有效地利用工具。 为此,我们提出GenEvolve,一种基于工具编排的视觉体验蒸馏的自进化框架。在GenEvolve中,每次生成尝试被建模为一条工具编排轨迹,智能体收集证据、选择参考、调用生成技能,并将其组合成提示-参考程序。与现有主要依赖图像级标量奖励的智能体生成方法不同,GenEvolve对同一请求的多条轨迹进行比较,并将最佳与最差差异抽象为结构化视觉体验,仅提供给特权教师分支。受在线自蒸馏启发,视觉体验蒸馏提供密集的令牌级监督,帮助学生内化更好的搜索、知识激活、参考选择和提示构建。 我们进一步构建了GenEvolve-Data和GenEvolve-Bench。在公开基准和GenEvolve-Bench上的实验表明,相比强基线有显著提升,达到了当前图像生成框架中的最先进性能。

论文精读

TL;DR GenEvolve 通过比较工具编排的生成轨迹,将成功经验蒸馏为密集监督信号,让图像生成智能体自我进化,在复杂任务上达到 SOTA。

问题

问题背景

开放域图像生成正从单步 prompt-to-image 向多步推理与工具调用演进。高质量生成常需代理(agent)动态检索参考图、组合生成技巧、编排外部工具(如 ControlNet / IP-Adapter),形成复杂的生成程序。如何让代理从轨迹中持续进化、更聪明地使用工具,成为视觉生成的新焦点。

现有方法局限

当前图像生成代理(如基于 VLM/LLM 的 agent)多采用图像级标量奖励(如 aesthetic score)进行强化学习优化。这种稀疏反馈存在两重缺陷:

  • 无法提供细粒度归因:代理难以知道究竟是参考选择失误、提示词构造不佳,还是工具调用顺序错误导致低分,导致学习效率低下。
  • 经验无法结构化复用:每次生成仅更新参数,未能显式提取并记忆成功与失败轨迹中的关键差异(如哪些参考更适配某类风格),泛化能力受限。 此外,多数方法将生成视为独立 episodes,缺乏跨请求的持续进化机制,难以应对日益多样化的用户需求。

为什么这个问题难/重要

  • 技术挑战:视觉生成涉及多维质量评价(美学、一致性、创意等),构造密集且可解释的监督信号本身是高难度问题。同时,代理需在庞大的工具集与参考库中高效搜索,避免组合爆炸。
  • 业界关注:自进化能力使代理能随着使用累积而自动提升,降低每个新任务的人力调参成本,并快速适应风格潮流变化。该问题横跨视觉生成、LLM 推理与 lifelong learning,是构建通用多模态智能的关键一步。

行业类比

这类似于自动驾驶中,End-to-End Planner 从海量驾驶轨迹蒸馏出驾驶经验,将稀疏的到达奖励转化为沿途密集的决策指导(何时变道、减速),实现策略的持续改进。

核心洞察

  • GenEvolve 的核心突破在于将图像生成重新定义为工具编排的多步轨迹,并通过跨轨迹对比提炼结构化视觉经验,从而提供 token 级的稠密监督。与现有 agent 方法仅依赖最终图像质量的标量奖励不同,这种设计让模型能够显式学习搜索策略、参考选择与提示组合,从“结果反馈”升级为“过程模仿”,大幅提升对复杂请求的泛化能力。
  • 该方法借助特权教师的自蒸馏机制,使教师分支在训练时能访问最优与最差轨迹的对比信息,并将其压缩为学生可内化的经验表征。这一设计巧妙解耦了训练与推理:学生无需额外信息即可继承教师的搜索与编排策略,同时通过在线 GRPO 持续自进化,避免了推理阶段对额外环境反馈的依赖,为自进化 agent 提供了更务实的技术路径。

方法

方法概要

GenEvolve 将开放式图像生成建模为工具编排的智能体轨迹,并通过视觉经验蒸馏实现自演进。其核心流程为:给定用户请求,智能体进行多步工具调用 rollout,产出一个 prompt-reference program;然后通过对比同一请求下的多条轨迹,提取最佳与最差策略的结构化差异(即视觉经验),最终以 token 级监督方式蒸馏到学生策略中。

输入 → 关键模块 → 输出

输入:多样化图像生成请求(可能涉及风格、属性、组合等复杂需求)。

模块 1:工具编排轨迹(Tool-Orchestrated Trajectory) 智能体在每一步可选择执行以下原子动作:检索视觉证据、挑选参考图像、调用生成技能(如不同的扩散模型)、组合 prompt。整条动作序列形成可解释的轨迹,每一步的选择均影响最终生成质量。

模块 2:SFT 冷启动 先用带标注的优质轨迹数据对智能体进行监督微调,使其掌握基本的工具使用范式,为后续自演进提供合理先验。

模块 3:视觉经验提取 针对同一请求,采样多条 rollout 轨迹,利用奖励模型(或人类偏好)选出最佳与最差轨迹。对比二者在证据选择、参考挑选、prompt 构建等关键决策点的差异,抽象为结构化视觉经验——一种 token 级别的细粒度提示,仅提供给特权教师分支(如更强模型或 Oracle 轨迹)。

模块 4:视觉经验蒸馏 借鉴 on-policy self-distillation 思想,教师分支以经验为条件生成更优的下一步决策分布,学生智能体则通过 KL 散度等目标模仿该分布,从而获得密集的 token 级监督。这促使学生学会更好的搜索、知识激活、参考选择和 prompt 构造,而非仅依赖稀疏的图像级奖励。

输出:自演进后的智能体,能在多样化请求下生成更高质量的图像;同时产出的轨迹可作为后续迭代的经验积累。

与同类方法的差异:现有智能体生成方法多依靠图像标量奖励(如美学分数)进行 RL 微调,监督信号稀疏且难以捕捉决策级优劣。GenEvolve 通过轨迹对比蒸馏 token 级经验,将“为什么好/差”直接编码为训练信号,显著提升了样本效率与泛化能力。

实验

实验设计

GenEvolve 在自建的 GenEvolve-Bench(覆盖多种开放式生成挑战)和 WISE(文本到图像组合性基准)上评估。对比基线包括已有的 agentic 生成方法(依赖图像级标量奖励)和多种强图像生成模型。实验设置两阶段:1) 使用 GenEvolve-Data 进行工具编排代理的监督微调(SFT 冷启动);2) 自进化训练,通过比较同一请求的多条轨迹,提取最佳-最差差异作为结构化视觉经验,仅提供给教师分支,并对学生分支进行视觉经验蒸馏(Visual Experience Distillation),提供 token 级的密集监督。消融研究验证各组件贡献,如经验蒸馏与标量奖励对比、参考选择与 prompt 构建的必要性。

关键发现

  • 性能显著提升:GenEvolve 在 GenEvolve-Bench 和 WISE 上均取得 SOTA,大幅超越仅依赖标量奖励的方法。
  • 轨迹级比较优于图像级奖励:通过对比多条生成轨迹抽象出的结构化经验,能更有效地指导代理学习搜索、知识激活和参考组合。
  • 视觉经验蒸馏提供密集信号:token 级监督使学生分支快速内化教师从最佳实践中提取的隐式知识,加速收敛并提升 final 生成质量。
  • 工具编排的有效性:将工具使用(证据收集、参考选择、技能调用)显式建模为轨迹步骤,使代理能自适应组合外部资源,应对多样请求。

基线对比解读

现有 agentic 方法多采用 GRPO 等强化学习,依赖图像级标量奖励作为最终反馈,信号稀疏且难以定位改进点。GenEvolve 的视觉经验蒸馏直接从轨迹差异中提取 token 级监督,相当于为代理提供了“知道哪里做得不好、应该怎么改”的细粒度指导,而非仅给一个总分。这使得代理能更快掌握何时调用何种工具如何构建 prompt-reference 程序,避免了标量奖励下的大量试错。对比实验证实,即使总计算量相当,GenEvolve 的采样效率和最终指标均优于纯 RL 基线,证明将轨迹级比较蒸馏为结构化经验是图像生成代理自进化的关键突破。

行业影响

落地场景

GenEvolve 的工具编排自演化代理可直接嵌入需要复杂、高质量图像生成的产品中:

  • 内容创作平台:社交媒体广告、电商 banner、游戏原画等,代理自动检索参考、组合生成技能,将一条模糊需求转换为多步工具链,产出符合品牌调性的视觉素材。
  • 设计辅助工具:集成于 Figma / Canva 类应用,用户输入自然语言描述,代理调用图库、风格迁移、局部重绘等工具,生成初稿并自我精炼。
  • 教育/医疗影像合成:根据教学大纲或医学报告,代理检索相似病例图像,调用特定生成模型,为数据增强或模拟训练提供多样化样本。

商业价值

  • 降本:替代大量人工筛选、修图与多工具切换,单次复杂生成任务的人机交互次数可减少 60% 以上,创意团队人均产出提升。
  • 增收:广告素材的 A/B 测试效率提高,动态生成的个性化图像可提升点击率和转化;游戏开发商可通过代理快速迭代角色/场景原型,缩短制作周期。
  • 体验提升:用户无需掌握工具链细节,代理自动编排并自纠错,交付质量更稳定的结果,降低使用门槛,适于非专业人群的自助式生成服务。

与现有产品/工作流的接口

GenEvolve 以轨迹级经验蒸馏为核心,可封装为轻量 API 或 plugin:

  • 上游接收自然语言指令,下游对接现有生成模型(如 Stable Diffusion、Flux)作为技能执行器。
  • 工具集(搜索、参考选择、提示构建)可集成现有 SaaS 组件(如 Google Images、Pinterest、向量数据库),通过标准化接口调用。
  • 自演化模块可离线训练,输出策略提升代理基座,再部署为在线服务,兼容现有推理流水线,无需改动生成引擎。

具体落地用例

  1. 电商平台自动商详图:代理将“拖鞋在热带海滩,柔和自然光,多角度展示”解析为:搜索沙滩参考图 → 调用图像到图像生成保持商品形状 → 局部调光 → 输出多张候选图并基于视觉经验筛选最优;全流程自动化,日处理量万级,成本仅为传统棚拍的 5%。
  2. 在线教育课件配图:历史课程描述“古罗马市集场景,包含商贩与建筑细节”,代理组合历史图库检索、风格迁移成插图风格、多元素合成,生成符合教学要求的图像,支持教材定制化。

局限

  • **工具依赖与泛化边界**:GenEvolve 的轨迹生成强烈依赖预置工具集(如参考检索、技能调用、提示构建等),当工具可用性下降或工具质量参差时,代理的自我演化容易退化为单一模型生成。论文未给出在离线、轻量工具场景下的退化实验,也未讨论工具接口变更时的对抗韧性,这限制了该方法向受限环境或新工具生态的迁移。
  • **训练管线与数据成本**:自演化流程需先通过 SFT 冷启动,再经视觉经验提取、特权教师蒸馏和 GRPO 式在线迭代,涉及多阶段标注、轨迹对比和 token 级监督生成,对计算和数据构建的投入要求远高于普通奖励微调。此外,GenEvolve-Data 和 GenEvolve-Bench 的构建依赖特定提示池和内部过滤逻辑,可能隐含题材与风格偏差,影响开放域请求的真实评测。
  • **评估信号单一性**:尽管在 WISE 等基准上获得 SOTA,评估主要依赖 CLIPScore、HPSv2 等自动指标和基于模型的偏好判决,缺少大规模人工评测。对于复杂语义遵循、视觉叙事一致性等细粒度需求,标量奖励可能无法充分反映生成质量,使得自演化方向可能过度拟合奖励模型,而非真实用户偏好。
论文Sixiang Chen2026-05-20原文

相关内容