论文

AutoRef:面向智能体化多参考图像生成的 Harness 优化

AutoRef:面向智能体化多参考图像生成的 Harness 优化

近期图像生成模型可将多张参考图组合成一张新图像,但 多参考图像生成 仍具挑战:模型可能遗漏或重复参考图中的主体,或把多个主体拼接得不自然。近期工作提出图像生成智能体,它组合图像生成模型、推理模型与 harness——一种可执行程序,规定参考图如何解读、生成如何执行、输出如何诊断以及最终图像如何选出。 在多参考生成中,各参考图角色不同,输出需同时满足对每张参考图的保真度与整图自然度等多项标准,因此 harness 从参考图处理到输出诊断都有改进空间,既难以预测改动带来的收益,手工设计也相当困难。为此我们提出 AutoRef:在冻结两个模型的前提下,由 coding agent 迭代重写 harness 代码,并把「反馈用于提出候选」与「用于挑选候选」的任务分离,在选择任务上从高分 harness 组成的 beam 继续搜索。 由此得到的 AutoRef-Harness 将开放权重的 FLUX.2 [klein] 4B 在 MultiBanana 基准留出四参考任务上从 5.72 提升至 7.37,匹配或超越 Nano Banana Pro、GPT-Image-1.5 等专有模型;且无需重新优化,当生成器、参考图数量、基准、评估器或推理模型与搜索时不同,同一 harness 仍能带来提升。

论文精读

TL;DR AutoRef 用编码代理自动优化多参考图像生成的 harness 代码,在 MultiBanana 上把 FLUX.2 4B 从 5.72 提至 7.37,超越专有模型,且可跨模型/基准迁移。

问题

问题背景

多参考图像生成(multi-reference image generation)是当前生成模型的重要分支:给定多个参考图像,模型需融合其中的主体、风格或背景,生成一致的新图像。业界正探索 agentic generation 通过 harness 编排生成、诊断与选择流程。

现有方法局限

  • 手工设计的 harness 难以系统优化:多参考生成中,参考图像角色各异(主体/背景/风格),输出需同时满足多参考保真度与整体自然度,harness 的参考解释、生成策略、诊断、选择等环节均可调整,但人工很难预测哪处改动带来多大收益。
  • 已有图像生成代理(如 GEMS、IPR、Idea2Img)的 harness 依赖专家经验,性能方差大;底层生成模型(如 FLUX.2 4B)在多参考场景下常出现主体遗漏、重复或不自然拼贴。

为什么这个问题难/重要

  • 技术挑战:本质是多目标优化,需在多个参考之间的保真度与整体自然度之间权衡;harness 搜索空间离散、反馈信号(评估器)昂贵且噪声大,无法直接用梯度优化。
  • 业界关注:多参考生成是 AIGC 实用化的关键能力,直接影响个性化内容合成、创意设计、虚拟试穿等场景的落地效率。

行业类比

类似 AutoPrompt 或 AutoML 中的 pipeline 搜索:当单个模型输出不稳定时,通过优化外部控制流(harness)而非重新训练模型,以更低成本提升组合生成质量。

核心洞察

  • AutoRef 的核心思想是将 agent 中的 harness 视为可优化代码,通过 coding agent 自动改写来提升多参考图像生成性能,而不是依赖人工设计或固定流程。与以往人工编写 harness 或使用固定生成-诊断-选择流程的方法相比,AutoRef 将优化空间扩展到 harness 的全部环节(参考解释、生成、诊断、选择),能够系统性发现人类难以预料的改进点。论文在 MultiBanana 基准上将 FLUX.2 4B 的分数从 5.72 提升至 7.37,证明自动搜索 harness 可以显著超越手工设计。
  • AutoRef 在 harness 搜索中分离反馈任务和选择任务,并用束搜索保留多个候选,有效避免了多参考生成任务中的过拟合和局部最优。与贪心搜索或仅基于单一验证集反馈的方法不同,这种设计使优化过程更稳健,找到的 harness 具有更强泛化性。实验表明,优化得到的 AutoRef-Harness 无需重新优化即可迁移到不同生成器、参考数量、基准和评估器,说明其捕捉到了通用的多参考生成策略,而非针对特定配置的过度调参。

方法

输入与目标

AutoRef 接收多参考图像及文本指令,目标是自动优化 agentic 图像生成系统中的 harness(可执行程序,定义参考解释、生成、诊断与选图流程)。初始输入还包括一个初始 harness 代码或人类手写 harness 池,以及固定的图像生成模型(如 FLUX.2 [klein] 4B)与推理模型(均冻结参数)。

关键模块

  1. Proposer Coding Agent:一个编码智能体,根据反馈任务上的表现诊断当前 harness 缺陷,迭代重写 harness 代码,生成新的候选 harness。
  2. 任务分离机制:将评估任务分为两类——反馈任务(用于指导提案,提供具体失败模式)与选择任务(用于候选排序,避免过拟合反馈任务)。
  3. Beam Search 搜索:在每一轮迭代中,保留选择任务上排名最高的 top-k harness 作为 beam,下一轮从 beam 出发继续生成候选,而非贪心单点搜索。
  4. Harness 内部结构:优化后的 harness 通常包含参考图像 grounding、多样化草稿生成、失败诊断与最终选图等子模块,编码代理可重新组合或改写这些组件。

输出

输出为优化后的 AutoRef-Harness,该 harness 在执行时接收多参考图像和文本,输出满足多条件(如每个参考的保真度、整体自然度)的最终图像。

差异点

与依赖手工设计或简单贪心搜索的 harness 优化方法(如 Meta-Harness)不同,AutoRef 通过分离反馈与选择任务、结合 beam search 持续搜索,在不修改模型权重的前提下显著提升多参考生成性能。

实验

实验设计

AutoRef 在 MultiBanana 基准上评估多参考图像生成,以 FLUX.2 [klein] 4B 作为开放权重生成器,并固定生成模型与推理模型。搜索时,将任务分为反馈任务(提供改进信号)与选择任务(基于 beam search 筛选候选 harness),由 coding agent 迭代改写 harness 代码。由此发现 AutoRef-Harness。

关键发现

AutoRef-Harness 在 held-out 四参考任务上将 FLUX.2 4B 的得分从 5.72 提升至 7.37,匹配或超过 Nano Banana Pro 与 GPT-Image-1.5。且该 harness 无需重新优化即可迁移至不同生成器、参考数量、基准、评估器与推理模型,显示较强泛化性。

与基线对比

相比人类手写 harness,AutoRef 避免了手工设计的不稳定性;相比 Meta-Harness 与 Greedy Search,其任务分离与 beam search 机制可能更有效防止过拟合,在 held-out 任务上表现更优。这为 agentic 图像生成系统的 harness 自动化设计提供了新范式。

行业影响

落地场景

多参考图像生成在电商、广告、内容创作等领域有直接需求。例如电商平台将多个商品参考图合成到同一场景(家具搭配、服装组合),内容平台根据多个角色参考生成漫画或海报。AutoRef 优化的 harness 可嵌入此类产品后端,在保持底层模型不变的前提下提升合成质量与一致性。

商业价值

  • 降低试错成本:手工设计 harness 依赖专家经验且性能波动大,AutoRef 自动搜索将 harness 优化过程自动化,减少人工迭代与 prompt 调试开销。
  • 提升生成合格率:在 MultiBanana 基准上,AutoRef-Harness 将 FLUX.2 4B 从 5.72 提升至 7.37,意味着相同算力下可产出更多可用图像,直接降低单张合格图的成本。
  • 模型无关的迁移性:同一 harness 在不同生成器、参考数量、评测器上仍有效,企业一次优化可复用到多个产品线或切换底层模型,避免重复投入。

与现有工作流的接口

AutoRef 优化产物是可执行代码,可作为编排层插入现有图像生成 pipeline:调用现有生成模型 API(如 FLUX.2)、推理模型和诊断模块,不改变已有模型权重。实际集成时,可将 AutoRef 作为离线搜索工具,针对特定任务集定期更新 harness;线上服务直接加载优化后的 harness 代码执行生成与选择逻辑。对于已使用 agentic 图像生成框架的团队,AutoRef 可作为插件替换手写 harness,且搜索过程无需微调模型,降低了部署门槛。

局限

  • **计算开销巨大**:AutoRef 在搜索阶段需要不断调用编码代理生成候选 harness,并在多个反馈/选择任务上评估,同时使用 beam search 保留多个候选进一步迭代。每次评估都包含多次图像生成与 VLM 诊断,相比单次推理成本高数个量级。论文未明确给出搜索总 token 或 GPU 小时数,但从方法设计看,搜索过程可能需数小时至数天,限制了在资源有限环境或频繁变动的任务中的实用价值。
  • **优化结果可能过拟合搜索所用的基准与评估器**:尽管论文展示了在改变生成器、参考数量、基准、评估器和推理模型时的迁移性,但所有实验仍围绕多参考图像生成这一狭窄任务,且 MultiBanana 的评估指标(可能侧重身份保持和自然度)可能驱动 harness 偏向特定策略。对于更开放或主观的图像生成场景(如复杂文本引导、风格迁移),AutoRef-Harness 的有效性未经充分验证。
  • **与底层生成模型能力绑定,且 harness 可解释性差**:AutoRef 保持模型冻结,仅优化编排逻辑,因此无法突破生成模型本身的缺陷(如空间推理、细粒度属性绑定)。搜索得到的 harness 代码往往包含大量启发式规则与条件分支,可读性和可维护性低,难以让人理解为何有效,也增加了调试和进一步人工改进的难度。
论文Yuta Oshima2026-09-28原文

相关内容