InterleaveThinker: 强化代理式交错生成
近期图像生成器在单图生成与编辑中展现出逼真的效果和指令跟随能力。然而受限于架构,它们无法实现交错生成(文本-图像序列),这在视觉叙事、引导和具身操作中至关重要。即便是最新的开源统一多模态模型(UMMs)也表现有限。 本文提出InterleaveThinker,首个多智能体流水线,赋予任意现有图像生成器交错生成能力。首先,规划智能体组织图像-文本输入序列,指示生成器执行每步任务;随后批评智能体评估输出,识别偏离指令的样本,并细化指令以重新生成。为实施该流水线,我们构建了Interleave-Planner-SFT-80k和Interleave-Critic-SFT-112k进行格式冷启动,再通过Interleave-Critic-RL-13k使用GRPO强化生成轨迹内的逐步指令修正能力。由于单次交错生成可能涉及超过25次生成器调用,优化整个轨迹不切实际,因此我们提出准确率奖励和逐步奖励,使单步强化学习有效指导全轨迹。 结果表明,InterleaveThinker显著提升多种图像生成器的性能。在交错生成基准上,它达到与Nano Banana和GPT-5相当的水平。令人惊讶的是,它还大幅增强了基础模型在推理基准上的表现,例如在4步FLUX.2-klein上,WISE和RISE指标取得显著提升。
论文精读
TL;DR InterleaveThinker 通过规划-评论多智能体与单步强化学习,首次让任意图像生成器具备交错生成能力,性能比肩 Nano Banana 和 GPT-5,并在推理任务中大幅提升。
问题
问题背景
当前图像生成模型在单图生成与编辑上已极为逼真,但工业界需要生成连贯的图文序列(interleaved generation),例如视觉叙事、分步教程或具身指令。然而,直接沿用单图生成器无法实现跨模态序列的自动规划与迭代。
现有方法局限
主流图像生成器(如扩散模型)的编解码架构天然只接受单一图像或文本输入,缺乏对多步图文序列的整体建模能力。最新开源**统一多模态模型(UMMs)**尝试融合理解与生成,但在交错生成任务上表现受限:它们通常依赖用户手动分解长序列指令,缺乏自动化的规划与质量评估,导致序列中后期步骤偏离语义、对象不一致,且无法有效纠错。此外,UMMs大多通过海量数据端到端训练,推理时生成轨迹不可控,难以集成外部生成器的强大先验。
技术挑战与业界关注
交错生成的核心难点在于长程依赖与组合爆炸:一次完整生成可能调用超过25次图像生成器,每一步的输出都会影响后续步骤,整条轨迹的全局优化计算量巨大;同时,需要评估每一步的生成质量并做出动态修正,这要求系统具备类似智能体(agent)的反思与重规划能力。业界对能够自动生成图文并茂的说明书、可视化问答、具身操作指引等应用有强烈需求,但现有方案要么闭源(如GPT-5),要么性能有限,缺乏一种轻量、即插即用的框架来赋能任意图像生成器。
行业类比
这类似于LLM智能体工作流中,通过引入Planner和Critic等多智能体协作,让原本只擅长单轮对话的模型完成复杂的多步推理任务;InterleaveThinker正是为视觉生成领域补上了这一“agentic”范式缺口。
核心洞察
- 通过解耦规划(Planner)与批判(Critic)智能体,实现与生成器架构无关的交替生成:现有图像生成器受限于架构,无法直接产生文本-图像交错序列,而最近的统一多模态模型(UMM)虽支持交替生成,但通常需要端到端重训练。InterleaveThinker 首次将规划与评价外置为可复用的多智能体管道,使得任何黑盒生成器无需内部改动即获得交错生成能力。Planner 负责解析输入序列并生成每一步的生成指令,Critic 则事后检测输出与计划的一致性,并重写指令以重试。这种“外挂式”设计不仅降低了适配成本,也为后续不同生成器的泛化提供了即插即用的框架。
- 提出 step-wise 奖励与 accuracy 奖励,将全局轨迹优化降维为单步强化学习:一次交错生成可能触发超过 25 次生成器调用,直接对完整轨迹做 GRPO 优化计算不可行。InterleaveThinker 将奖励塑造成对单步指令修正的评价,利用 accuracy 奖励衡量最终图像是否符合计划,step-wise 奖励评估修正指令的合理性,从而仅对 Critic 的单步决策进行 RL 训练。这种局部优化引导全局行为的方式,在相同实验条件下达到了端到端训练相当的交错生成性能,并大幅降低训练开销,为长序列多模态生成的高效对齐提供了一种可参考的奖励设计范式。
方法
多智能体流水线概览
InterleaveThinker 通过可插拔的多智能体流水线为任意图像生成器赋予交错生成能力,无需修改生成器自身架构。输入为多模态图文序列(如叙事步骤),输出为被校验过的连续图文序列。
关键模块与流程
1. Planner Agent(规划器)
- 解析用户输入,将其组织为结构化的步骤计划,明确每步操作类型(生成、编辑、文本输出等)。
- 生成标准化指令,驱动下游图像生成器逐步执行。
2. 图像生成器(可替换基座)
- 接收 Planner 的当前步指令,生成对应图像或文本。
- 本流水线支持任意现成生成器,如 FLUX 或扩散模型,并不绑定特定架构。
3. Critic Agent(批评器)
- 对生成器的每步输出进行评估,判断是否偏离计划指令(如内容不一致、风格错误)。
- 若检测到偏离,自动修正当前步指令,并触发该步的重新生成,直至通过评估或达到最大重试次数。
数据集与训练方案
- 格式冷启动 SFT:构建 Interleave-Planner-SFT-80k 和 Interleave-Critic-SFT-112k 分别训练 Planner 和 Critic 的指令遵循与评估能力,使其掌握统一交互格式。
- 强化学习增强:构建 Interleave-Critic-RL-13k,使用 GRPO 提升步骤级指令修正质量。
- 由于完整交错轨迹可能涉及超 25 次生成器调用,直接优化整条轨迹计算代价过高。
- 引入 accuracy reward(与计划的一致性)和 step-wise reward(单步修正的即时反馈),让 RL 仅优化单个修正步骤,却通过奖励设计将影响传播至整个生成轨迹。
输出与验证
每步经 Critic 把关后,最终序列中的图文在语义连贯性和视觉质量上均得到保障,整个过程无需人工介入。
与同类方法的差异
不同于统一多模态模型(UMM)依赖端到端架构直接生成交错序列的做法,InterleaveThinker 以 Agent 形式解耦规划与纠错,可在不改变基座生成器的前提下注入交错生成能力,并通过单步 RL 策略高效地引导全轨迹质量,计算开销远低于全轨迹优化方案。
实验
实验设计
InterleaveThinker 采用分阶段训练:首先使用自建的 Interleave-Planner-SFT-80k 与 Interleave-Critic-SFT-112k 进行格式冷启动有监督微调(SFT),再通过 Interleave-Critic-RL-13k 数据集和 GRPO 强化学习增量调优批评家。训练围绕“准确率奖励”与“逐步奖励”设计,使单步 RL 即可优化长达 25+ 生成器调用的完整交叠轨迹,避免端到端轨迹级优化的计算不可行性。评估覆盖交叠生成基准和推理基准,基础生成器包括 FLUX.2-klein 等模型。
关键发现
- 该多智能体管线首次为任意图像生成器赋予交叠生成(文本-图像序列)能力,无需改动底层架构。
- 在交叠生成基准上,InterleaveThinker 取得与 Nano Banana 及 GPT-5 相当的性能。
- 使用 4 步推理的 FLUX.2-klein 基础模型在 WISE 指标上从 0.47 提升至 0.73,RISE 从 13.3 提升至 28.9,说明规划-批评循环可显著增强推理类基准表现。
与基线的对比解读
与原生图像生成器(缺乏交叠能力)相比,InterleaveThinker 通过计划器-批评家架构灵活注入多步生成逻辑,避免了端到端统一多模态模型(UMMs)在交叠生成上的性能局限。批评家的反馈循环不仅纠正生成偏差,还使模型在需要逐步推理的场景中受益,这解释了在 WISE 和 RISE 上的异常提升——这类推理基准通常需要模型内在的“思考”链,而 InterleaveThinker 的外部批评机制恰好模拟了此过程。
行业影响
落地场景
InterleaveThinker 的多智能体交错生成能力,可直接融入内容创作平台(如 Canva、Figma、Adobe Firefly)、电商场景(商品多步使用教程图)、在线教育(交互式步骤示意图)、游戏与影视(分镜叙事板)及具身智能(操作步骤可视化)。它让任何图像生成器具备生成连贯图文序列的能力,而不仅是单图输出。
商业价值
- 降本增效:将原本需要人工编排的多步图文叙事自动化,缩短设计/编辑周期。例如,电商详情页的多步教程图可从单一 prompt 批量生成,节省摄影师与设计师工时。
- 体验升级:在社交媒体或教育产品中,用户可输入一个故事梗概,系统自动生成带图的章节式内容,提升沉浸感与互动时长,驱动订阅或广告收入。
- 模型能力延展:作为插件式 pipeline,直接复用现有图像生成器(如 FLUX、Stable Diffusion),避免重新训练大模型,保护存量投入。
与现有产品/工作流的接口
整个 pipeline 以 Planner Agent 解析输入序列,规划每一步的生成指令;Critic Agent 评估输出并修正指令,最终调用底层图像生成 API。集成时只需:
- 部署规划器与评论家模型(或通过 HF 端点调用);
- 配置目标图像生成器接口;
- 将现有 AI 创作工具的“单图生成”入口替换为交错生成接口,即可复用原有 UI 与权限体系。
具体用例
- 电商商品详情页自动化:用户上传商品主图,输入“展示开箱、组装、使用三步”,InterleaveThinker 生成带对应文本的 3 张连贯图片,直接嵌入商品描述模块,替代视频或实拍步骤图。
- 在线编程/STEM 教育:教学平台可将“如何搭建电路”的文本描述转换为图文交替的交互式卡片,每一步的图示由 Critic 校验是否准确反映电路连接,减少手动配图成本。
局限
- **计算成本与推理延迟**:交错生成轨迹可能包含超过 25 次图像生成器调用,即使采用单步 RL 和 step-wise reward 设计,训练和推理时的总计算量仍显著高于单图生成。大规模部署或实时场景下,多次调用生成器会带来较高延迟和资源消耗,限制了在低算力设备或高吞吐服务的应用。
- **依赖底层生成器能力**:InterleaveThinker 作为 Agent 流水线,性能上限受所选图像生成器的制约。若生成器在复杂指令遵循、文本渲染或一致性维持上存在短板,即使 Planner 和 Critic 进行规划和修正,也难以完全补偿,导致交错序列中的错误累积。不同生成器的适配成本也可能不同。
- **数据集与评估覆盖面有限**:论文构建的 SFT 数据集(Interleave-Planner-SFT-80k、Interleave-Critic-SFT-112k)和 RL 数据(Interleave-Critic-RL-13k)规模中等,可能未覆盖长时视觉叙事、具身操作等复杂场景。基准测试主要衡量短序列和推理能力,对多样化的交错生成任务(如多轮交互、风格一致性保持)的泛化性尚待验证。