ToolArtist: 工具使用的统一多模态模型用于智能体图像生成
文本生成图像 (T2I) 模型能生成视觉上吸引人的图像,但在需要复杂语义理解、多步推理及外部世界知识整合的开放世界任务中仍然受限。现有工作尝试将智能体能力引入图像生成,但要么预设固定工作流,要么仅让部分环节受智能体控制,导致推理、工具调用与图像生成未由统一策略协调。 为此,我们提出 ToolArtist,通过对统一多模态模型 (UMM) 进行后训练得到的完全智能体化图像生成模型。ToolArtist 在单一统一策略内动态编排推理、外部工具使用与原生图像生成。在监督微调 (SFT) 阶段,我们为教师智能体配备搜索工具和图像生成工具,并将收集的轨迹转换为 UMM 兼容格式——隐藏工具调用、保留生成图像。在强化学习 (RL) 阶段,我们构建面向 UMM 的智能体 RL 基础设施,并提出 Reason-Act-Draw GRPO (RAD-GRPO),利用互补的意图奖励与质量奖励联合优化模型。 实验表明,将整个开放世界图像生成流程置于智能体策略之下,始终优于固定流水线或部分受控方案。我们已发布训练数据及完整后训练基础设施。
论文精读
TL;DR ToolArtist 通过统一策略协同推理、搜索工具和原生生成,首次将开放世界图像生成完全交由智能体控制,性能超越固定流水线及部分代理方案。
问题
领域现状
文生图(T2I)模型已能生成高质量图像,但开放世界图像生成仍面临挑战:它要求模型具备复杂语义理解、多步推理及外部知识整合能力。现有研究正从单纯提升图像美学转向追求可控、可解释、有外部知识支撑的生成。
现有方法局限
部分工作尝试引入 agent 能力,但存在根本局限:
- 固定流水线:预设的检索-生成步骤无法适应多变任务,缺乏动态决策。
- 部分代理控制:仅让检索或生成阶段受 agent 控制,推理、工具调用与图像生成未整合在单一策略下,导致协调不畅,推理与执行割裂。
这些方法在面对长尾概念、严格事实约束或需要多跳推理的请求时,往往力不从心。
技术挑战与重要性
统一 agentic 策略的难点在于:
- 如何设计训练流程,让统一多模态模型(UMM)学会“思考→使用工具→生成”的动态切换。
- 如何构建有效的奖励信号,同时优化意图(reasoning quality)和生成质量(imagery)。
该问题的重要性体现在:实现全 agentic 图像生成是通往通用视觉智能体的关键一步,能够解放复杂视觉任务中的人工干预,对创意设计、自动化内容生产等行业有巨大应用潜力。
行业类比
类似于 ChatGPT 插件 或 AutoGPT 在文本领域通过工具使用自主规划任务,ToolArtist 让图像生成模型成为一个会自主搜索、思考并作画的统一智能体。
核心洞察
- 将整个开放世界图像生成过程交由单一代理策略统一协调推理、外部工具调用和原生图像生成,相比于以往预设固定工作流或仅部分环节受代理控制的方法,能更灵活地应对复杂语义理解与多步推理需求,使模型自主决定何时检索外部知识、何时直接生成,从而在开放世界任务中取得一致提升。
- RAD-GRPO强化学习框架引入互补的意图奖励和质量奖励,在代理式流程中联合优化步骤间的意图一致性和最终图像质量,有别于传统仅优化生成结果的奖励设计,使得模型在学习中更好地对齐用户意图,同时保持生成质量,实验证明该联合奖励对整体性能有显著贡献。
方法
方法概览
ToolArtist 将开放世界图像生成全过程统一到一个代理策略中,方法基于统一多模态模型 (UMM) 的后训练,分为监督微调 (SFT) 和强化学习 (RL) 两个阶段。
输入与输出
- 输入: 用户自然语言请求,可能包含复杂语义、多步推理需求、长尾知识或事实约束。
- 输出: 最终生成的图像,以及可选的中间推理文本。
关键模块
1. 监督微调 (SFT) —— 轨迹合成与格式转换
- 先构建一个教师代理 (teacher agent),配备搜索工具和图像生成工具,在开放世界请求上运行并收集推理-行动轨迹 (Reason-Act trajectory)。
- 轨迹转换为 UMM 兼容的训练数据时,图像生成工具调用被隐去,替换为生成的图像直接作为模型输出的一部分;搜索工具调用则保留为自然语言动作。这样 UMM 学会在需要时调用搜索,再基于搜索结果自主生成图像,而无需依赖外部的独立生成工具。
2. 强化学习 (RL) —— Reason-Act-Draw GRPO
- 为 UMM 构建代理强化学习基础设施,并提出 RAD-GRPO (Reason-Act-Draw GRPO)。
- 双重奖励:
- 意图奖励 (intent reward): 评估生成图像与用户意图的对齐程度(如语义匹配、约束满足)。
- 质量奖励 (quality reward): 评估图像美学质量、结构合理性。
- 使用 GRPO (Group Relative Policy Optimization) 算法,利用互补奖励信号联合优化策略,让模型在保持意图忠实的同时提升画质。
与同类方法的差异
不同于固定流水线或仅将部分生成流程交由代理控制的方法,ToolArtist 将推理、工具调用和图像生成全部纳入同一策略的自主决策中,实现了全流程端到端的代理化图像生成。
实验
实验设计
评估围绕开放世界图像生成 (open-world image generation) 展开,采用 WISE 与 WorldGenBench 等基准,后者涵盖 Humanities 等细粒度领域。任务要求模型理解复杂语义、进行多步推理并融入外部知识,而不只是简单的文生图。对比的基线包括:
- 固定流水线 (fixed pipeline) 方法,按预设步骤调用工具
- 仅将生成过程的某个子环节交由 agent 控制的部分方案
评估覆盖自动指标与人类偏好,衡量图像质量、与文本意图的一致性以及事实知识的准确度。
关键发现
ToolArtist 在所有评测集上一致优于两类基线,证明将完整的开放世界图像生成过程置于单一 agent 策略下,能显著提升性能。通过动态协调推理、外部工具检索与原生图像生成,模型在面对需要长尾知识、严格事实约束或高度复杂描述的请求时,生成的图像更符合用户意图且错误更少。消融研究显示,RAD‑GRPO 联合优化意图奖励与质量奖励,对模型行为的改进至关重要。
与基线的对比解读
固定流水线因缺乏灵活性,在遇到未见过的任务组合时易出错;部分 agent 控制的方法则因推理与生成割裂,难以在工具调用结果不理想时自主纠正。ToolArtist 的统一策略克服了这些不足:它可以在必要时主动搜索、验证信息,再调用生成工具,从而在事实一致性和语义深度上形成明显优势。这一结果说明,对于复杂的开放式图像生成,端到端 agentic 训练比预定义流程更具泛化能力,为后续多模态 agent 模型的设计提供了明确的范式参考。
行业影响
落地场景
ToolArtist 通过统一策略协调推理、外部工具调用与原生图像生成,开辟了开放世界图像生成的自动化新范式。其核心能力可嵌入以下产品:
- 内容创作平台:自动生成符合复杂语义约束的配图、社交媒体海报,支持长尾实体与事实性约束。
- 电商与广告:根据商品描述、用户评论和外部知识库,动态生成营销创意图像,无需人工设计模板。
- 教育与媒体:针对文本内容自动生成插图或信息图,结合搜索工具确保知识准确性。
- 企业服务与数据分析:将业务数据转化为可视化图表或叙事性图像,要求多步推理与外部数据整合。
商业价值
- 降本增效:全流程自动化减少了多模型串联开发成本和人工 prompt 工程投入。单一 UMM 取代固定管道,维护成本更低。
- 体验提升:动态工具调用(如搜索实时信息)使生成结果更准确、丰富,降低事实错误风险,提升用户信任。
- 新收益路径:开放世界场景(如长尾概念、文化典故)的覆盖拓宽了 T2I 的商业边界,可服务专业细分市场。
与现有产品/工作流的接口
ToolArtist 基于 UMM (Unified Multimodal Model) 后训练,可直接作为现有 UMM 栈的增强组件:
- 模型层:在已有 UMM(如 Emu3.5)基础上通过 SFT+RL 微调,无需变更推理架构。
- 工具集成:通过标准化接口接入外部搜索、计算等工具,与现有 MLOps 工具链兼容。
- 部署方式:可封装为 API 服务,接收自然语言指令,内部编排多工具调用并输出图像,前端产品无需感知多步流程。
具体落地用例
- 电商广告创意生成:用户输入“为我设计一款适合极地探险的保温杯海报,要求包含极光背景和产品使用场景”。ToolArtist 首先推理出需要检索极地景观与保温杯保温原理,调用搜索工具获取真实极光图像和材质说明,再生成融合知识约束的图像,避免常识错误(如普通杯子在极地会结冰),提升广告可信度与点击率。
- 新闻媒体自动配图:针对突发新闻“某地发生罕见日晕现象”,模型需要理解“日晕”的天文定义,搜索相关气象数据和历史事件图片,并生成符合新闻事实的配图(如正确光晕角度和天空色调),避免生成虚假或误导性视觉内容。全程由单一 agent 策略控制,响应速度快且事实一致性高。
局限
- **数据合成依赖教师代理,轨迹转换隐藏生成工具**。ToolArtist 的 SFT 阶段先用教师代理产出推理‑搜索‑生成轨迹,再将生成工具调用替换为最终图像,这种方法虽然简化了 UMM 的输入输出格式,但也可能使模型损失对工具调用参数的显式建模能力。模型学习到的是一种“隐式”生成,无法像显式 API 调用那样精细控制 style、分辨率等参数。此外,生成的多样性与质量仍受限于教师代理的能力以及预训练 UMM 的图像生成上限,当教师代理决策不佳或 UMM 本身存在长尾概念盲区时,最终生成结果会继承这些弱点。
- **评估基准覆盖范围有限,缺乏安全性与公平性分析**。实验主要使用 WISE、WorldGenBench、Humanities 三个基准,这些基准虽然覆盖了 open‑world 图像生成的部分典型场景,但任务规模和多样性仍较受限,尤其在需要深度外部知识或复杂交互的真实应用中泛化能力未经验证。此外,论文未讨论模型可能生成有害、偏见或侵权内容的潜在风险,也未提供相应的安全对齐评估,这在实际落地时是不可忽视的局限。
- **框架与特定 UMM 强绑定,RL 基础设施通用性有待验证**。本文基于 Emu3.5 实现 ToolArtist,SFT 数据格式与 RAD‑GRPO 强化学习专门围绕该模型设计。其他 UMM(如不同模态对齐策略、不同 tokenizer 的模型)可能需要大量适配工作。RAD‑GRPO 的双奖励(意图匹配与生成质量)设计以及辅助奖励的调优,目前只在 Emu3.5 上验证有效,迁移到其他架构时是否依然稳定高效尚不明确,这限制了方法在更广泛多模态模型上的推广。