论文

GenRouter:面向智能体图像生成的统一工作流路由

GenRouter:面向智能体图像生成的统一工作流路由

文本到图像(T2I)生成模型的快速发展已有效解决原始像素合成这一基础挑战,研究焦点转向满足日益复杂的用户请求。然而,现有的智能体图像生成工作流虽增强了静态推理,具备外部知识检索与迭代推理等能力,却大多在孤立的环境中运行,采用固定的“一刀切”拓扑,导致严重的计算不匹配——简单查询也被迫经过高计算量流水线。 为弥合这一鸿沟,我们提出 GenRouter,这是首个面向智能体图像生成的统一工作流路由框架。首先,我们构建 GenCanvas,将多样的智能体流水线标准化为一组通用基础原语与可执行模板。在此统一空间上,GenRouter 通过 (i) 需求分析、(ii) 经验匹配和 (iii) Pareto 过滤,自适应地将异构提示路由至其最优工作流。 在多样化基准上的大量实验证明,GenRouter 实现了更优的视觉对齐,同时相比重型静态流水线,执行成本降低超过 95%,延迟降低 65%。此外,系统通过积累的经验持续自我进化,实现了强大的零样本泛化,在提升性能的同时将计算开销减半。

论文精读

TL;DR GenRouter 将异构代理式图像生成管线统一为可路由工作流,按提示需求动态选择最优拓扑,相较重量级静态管线降低超 95% 成本与 65% 延迟,并支持经验驱动的自我演化。

问题

问题背景

文本到图像(T2I)生成模型已解决基础像素合成任务,社区焦点转向复杂用户请求,例如多步推理、外部知识整合与精细控制。Agentic 图像生成工作流通过引入检索、规划、迭代等机制增强静态模型。

现有方法局限

当前 agentic 工作流大多以 固定拓扑 运行,缺乏自适应能力:

  • 计算错配:简单提示词也被迫执行完整重管线,如多轮 LLM 推理或多次模型调用,导致显著资源浪费。
  • 工作流孤岛:不同 pipeline 之间缺少统一抽象,难以复用组件或比较效率。
  • 缺乏路由机制:没有系统判断何时调用重型能力,所有请求均走“一刀切”路径,无法根据任务复杂度动态调整。

问题难点与重要性

统一路由的挑战在于:

  1. 工作流空间标准化:需要将异构 agentic 流程抽象为可组合的原语和模板,保留灵活性与可执行性。
  2. 高效匹配:在巨大搜索空间中为每个 prompt 找到帕累托最优工作流,需平衡视觉质量、延迟与成本。
  3. 泛化与进化:系统需从历史经验中学习,对新任务零样本泛化,避免冷启动成本。

业界对降低推理成本、缩短响应时间有迫切需求,同时要保持生成质量,该问题直接关系到 agentic 系统的规模化部署。

行业类比

类似大型语言模型推理中的 自适应路由,根据请求复杂度将 token 分配到不同规模的模型,以最小化成本并维持响应质量。

核心洞察

  • 将 agentic image generation 从固定拓扑 pipeline 重构为统一工作流空间中的自适应路由,直接解决计算资源与请求复杂度不匹配问题。现有方案如检索增强、迭代推理等工作流以孤岛方式运行,无论 prompt 简单与否都执行完整重流程,导致严重算力浪费;GenRouter 通过 GenCanvas 抽象出可组合的 primitives 和 templates,使路由能够在统一空间上按需选择工作流,在保持视觉对齐的同时将执行成本降低 95%、延迟降低 65%。这一视角从系统调度层面优化生成效率,而非单纯改进单模型性能。
  • GenRouter 采用双记忆体验匹配与 Pareto filtering 实现持续自进化,区别于静态规则或单目标路由系统。它通过历史执行经验构建动态校准机制,对候选工作流进行多目标(成本、延迟、对齐)Pareto 过滤,使系统能够从累积数据中学习并泛化到未见过的 prompt 类型,零样本场景下性能提升且计算开销减半。这种闭环反馈设计让路由策略随使用迭代优化,是工程上可长期部署的关键,而非常规的一次性训练路由模型。

方法

输入与标准化空间

GenRouter 接收异构的用户 prompt,这些 prompt 涵盖从简单物体生成到需要外部知识检索、迭代推理的复杂请求。为统一处理,论文首先提出 GenCanvas,将各类 agentic 图像生成流水线抽象为一组基础原语(primitives)和可执行模板。原语包括模型调用、检索、推理、工具使用等原子操作,模板则定义这些原语之间的拓扑连接。

关键路由模块

路由流程分为三个核心阶段:

  1. 需求剖析(Demand Profiling):从 prompt 中提取任务签名(task signature),表征语义复杂度、所需外部知识、推理深度等特征;同时进行候选剪枝(candidate pruning),依据任务签名过滤明显不合适的模板,缩小搜索空间。
  2. 记忆引导匹配(Memory-Guided Matching):维护双记忆经验库(dual-memory experience)——一个记录历史成功案例,一个记录失败或次优案例。通过动态校准(dynamic calibration),将当前任务签名与历史任务进行相似度匹配,召回表现良好的工作流候选。
  3. 帕累托过滤(Pareto Filtering):对候选工作流在视觉对齐质量、执行成本、延迟等多个目标上进行帕累托前沿过滤,剔除被支配的解,最终选出最优工作流。

输出与自进化

路由器输出一个具体的工作流配置(原语模板实例),并执行该工作流生成图像。系统收集执行结果与反馈,通过周期性记忆蒸馏更新双记忆经验库,实现持续自进化,提升后续路由的零样本泛化能力。

与同类方法的关键差异:现有 agentic 工作流各自为政且拓扑固定,GenRouter 首次在统一原语空间上实现按需路由,并通过经验积累避免重复计算,从而在保证视觉对齐的同时大幅降低算力开销。

实验

实验设计

  • 构建 GenCanvas 统一工作流空间,将异构 agentic 图像生成流水线拆解为 基础原语 与 可执行模板。
  • GenRouter 通过 需求画像、经验匹配、Pareto 过滤 三步自适应路由,在多个基准上对比固定 heavyweight 静态流水线及其他路由方法。

关键发现

  • GenRouter 在保持或提升视觉对齐(visual alignment)的同时,将执行成本降低超过 95%,延迟降低 65%。
  • 系统通过累积经验持续自我演化,零样本泛化性能提升,且计算开销减半。

对比解读

  • 传统 agentic 工作流采用固定 "one-size-fits-all" 拓扑,导致简单查询被迫通过重型管道,产生严重 compute-mismatch。
  • GenRouter 的动态路由依据任务需求画像和 Pareto 过滤,在成本与质量之间取得平衡,显著优于静态流水线。
  • 相较现有 agentic system routing,GenRouter 首次针对图像生成领域统一工作流空间,并通过 双记忆经验 实现持续优化,为大规模部署提供降本增效路径。

行业影响

落地场景

GenRouter 可嵌入任何需要大规模图像生成的业务,例如:

  • 电商商品图生成:简单白底图、模特换装、复杂场景合成等不同复杂度请求,路由到不同 agentic workflow,避免每张图都走检索+推理+多步精修。
  • 内容平台配图与广告素材:根据 prompt 的任务签名(构图复杂度、实体数量、风格要求)动态选择轻量单步生成或重型多智能体协作流程。

商业价值

  • 降本:论文显示执行成本降低 >95%,延迟降低 65%,对于日均百万级图像生成的平台,可大幅削减 GPU 算力与排队时长。
  • 体验提升:视觉对齐指标提升,同时简单请求更快返回,复杂请求仍能获得高质量结果,避免“一刀切”导致的高延迟或质量不足。
  • 持续进化:GenRouter 通过经验记忆蒸馏实现零样本泛化,新工作流上线时无需全量重新训练,运维成本低。

与现有产品/工作流的接口

GenRouter 可作为现有图像生成服务的前置路由层:

  1. 通过 GenCanvas 将所有 agentic pipeline 统一为原语和可执行模板,与新老工作流无缝对接。
  2. 路由决策模块以独立微服务部署,输入 prompt 与用户上下文,输出 workflow ID 及参数,易于在现有 API 网关或推理平台(如 Triton、KServe)中集成。
  3. 支持 Pareto 过滤,可按成本/质量/延迟权重动态调整,方便产品经理设定不同业务线的多目标策略。

局限

  • **基元覆盖与扩展性限制**:GenCanvas 将现有 agentic 流程抽象为有限基元和模板,但未能证明对所有复杂工作流(如多智能体协作、外部工具调用链)的完备覆盖。其扩展性依赖人工定义新基元和拓扑,难以自动适应未来不断涌现的 agentic 能力。此外,论文未讨论当多个异构工作流存在语义重叠时,标准化过程可能丢失细粒度差异,导致路由决策次优。
  • **冷启动开销与经验泛化瓶颈**:系统冷启动依赖穷举探索候选工作流并批量评估,以构建初始经验池。当工作流空间规模较大或生成后端成本高昂时,该过程可能不可行。经验蒸馏和记忆引导匹配虽能降低后续开销,但高度依赖历史任务分布,在分布外或长尾用户请求上可能误判需求,导致路由到不恰当工作流。零样本泛化能力仅在有限基准上验证,实际部署中仍需持续积累经验。
  • **路由决策的额外计算成本与评估局限性**:GenRouter 在路由阶段引入需求剖析(任务签名提取、候选剪枝)和帕累托过滤,这些步骤消耗额外计算资源,可能抵消部分延迟收益,尤其在极低延迟场景下。实验仅基于有限基准、特定生成后端和视觉对齐指标,未覆盖多样化风格、真实世界噪声与交互式使用场景。与现有 agentic 系统路由方法相比,缺乏在线学习和多模态反馈的对比。
论文Harold Haodong Chen2026-08-17原文

相关内容