论文

OmniHarness: 通过符号策略学习驾驭可泛化的视觉生成

OmniHarness: 通过符号策略学习驾驭可泛化的视觉生成

统一多模态大语言模型(MLLMs)与多智能体系统推动了视觉生成的发展,但仍存在三点局限:(1) 现有方法多以任务特定经验蒸馏为主,泛化能力有限;(2) 反思往往被推迟到任务完成之后;(3) 知识通常只在下游任务需求出现时才被获取。 为此,作者提出 OmniHarness,一个通过 符号策略学习 实现可泛化视觉生成的框架。它把已验证的执行过程抽象为面向视觉生成任务族的 符号策略,保留共享流程与适用条件,同时剥离实例特定的输入。该 harness 能够对新任务完成策略的实例化、适配与组合,并借助 中间验证 在执行过程中引导策略精化与失败恢复。通过 自主探究,OmniHarness 在下游目标给定之前,主动生成并执行接近自身能力边界的练习任务;执行反馈持续改进策略,而模型参数保持冻结。 在六个基准、三个 MLLM 主干与三个视觉智能体框架上的实验展现出强劲性能与持续的能力扩展。在 ComfyBench 的 Creative 任务上,OmniHarness 取得 95.0% 的解决率,超过最强基线 27.5 个百分点;冻结的策略快照还能通过即插即用复用提升现有视觉智能体系统。

论文精读

TL;DR OmniHarness 把验证过的执行轨迹抽象为可复用、可组合的符号化策略,并用自导向练习与中间验证持续扩展能力,在 ComfyBench Creative 上达到 95.0% 解决率,显著超越现有视觉生成智能体框架。

问题

问题背景

视觉生成领域正从单一模型向统一多模态大语言模型(MLLMs) 与多智能体系统 演进,目标是让系统能自主构建工作流、编辑图像并适应多样化任务。

现有方法局限

当前多数框架通过任务特定经验蒸馏 来提升性能,但这类经验通常绑定具体实例,难以泛化到新任务。同时,反思机制往往推迟到任务完成后触发,导致错误在长流程中累积,无法中间纠正。此外,知识获取是被动响应式 的——只有当下游任务出现时才学习,缺乏主动探索与预训练策略库,因此面对未见任务时鲁棒性不足。

为什么这个问题难/重要

核心挑战在于如何从已验证的执行轨迹中抽象出符号化策略,既保留跨任务的共享过程与适用条件,又剥离实例特定输入;同时需要在执行过程中引入中间验证与失败恢复,形成闭环。业界关注点在于:生成任务空间高度开放,固定模型参数下如何实现持续能力扩展,是降低重复开发成本、提高系统自适应能力的关键。

行业类比

类似软件工程中的可复用组件库 + CI/CD 中间测试:将验证过的流程沉淀为可组合的策略库,在新任务上即时实例化并穿插检查点,避免每次从零开发且能在早期拦截失败。

核心洞察

  • 符号策略学习把通用的视觉生成过程抽象为可组合的策略,去除实例特定输入,实现了任务族之间的泛化与重用。与现有方法通常从具体任务样本中蒸馏经验不同,OmniHarness 将验证过的执行轨迹提炼为带适用条件的符号策略,使新任务能够按需实例化、改编和组合这些策略。这种抽象层次使模型无需更新参数即可快速泛化到未见任务,冻结的策略快照还能即插即用地增强现有视觉代理系统,体现了系统性的能力累积机制。
  • 自导式探究让模型在下游目标未指定前主动探索能力边界,通过生成并执行接近自身极限的练习任务来产生反馈,驱动策略持续进化。不同于被动等待任务需求才获取知识,OmniHarness 自主构建练习场景,并用中间验证信号修正策略,同时保持模型参数固定。这种无参数更新的自我提升方式降低了新任务陌生感,为视觉生成代理在部署前积累通用能力提供了有效途径。
  • 中间验证驱动的执行细化将反思从任务完成后提前到执行过程中,显著提升了复杂视觉生成流程的失败恢复能力。传统方法通常延迟到任务结束才进行反思,导致错误累积且难以定位。OmniHarness 在策略执行阶段穿插验证步骤,一旦检测到偏差立即触发细化或恢复,使 ComfyBench 创意任务 resolve rate 达到 95.0%,超出最强基线 27.5 个百分点,说明实时纠偏对长流程多步骤生成任务至关重要。

方法

输入

OmniHarness 接收视觉生成任务指令(文本到图像、图像编辑、工作流构建等)以及可调用的生成工具与执行环境。在下游目标出现前,框架可通过自导探究主动生成接近能力边界的练习任务。

关键模块

  1. 符号策略学习 将已验证成功的执行轨迹抽象为符号策略。每条策略记录任务族共享的程序步骤、适用条件与中间验证点,移除实例特定输入,形成可组合的符号规则库。
  2. 自导向探究 在没有外部任务时,框架自动生成并执行练习任务,将产生的成功/失败轨迹反馈到策略学习,实现前置知识积累,不依赖下游需求。
  3. 反馈引导执行 面对新任务时,从策略库实例化并组合相关策略,逐步骤调用生成工具。每完成中间步骤即进行验证(如图像内容检查、工具输出校验),验证失败时根据反馈调整策略参数或切换备选动作,支持失败恢复。

输出

输出为符合目标的视觉结果与可导出的 符号策略快照。快照可插件式复用,直接提升现有视觉 agent 系统性能,无需修改模型参数。

与同类方法的差异:OmniHarness 将经验抽象为显式符号策略并主动生成练习任务,而非仅蒸馏任务特定数据或事后反思,从而获得更强的任务族泛化能力与持续扩展性。

实验

实验设计

OmniHarness 在 ComfyBench、GenEval、GenEval2、Reason-Edit、WISE、KRIS-Bench 六个基准上验证,覆盖文本到图像、图像编辑、创意工作流等任务族。框架使用三种 MLLM 骨干和三种视觉智能体框架作为底座,通过自我导向探究生成接近能力边界的练习任务,再利用执行反馈迭代优化符号策略,全程冻结模型参数。

关键发现

最突出结果是 ComfyBench Creative 上 resolve rate 达到 95.0%,相较最强基线提升 27.5 个百分点。符号策略不仅在新任务上实例化、适配与组合,还能导出为冻结快照,以即插即用方式提升现有视觉智能体系统。消融研究表明,自我导向探究、反馈引导执行和符号策略学习三个组件均对性能有正向贡献。

基线对比解读

现有方法通常蒸馏任务特化经验,泛化性有限,且在任务完成后才反思。OmniHarness 通过抽象验证执行轨迹为符号策略,显式编码共享流程与适用条件,去除实例输入,因此在跨任务族泛化上更稳定。相比多智能体系统,其中间验证可在执行过程中早期纠正失败,而不是等最终结果再回溯,这是 resolve rate 大幅领先的关键原因。

行业影响

落地场景

  • 电商与广告素材生成:自动根据商品描述生成多版主图、海报及场景图,执行复杂编辑指令(换背景、风格迁移、构图调整)。OmniHarness 抽象出任务族符号策略,对新任务可实例化复用,减少重新调试成本。
  • 内容平台与游戏资产:批量生成符合主题的视觉内容,如社媒配图、游戏道具/角色概念图,并支持文本到图像、图像编辑统一策略框架,适合需要高频产出的业务。

商业价值

  • 降本:自动化复杂视觉生成流程,降低人工审核与反复提示调试开销;策略复用避免为每个子任务收集训练数据,模型参数固定节省推理适配成本。
  • 提效与增收:在 ComfyBench Creative 任务上达到 95.0% resolve rate,远超基线,可显著提升内容生产吞吐,缩短创意迭代周期。中间验证与失败恢复减少返工,间接提升用户体验与平台活跃度。

与现有产品/工作流接口

  • 即插即用:冻结策略快照可作为插件嵌入现有视觉 agent 系统(如基于 GPT-4V / LLaVA 的 agent 或 ComfyUI 工作流),无需重训骨干模型。
  • 集成方式:将 OmniHarness 作为中间件,接收上游任务指令,输出可执行的符号策略序列,驱动下游生成器(如 Diffusion 模型、编辑 API)。中间验证可对接现有质量评估服务(如 CLIP score、人工审核队列)。
  • 部署考量:符号策略是轻量文本/JSON,易于版本管理、A/B 测试和跨团队共享;建议与 MLLM 推理服务解耦,策略执行可批处理以提升吞吐。

具体 use case:全球电商平台使用 OmniHarness 自动生成商品白底图与场景图,根据用户偏好动态调整风格并保持品牌一致性;短视频平台批量生成封面与分镜草图,减少人工设计投入。

局限

  • **对预训练 MLLM 能力的高度依赖**:OmniHarness 的符号策略学习建立在 MLLM 生成结构化符号、进行反思与代码执行的基础上。若底层 MLLM 对视觉生成工作流理解有限,生成策略的质量会显著下降,框架的通用性受到 backbone 能力约束。论文报告了三个 MLLM backbone 的结果,但未深入分析在较弱模型上的退化程度,也未给出最小能力阈值。实际部署时,若团队没有足够强的闭源或开源 MLLM,可能难以复现收益。
  • **探索成本与冷启动问题**:self-directed inquiry 需要大量自主生成与执行练习任务来逼近能力边界,这带来额外的推理与执行开销。论文未量化 inquiry 阶段的 token 成本、执行时间或失败率;同时,symbolic policies 从 verified executions 抽象,冷启动时如果没有足够高质量示范,策略库构建可能受阻,尤其在全新任务家族上需要重新积累经验。
  • **任务类型与评估范围的局限**:实验集中在 ComfyGen 类结构化视觉生成(ComfyBench、GenEval、Reason-Edit 等),主要基于 ComfyUI 工作流。对于更开放式的图像生成、视频生成或 3D 生成,symbolic policies 的可迁移性尚未验证。此外,对比 baseline 虽强,但缺少与最前沿 agent 框架在完全对齐设置下的细粒度消融,plug-and-play 复用效果可能受 benchmark 偏差影响。
论文Xu Xu2026-09-13原文

相关内容