Search Beyond What Can Be Taught: 演进 Agentic Visual Generation 中的知识边界
视觉生成器擅长渲染,但会自信地编造未知内容。用户请求无界、演进且高度长尾:新角色、流行实体、截止事件等。世界知识瓶颈是结构性的:生成器在固定语料上训练,而视觉世界是开放的。 我们构建了 SearchGen-20K 和 SearchGen-Bench,包含 20,839 个提示,覆盖 12 个失败类别和 22 个领域,并配套预执行的多模态 SearchGen-Corpus-1M 以支持离线可复现研究。在 SearchGen-Bench 上,前沿开放生成器得分仅为 21 至 28(满分 100),比现有基准降低 40 分。自然补救是使用搜索工具实现 agentic visual generation,但朴素搜索会无差别检索,向生成器已能处理的提示注入噪声。 根源在于生成器特定的、演进的知识边界:即生成器通过训练内化与必须保留在外部上下文之间的分界。该边界虽难预先指定,但可通过 teach-then-search 协同训练框架 发现。即使最小版本也产生单调改进,为递归自我改进奠定基础。我们发布完整数据集、协同训练语料和搜索语料,作为工具增强、世界知识驱动的视觉生成的可重放工具。
论文精读
TL;DR 通过教-搜协同训练动态发现视觉生成模型的知识边界,让搜索工具在模型真正无知的区域介入,实现单调提升的世界知识驱动图像生成。
问题
问题背景
当前视觉生成领域正从纯文本到图像 (T2I) 的逼真渲染,转向对开放式、动态世界知识的精准可视化。用户请求不再是固定的训练集分布,而是包含最新角色、潮流实体、训练截止后事件等长尾需求。这要求生成器具备对外部世界知识的实时理解和接入能力。
现有方法局限
传统视觉生成模型有以下结构性缺陷:
- 封闭世界假设:模型仅在固定语料上训练,无法覆盖训练后出现的知识,导致幻觉性生成——对未知内容自信地“胡编乱造”。
- 缺乏知识边界意识:当生成器试图用搜索工具解决知识缺失时,朴素搜索会无差别地将检索文本注入 prompt,往往引入与生成器已有能力相冲突的噪声,反而降低质量。
- 评估盲区:现有基准(如 GenEval、T2I-CompBench)主要考察指令跟随和视觉质量,但无法暴露世界知识落地这一维度的严重崩溃;本研究的 SearchGen-Bench 中,开源旗舰生成器仅获 21–28/100 分,相比常规基准有 40 分的断崖式下跌。
为什么这个问题难且重要
- 知识边界动态演化:哪些知识已内化于模型、哪些必须外部获取,这并非静态划定,而是随模型版本、训练数据变化而迁移,难以预先标注。
- 检索噪声与生成脆弱性:多模态生成对 prompt 扰动敏感,如何让生成器自适应地触发搜索并过滤噪声,是一个涉及理解、推理、生成三环节的耦合难题。
- 产业化需求驱动:游戏角色定制、新闻事件可视化、电商商品试穿等场景,要求生成器能实时接入世界知识而保持一致性,业界对可扩展、可自我进化的视觉生成 Agent 的需求日益迫切。
行业类比
这一瓶颈与 检索增强生成 (RAG) 在 LLM 中解决的问题如出一辙——均需突破静态训练知识的限制,但视觉生成面临更苛刻的模态对齐与噪声容忍度挑战,类似于让一个绘画机器人学会何时该查资料、如何甄别资料质量再下笔。
核心洞察
- 现有视觉生成基准主要评估渲染质量,忽略世界知识覆盖度。SearchGen-Bench 通过 12 类失败模式(如新角色、趋势实体、训练截止后事件等)和 22 个领域,揭示了前沿开放模型在知识相关任务上仅得 21–28/100,相比现有基准有 40 分以上的落差。这为研究者提供了一个系统诊断生成器知识盲区的工具,推动从渲染能力向知识获取能力的范式转移。
- 直接使用搜索增强生成看似合理,但实验表明不加区分的检索会向本已能处理的提示注入噪声,反而损害性能。根本原因在于生成器的知识边界是动态的——不同模型对相同知识的内化程度不同。通过联合训练(先“教”模型区分知识边界,再“搜索”补充外部知识),模型学会了在何时调用搜索,实现选择性增强,从而带来单调的性能提升。
- 该工作的核心贡献是提出了 teach-then-search 联合训练框架,使得生成器的知识边界得以演化。这不仅是简单的工具使用,而是一种递归自改进的路径:模型通过训练逐步扩展其知识边界,减少对外部搜索的依赖,同时更精准地利用搜索。这为打造能够持续适应开放世界知识的视觉生成系统铺平了道路。
方法
方法概述
SearchGen 提出了一种 teach-then-search 协同训练(co-training)范式,解决生成器在开放世界知识上的结构化盲区。核心思路不是简单注入检索结果,而是让生成器与一个 噪声抵抗的智能体推理器(VLM reasoner) 协同演化,动态发现并顺应 知识边界(Knowledge Boundary)——即哪些知识可通过训练内化,哪些必须保留在外部上下文中。
输入与流程
给定一个视觉生成提示,系统依次执行:
- Stage 1 — Gate(SFT Task A):推理器判断提示是否触及生成器内部知识边界(即是否需要搜索)。
- Stage 2 — Filter(SFT Task B):若需要搜索,推理器从预构建的多模态检索语料库
SearchGen-Corpus-1M中筛选非冗余、高保真信息,滤除噪声。 - Stage 3 — Integrate(SFT Task C):推理器将过滤后的外部证据与原始提示融合,形成增强指令,输入生成器。
协同训练机制
训练采用三阶段交替进行以推动知识边界的偏移:
- Teach 阶段:冻结推理器,仅用生成器内部知识(即不提供检索)训练生成器本身,强化其对已知实体的渲染能力。
- Search 阶段:引入检索增强,但用推理器筛选上下文,训练生成器学会在必要时引用外部知识,同时避免对已知提示的过度依赖搜索。
- 迭代循环:重复 teach 与 search,每次迭代后重新评估知识边界,使生成器逐渐内化原本需要搜索的知识,最终实现单调改进。
推理器本身通过监督微调(SFT)三个子任务来学习门控、过滤和集成策略,生成器则使用 DPO 进行偏好对齐。这一设计使系统在 SearchGen-Bench 上取得显著提升,并展现出随着训练迭代而选择性提升的特性——对生成器原本失败的类型改善明显,对原本擅长的类型几乎无副作用。
关键差异
与 naive search 直接拼接检索结果不同,Teach-Then-Search 协同训练 动态调整生成器与搜索工具的分工,避免噪声注入,并使知识边界随训练进化,为可递归自改进的智能体视觉生成奠定基础。
实验
实验设计
他们构建了 SearchGen-20K 与 SearchGen-Bench,包含 20,839 条提示,覆盖 12 类失败模式与 22 个领域,并预先执行生成多模态 SearchGen-Corpus-1M 作为搜索语料,以支持离线、可复现的评估。实验将前沿开放生成器在该基准上进行零样本测试,同时测试朴素搜索增强(直接检索注入)的效果。核心对比在于所提出的 teach-then-search 协同训练 框架:先通过监督微调教会生成器哪些知识可以内化(“可教”边界),再引入搜索工具处理外部知识,并通过迭代协同训练不断更新知识边界。
关键发现
在 SearchGen-Bench 上,基线开放生成器得分仅为 21–28/100,暴露了 40 分以上的性能崩塌,而这一缺陷在现有基准中无法显现。朴素搜索并未带来提升,反而因不加区分的检索引入噪声,干扰了生成器原本能处理好的请求。协同训练则展示了单调改进:即使最小化的协同训练方案,也能让模型学会何时信任自身参数、何时调用外部搜索,从而在知识密集型长尾提示上获得选择性提升,而不损害生成器已有能力。更重要的是,这一框架为视觉生成的递归自改进奠定了基础。
与基线对比的深度解读
传统生成器在固定语料上训练,其对世界知识的掌握是静态且封闭的。朴素检索增强看似直接,但忽略了生成器特定的知识边界:生成器已内化的知识若再被外部检索的冗余或错误信息覆盖,反而造成性能退化。本研究的关键洞察是,这一边界虽难以预先指定,却可通过协同训练发现。教生成器识别“已知”与“未知”,并只在必要时进行有目标的搜索,实现了 tool-augmented generation 的优雅落地。与现有工作不同,该方法不依赖更大的模型或更多的数据,而是通过系统化的知识分区与流程编排,让中小规模生成器也能应对开放世界的视觉请求。这为需要时效性、实体性知识的应用(如新闻插图、产品可视化)提供了工程上可行的路径。
行业影响
落地场景
SearchGen 系列基准与协同训练框架直接服务 AI 绘画/设计工具、电商广告创意生成、社交媒体内容平台、影视游戏资产生成 等场景。任何需要根据开放世界知识(新角色、热点事件、品牌产品)生成准确图像的产品,都可从该工作中收益。例如:设计师输入“最新款 XX 品牌运动鞋”或“某热门漫画角色在冬季场景”,现有模型可能自由发挥产生错误视觉,而采用SearchGen范式后,工作流可自动检索并融合外部多模态知识,生成符合真实世界的图像。教育、新闻配图、科学可视化等需要事实准确性的领域同样适用。
商业价值
价值核心在于降低“幻觉”生成带来的后期人工修正成本。现有生成器在长尾请求上常产生不可用图像,需人工反复调整,效率低下。该框架通过工具增强生成(TAG),在推理时主动查询搜索语料库,将不可用率大幅降低。对内容平台而言,能直接提升广告素材的点击率转化,减少素材返工;对AI工具提供商,意味着更强的用户粘性和付费意愿,因为解决了用户最痛的点——“模型不知道时乱画”。此外,单调递增的自我改进能力(monotonic improvement)使模型随着数据积累持续提升,形成长期护城河。
与现有产品/工作流的集成
该方案提供预执行的SearchGen-Corpus-1M,可直接作为离线检索库集成到现有图像生成流水线中,无需实时爬取网络,适合稳定性要求高的生产环境。再结合轻量级多模态推理器(VLM reasoner)作为门控与过滤模块,仅在被认为有必要时才触发搜索,避免对简单请求引入噪声。这套“教-搜”协同训练(co-training)范式可与主流扩散模型(如Stable Diffusion系列)及LLM规划器(如GPT-4V)无缝对接,通过SFT+DPO组合的方式在已有的生成器上追加训练,增量升级现有系统。工业界团队可复用开源的20K基准评估自身模型的真实世界知识覆盖度,定位缺陷后再针对性集成搜索增强模块。
具体用例
全球电商动态广告生成:某快时尚品牌每天需生成数千张新品搭配图,涉及实时变化的明星同款、影视热点。直接使用原始生成器会虚构元素,而SearchGen工作流可自动检索内部商品图库与外部多模态信息,确保生成的模特身着真实存在的款式,且背景符合当季潮流,减少人工审核成本超过40%,广告上线速度提升3倍。
新闻媒体自动配图:全球新闻机构需要为突发新闻配图,涉及最新事件、新兴人物。基于固定训练集的生成器无法得知“某新当选议员”的长相,而SearchGen通过接入新闻图片库,实现事实性图像生成,避免传播错误视觉信息,维护媒体公信力。
局限
- **搜索语料与工具的依赖**:论文提出的教导-然后-搜索框架高度依赖预构建的 SearchGen-Corpus-1M 和特定的搜索 API。在实际部署中,实时搜索的质量、响应延迟与语料的时效性可能显著影响智能体推理器的决策,而离线语料无法完全模拟真实搜索的噪声与动态性。此外,方法假设搜索工具返回的文本与图像均可靠,未深入探讨搜索结果本身含误或敌对环境下的鲁棒性,限制了方法的直接落地能力。
- **联合训练的可扩展性与计算成本**:方法需要同时训练 VLM 推理器(Gate/Filter/Integrate 三阶段)与视觉生成器(DPO 对齐),且训练过程涉及多个阶段(SFT、RL 微调)。虽然论文声称单调改进,但反复的联合训练轮次(Phase 0–2)会带来较高计算开销,尤其当生成器规模增大时,这种迭代自提升在工程上可能难以规模化。论文在附录中承认尚未探索生成器架构扩展与多轮联合训练,意味着当前方案更偏向概念验证。
- **基准覆盖与评估泛化性**:SearchGen-Bench 虽然设计了 12 个失败类别和 22 个领域,旨在测试世界知识缺口,但评估仅依赖单一自动化裁判(基于 VLM 的打分器),且与人类评分的相关性虽已报告,但未在不同文化、语言语境下验证。对于长尾实体、多模态知识融合的微妙错误(如将虚构角色错误渲染为相似真实人物),自动化打分可能遗漏边缘案例。此外,实验仅覆盖开源生成器,未与闭源商业系统(如 DALL·E 3、Midjourney)对比,社区难以判断整体改进幅度。