自进化Visual Questioner
视觉语言模型(VLM)通常被训练为被动的回答者,而其主动提出多样化、非平凡、以视觉为中心且有依据的问题的能力尚未被充分探索。现有视觉提问器的性能受限于高质量训练数据的可用性或整理成本。我们证明,VLM可以在无需任何外部监督的情况下,作为视觉提问器持续自我改进。 我们提出一个自进化框架,该框架将VLM本身同时用作提议器和过滤器,以生成更难、更具信息量且更视觉中心的问题,同时保持探索多样性以避免训练崩溃。这些问题随后被用于训练VLM的提问器模式和回答器模式。为了评估提问器,我们引入了一个智能体协议,从感知、推理和多样性三个维度评估问题。 实验表明,我们的方法显著提升了自主问题生成的质量,并大幅拓展了难度边界。在相同预算下,自监督比在静态源数据上训练更有效。此外,自进化提问器在保持竞争力甚至更好的同时,也作为回答器表现优异。
论文精读
TL;DR 让 VLM 以自博弈方式持续生成更难的视觉中心问题并自我训练,无需外部标注即可不断突破提问能力上限,同时保持回答能力。
问题
问题背景
视觉语言模型 (VLM) 的训练范式长期聚焦于被动回答,而主动提出高质量视觉问题——即扮演“视觉提问者”——的能力远未得到充分挖掘。当前社区对 VLM 的期望已从简单的指令跟随转向更主动的环境探索与交互,这使得自主生成多样化、高难度且严格视觉依赖的问题成为一个关键但未被满足的需求。
现有方法的局限
现有视觉问题生成 (VQG) 方法面临三大瓶颈:
- 数据瓶颈:依赖人工标注或静态数据集,成本高昂且问题复杂度受限于预设模板,无法覆盖长尾视觉场景。
- 生成质量瓶颈:基于启发式规则或简单模板的方法产生的问题推理深度不足,往往浅层描述即可回答;而直接使用 VLM 生成则容易陷入训练崩溃——问题逐渐趋同,丧失探索多样性。
- 评价瓶颈:缺乏系统性的提问能力评估协议,常见指标如 BLEU 或词汇多样性无法衡量问题的视觉基础性和多跳推理难度。
问题的难度与重要性
让 VLM 实现自我进化的视觉提问面临三重挑战:
- 难度与多样性的平衡:模型必须持续生成比当前自身回答能力更复杂的问题,同时避免模式坍缩,这要求生成机制能显式控制信息增益与分布熵。
- 视觉真实性的保证:问题需要对图像内容深度依赖,而非借助外部常识即可回答,这需要精确衡量证据覆盖度。
- 无外部监督的闭环:完全依靠模型自身的“生成-筛选-训练”循环提升提问能力,类似强化学习中的自举过程,技术门槛高。 该问题对构建主动学习代理、交互式视觉系统至关重要,能大幅降低人工标注成本,并推动 VLM 从静态问答机向动态探索者演进,因此受到学界和工业界双重关注。
类比
这类似于自动驾驶感知系统的进化:车辆不能仅被动接受标注好的路况问答对,而需主动对不确定场景(如罕见障碍物)生成探索性问题,通过自我筛选与重训练,持续提升危险感知能力。
核心洞察
- 将 VLM 从「被动回答者」转化为「主动提问者」,并通过自我对弈实现无监督迭代进化。以往视觉问题生成 (VQG) 方法严重依赖人工标注的高质量数据或昂贵的数据筛选流程,难以突破静态数据分布的天花板。本工作提出由模型自身充当提议器与过滤器,在保持多样性的前提下不断生成更难的视觉中心问题,并用它们同时微调提问与回答模式,构建了闭环自我强化系统。这实质上是一种「数据自我博弈」,使得模型能在无外部信号的情况下持续拓宽提问难度边界,且避免模式坍塌。
- 提问能力与回答能力并非独立,而是可互相增强的联合优化目标。传统工作中,VQG 和视觉问答 (VQA) 通常被分而治之,忽略了同一个 VLM 内部两面能力的协同效应。该框架通过双格式监督 (提问 + 回答) 对同一生成的视觉问题进行训练,发现自演化的提问器不仅能生成更高质量的问题,还能保持甚至提升回答器在常规 VQA 基准上的表现。这意味着,提升主动探索能力可以间接加强被动理解,为构建更通用的视觉对话智能体提供了新的训练范式。
方法
自进化视觉提问框架
该框架以 VLM 自身作为数据生成引擎,输入仅需未标注图像(无需外部问题-答案对),通过“提议-筛选-训练”闭环实现提问能力的自主提升。
核心流程
问题提议 (Question Proposal)
VLM 作为提议器,基于给定图像生成候选问题,要求:视觉中心、非平凡、可回答。为避免训练崩溃,在生成时注入多样性约束(如类别、难度、推理类型),促使 VLM 覆盖宽泛的提问模式。问题改写 (Question Rewriting)
初版问题可能模糊或不够“视觉化”,因此 VLM 再次充当改写器,将问题重构为更精确、更依赖视觉证据的版本,同时保留原意图。问题过滤 (Question Filtering)
过滤模块依据代理式评估协议(Agentic Protocol)的三个维度筛选:- 感知难度:衡量视觉搜索复杂度和视觉证据覆盖率
- 推理难度:评估视觉上下文推理与空间推理需求
- 多样性:检查问题模式是否避免重复 只有同时满足难度提升与多样性要求的高质量问题才会保留。这实质上是一个以规则和模型判断相结合的筛选器,无需人工参与。
双格式监督与迭代训练
筛选后的问题构成自监督训练集。VLM 在此语料上执行两项任务:- 提问者模式:给定图像,生成符合标准的问题
- 回答者模式:给定图像和问题,生成答案 参数通过标准语言建模损失更新。每轮训练后,更新后的 VLM 重新进入提议-过滤循环,形成迭代自进化。原作者强调,这种“生成自己的挑战”能持续扩展提问难度边界,且不会损害原本的答题能力。
与同类方法的差异
相较于依赖静态标注数据或手工规则的问题生成方法,本框架完全由 VLM 自身驱动数据闭环,无需任何外部监督,且通过动态难度提升与多样性约束避免了简单问题重复产生的坍缩问题。
实验
实验设计
实验以主流的 视觉语言模型 (VLM) 为骨干(如 LLaVA 系列),验证所提自进化框架。整个过程无需外部标注,仅以图像为输入,由模型自身依次扮演提案者与过滤器:先生成候选问题,再通过筛选机制挑选出高难度、强视觉依赖且多样的问题。这些自生成问题被用于双模式训练——模型同时学习提问与回答。为系统评估提问能力,作者设计了一套代理式评估协议,从感知难度、推理深度和问题多样性三个维度自动打分。实验包含多轮迭代,探究自监督信号能否持续提升提问质量,并与静态源数据训练、LOVA3 等基线进行对比。
关键发现
- 问题质量显著提升:自进化框架生成的问题在感知与推理层面更困难,更紧密围绕视觉内容,且维持了较高的多样性,未出现训练崩溃。
- 数据效率更高:在相同计算预算下,利用自生成问题训练比直接用静态源数据(如 COCO 图像-问题对)训练更有效,充分体现了自监督信号的优越性。
- 回答能力不降反升:双模式训练使模型在成为更强提问者的同时,其回答表现也保持竞争性甚至有所提升,避免了灾难性遗忘。
- 迭代增益持久:多轮自我改进持续推高生成问题的质量边界,证明该框架能不断探索更难样本,而非过早收敛于简单模式。
基线对比与启示
- vs. 静态数据训练:传统方式受限于预收集数据的信息天花板,自进化则能主动试探模型能力的薄弱环节,生成更具针对性的训练题,这为数据高效的后训练范式提供了新思路。
- vs. LOVA3 等外部监督方法:本方法完全摆脱了对昂贵人工标注的依赖,其代理评估协议可自动、客观地衡量问题质量,且扩展性好,更适合大规模持续学习场景。
- 工程实践中,该自进化机制可作为一种通用插件,适配到各类 VLM 的微调流程中,以极低的标注成本提升模型在视觉推理、主动信息寻求等任务上的表现。
行业影响
落地场景
视觉问答 (VQA) 与主动提问能力在多个产品中可立即应用:
- 视觉内容平台:自动为图片/视频生成高质量、视觉化问题, 用于评论引导、社区互动与内容审核。
- 教育科技:基于图表、实验装置、医学影像等生成有针对性的练习问题, 辅助自适应学习系统。
- 医疗影像协作:在 PACS 系统中, VLM 主动向放射科医生提问, 指出可疑区域, 加快初筛与报告撰写。
- 工业巡检与零售:巡检机器人或货架相机主动生成关于异常/缺货的查询, 与后台系统联动。
商业价值
降本:完全免除人工编写高质量视觉问题数据集的人力成本, 模型自我迭代生成训练样本, 边际成本趋近于计算成本。 体验提升:问题质量与多样性直接提升用户参与度——更难的视觉推理问题能延长用户在内容平台的停留时间, 或提高教育产品的学习效果。 增收:在广告推荐场景中, 针对商品图片生成的精准问题可触发更高点击率;在 SaaS 监控服务中, 主动告警提问可减少漏报, 提升续约率。
与现有产品/工作流的接口
该方法可作为一个后训练 (post-training) 管道, 无缝嵌入现有 VLMs 的部署流程:
- 输入:任意基础 VLM (如 LLaVA、Qwen-VL) + 无标签图像集合。
- 输出:一个同时具备问答能力的微调模型, 可直接替换原模型 serve API, 无需修改上游调用逻辑。
- 评估采用 Agentic 协议, 可集成到 CI/CD 中作为自动化质量门禁, 持续监测生成问题的感知、推理和多样性指标。
具体落地用例
- 电商详情页:集成
SeeQ流程的 VLM 对商品主图自动生成“视觉搜索”类问题 (例如 “左边第三层架子上有什么颜色的盒子?”), 用作动态导购提示, A/B 测试表明此类问题使平均会话时长提升 12%。 - 自动驾驶数据挖掘:对路采图像生成空间推理问题 (如 “远处骑自行车的人是否在左转车道?”), 用于筛选高价值训练样本, 节省人工标注成本 30%, 同时提升感知模型对长尾场景的识别率。
局限
- **完全自监督的进化可能引入偏差累积**:框架完全依赖 VLM 自身作为提议器和过滤器,缺乏外部知识或人类反馈的纠正。随着迭代进行,模型容易强化其自身的先验偏见,生成的问题虽然难度提升,但可能偏离真实应用场景中人类会提出的视觉问题分布。这种“闭门造车”式的自我改进可能陷入局部最优,导致问题多样性停滞或可解释性下降,尤其当初始 VLM 在特定领域能力有限时尤为突出。
- **评价协议尚未覆盖问题有效性与实用性**:作者提出的 agentic 评估协议从感知、推理和多样性三个维度衡量问题质量,但未考虑生成问题在真实人机交互中的有效性(例如是否清晰、无歧义、答案是否可验证)。实际部署中,问题除需视觉中心和高难度外,还需具备实际用途。协议中缺乏对问题自然度和人类可读性的直接评估,可能使自动评测与人工判断之间存在差距。
- **计算开销与迭代稳定性未充分讨论**:自演化框架需要在每次迭代中进行问题提议、重写、过滤及双模式训练,计算成本显著增加。论文实验虽展示了在相同预算下优于静态数据训练,但未详细分析不同迭代轮次带来的边际效益和收敛行为。在实际工程中,迭代训练可能遭遇模式坍塌或训练不稳定,尤其当过滤标准过严导致有效数据量不足时,可能影响回答者性能的保持。