Where-OPD: 面向 MLLMs 的合成场景空间引导在线策略自蒸馏
On-policy self-distillation 近来成为提升语言模型推理能力的有效手段:让冻结或 EMA 版本的模型自身在接收特权信息后监督学生。但该思路在 MLLMs 上的应用仍鲜有探索。已有方法借助图像裁剪等特权视觉信息改善细粒度感知,收益却局限于受益于视觉放大的任务,且依赖人工标注的 grounding 数据或外部教师模型。 本文提出一种不同形式的 on-policy self-distillation:为教师提供文本化的、空间定位的引导,明确指出与查询相关的视觉元素。方法采用程序化生成的场景,其物体身份与空间坐标可自动获取,从而实现可扩展、无需标注的后训练。教师借助该空间引导定位并整合多个相关图像区域的证据,学生则学习仅凭图像与问题复现这一行为。 实验表明,该方法在多个模型上持续提升 counting、文档与图表理解等基准的表现。更重要的是,尽管后训练仅使用合成场景,提升仍可迁移到真实世界感知基准:在 CVBench、V、ZoomBench、BLINK、HR-Bench 与 MME-RealWorld 上平均提升 3.23 分。 这说明空间定位的特权信息可通过 on-policy self-distillation 诱发更广泛的感知能力,实现超越后训练任务与数据分布的合成到真实迁移。项目页面:https://github.com/sirkosophia/Where-OPD
论文精读
TL;DR Where-OPD 通过合成场景的空间引导文本做 on-policy 自蒸馏,让 MLLM 学生无需标注或外部教师即可学会定位、整合多区域视觉证据,并在真实感知基准平均提升 3.23 点。
问题
问题背景
当前多模态大模型(MLLM)在通用视觉问答上表现优异,但在细粒度视觉感知任务(如精确计数、文档/图表理解、空间定位)上仍频繁出错,成为实际落地的主要瓶颈。
现有方法局限
近期工作尝试通过 on-policy self-distillation 引入特权视觉信息(如问题对应的图像裁剪区域)来增强细粒度感知,但存在两个关键限制:
- 增益高度依赖“视觉缩放”这一任务形态,对于不需要局部放大即可回答的计数、图表理解等任务帮助有限;
- 训练需要人工标注的 grounding 数据或额外教师模型,数据获取成本高,难以规模化。
换句话说,现有方法要么局限于特定任务,要么依赖昂贵标注,缺乏一种通用、无需外部监督的细粒度感知增强机制。
为什么这个问题难/重要
核心挑战在于:如何在不引入人工标注或外部模型的前提下,让 MLLM 自主学会“关注与问题相关的多个图像区域”并整合证据。on-policy self-distillation 为语言模型推理提供了新范式,但将其扩展到多模态场景时,特权信息的构造方式、空间引导的形式以及合成数据到真实场景的迁移能力都未被充分探索。该问题具有高业界关注度,因为真实世界视觉任务往往要求模型能精准定位关键对象、忽略干扰区域,而这正是当前 MLLM 的普遍短板。论文表明,仅用合成场景训练即可提升多个真实基准(如 CVBench、MME-RealWorld)平均 3.23 点,显示出显著的实际价值。
行业类比
类似自动驾驶中利用程序化生成的合成场景,自动获得精确目标框与空间坐标进行感知训练,再将模型迁移到实车真实数据上,从而摆脱对人工标注的依赖。
核心洞察
- 文本空间引导的特权信息比视觉裁剪更通用。该方法通过坐标文本引导 teacher 定位多个相关区域,而非提供单个图像 crop,因此能处理需要整合多区域证据的任务(如 counting、document/chart understanding)。与依赖外部教师或人工 grounding 数据的方法不同,这里的特权信息由程序化生成的合成场景自动提供,实现零标注扩展;且 student 推理时不增加任何额外视觉输入或计算开销,训练目标纯粹是学习空间注意力策略。
- 合成场景驱动的 on-policy self-distillation 实现合成到真实迁移。训练仅使用带有坐标标注的合成计数场景,但提升迁移到 CVBench、V*、ZoomBench、BLINK、HR-Bench、MME-RealWorld 等真实基准,平均 +3.23 点。这说明 teacher 利用空间特权信息生成高质量推理链,student 模仿这些链式推理,可以隐式学习通用的视觉 grounding 能力,而无需在目标域数据上微调。这种零标注、可扩展的范式为 MLLM 后训练提供了新思路:设计廉价的程序化特权信息,诱导模型学习跨任务的空间推理。
方法
输入与数据生成
模型输入包含 图像、自然语言问题 以及仅用于 teacher 的 空间引导文本。训练数据来自 程序化生成场景(Procedural Scene Generation),通过可配置规则合成包含多个物体的图像,并自动附带每个物体的类别标签和二维坐标,完全无需人工标注。
关键模块:师生自蒸馏
采用 on-policy self-distillation 框架,维护一个 teacher(学生模型的冻结或 EMA 副本)和一个 student。
- teacher 前向:在由当前 student 策略采样得到的 prompt 下,teacher 额外接收文本形式的 空间引导,例如描述相关物体及其坐标的元数据。teacher 利用这些坐标定位多个相关图像区域,从原始图像中提取并整合视觉证据,生成更准确的目标 token 分布。
- student 学习:student 仅接收图像和问题,不接触空间引导。它以 teacher 的输出分布作为监督信号,通过 KL 散度或序列级交叉熵损失,学习如何在无特权信息时复现 teacher 的推理行为。
输出与训练目标
训练完成后只部署 student,推理时不使用任何空间引导或额外标注。输出为模型根据输入图像和问题生成的最终回答。由于 post-training 仅使用合成场景,但空间定位能力被蒸馏到 student,该方法支持 synthetic-to-real transfer。
与同类方法差异
与基于 视觉裁剪特权信息 的方法(如提供 image crops 或 zooming)不同,本文使用 文本形式的空间引导 作为 teacher 特权信息,避免依赖人工 grounding 标注或外部教师模型,且能通过程序化生成无限扩展训练数据。
实验
实验设计
提出 Where-OPD 方法,利用程序化生成的合成场景自动获取物体身份和空间坐标,作为文本形式的空间引导。教师模型接收该引导,定位并整合多个相关图像区域证据;学生模型仅从图像和问题学习复现教师行为。评估覆盖计数、文档、图表理解基准,以及真实世界感知基准 CVBench、V*、ZoomBench、BLINK、HR-Bench、MME-RealWorld。
关键发现
- 仅在合成场景上 post-training,即可在多个真实世界感知基准上实现平均 3.23 点 提升。
- 在计数、文档、图表理解任务上持续改进,证明空间引导特权信息能诱导更广泛的感知能力。
- 合成到真实的迁移显著,不局限于 post-training 使用的任务或数据分布。
与基线对比
- 对比近期使用视觉特权信息(如图像裁剪)的 on-policy self-distillation 方法,Where-OPD 无需人工标注的 grounding 数据或外部教师模型,且不局限于需要视觉缩放的任务。
- 论文还比较了 GRPO 与监督微调基线,但摘要未给出具体数字,仅报告方法自身的提升。整体表明,文本形式的空间引导在泛化性上优于依赖视觉裁剪的方案。
行业影响
落地场景
Where-OPD 适用于需要 MLLM 进行细粒度视觉推理的产品,例如电商平台的商品详情问答(计数、属性识别)、企业文档 / 图表理解、医学影像报告辅助生成、自动驾驶场景理解。无需人工标注的合成场景训练,特别适合数据获取受限但要求高可靠性的业务。
商业价值
主要收益在降本与体验提升:省去大规模人工标注和外部教师模型,程序化生成无限场景可低成本扩展训练数据;模型在 CVBench、V*、ZoomBench 等真实感知基准上平均 +3.23 点,计数、文档、图表任务明显改善,直接提升用户信任和转化率。推理不增加额外开销,部署成本不变。
与现有产品 / 工作流接口
该技术定位为 MLLM 的 post-training 阶段:使用 EMA 教师模型 + 空间引导文本,插入现有 SFT 或 RLHF 流水线之后。训练只需合成场景与对应坐标标注,可通过 on-policy self-distillation 直接作用于开源 MLLM(如 LLaVA、Qwen-VL 等)。模型权重替换即可部署,无需改变推理架构。
具体用例:
- 电商商品审核与问答:用户询问“图中有几件商品?哪些在左侧?”模型借助空间引导学习定位和计数,减少延迟并提升准确率,可整合进商品详情页或客服机器人。
- 财务 / 企业文档分析:对图表、合同中的关键数字和位置关系进行问答,支持自动报表解读和审计辅助,降低专家人工复核成本。
局限
- 论文方法依赖程序化合成场景的物体身份与坐标作为特权空间引导,这类标注在真实场景中难以自动获得,因此训练范式难以直接扩展到大规模真实数据;尽管实验显示跨域迁移,但合成场景的视觉复杂性、遮挡、光照、文本多样性等与真实分布仍存在 gap,可能限制模型在复杂真实图像上的泛化上限。
- 教师模型在训练时接收精确的空间文本坐标来定位相关区域,但学生仅从原始图像和问题学习,缺少显式的空间推理监督 signal;这可能使学生学到的是一种隐式的、任务相关的注意力策略,而非可解释的空间理解能力,在需要精确定位或开放域空间推理的任务上效果不明确,且论文未深入分析学生内部是否真正形成了空间 grounding。
- 实验主要评估计数、文档/图表理解等与空间定位强相关的基准,对一般视觉问答、推理或对话任务覆盖不足;此外,相对基线提升幅度为平均 3.23 点,绝对增益有限,且未与更多现代 MLLM 或更强的视觉特权蒸馏方法(如使用真实图像 crop 的 zoom 类方法)直接进行系统对比,说服力有待加强。