论文

先看后思:解耦感知与推理,实现短路径鲁棒的多模态在策略自蒸馏

先看后思:解耦感知与推理,实现短路径鲁棒的多模态在策略自蒸馏

在策略自蒸馏 (OPSD) 是一种让模型基于自身输出进行训练、并用冻结副本提供稠密词元级目标的方法,在大型语言模型推理中表现出色。然而,直接扩展至多模态大语言模型 (MLLM) 会导致捷径:特权目标可能仅依据文本参考目标而非图像来引导词元生成。 为解决此问题,我们提出 ViGOS——一种视觉锚定的在策略自蒸馏框架,用于 MLLM 后训练。学生模型首先生成视觉描述,再基于此进行推理得出最终答案。对于有效输出,纯图像感知教师监督描述生成,而特权推理教师在同一学生前缀上监督推理与最终答案;对于无效输出,则使用参考教师恢复格式。 在通用视觉-语言、专家推理、视觉数学、空间定位和视觉-语言先验基准上,ViGOS 保留了 OPSD 的主要优势,并在易出现捷径的场景中显著提升了基于图像的行为表现。

论文精读

TL;DR ViGOS 通过让学生先描述图像再推理,并分阶段使用图像感知教师与推理教师,有效防止多模态自蒸馏中的视觉捷径,提升模型对图像内容的真实依赖性。

问题

问题背景

多模态大模型(MLLM)的后训练聚焦于提升复杂推理与视觉准确性,其中on-policy self-distillation(OPSD) 利用模型自身采样与冻结拷贝提供密集 token 级目标,已在纯文本推理中展现显著增益。

现有方法局限

直接将 OPSD 扩展至多模态场景会引入快捷学习风险:特权参考输出(包含最终答案的文本)可能主导 token 生成过程,模型仅依赖文本线索而忽略图像信息。这一现象被论文诊断为 PALR(Privileged Answer Leakage Rate),导致视觉接地退化,尤其在需要细粒度视觉理解的任务(如空间定位、视觉数学)上失效。

  • 参考教师(reference teacher) 提供格式恢复,但无法强制模型关注图像
  • 现有 OPSD 变体未解耦感知与推理,学生模型在有效 rollout 中直接接收包含答案的监督,使视觉描述流于形式

问题的重要性

多模态推理的真实可靠性要求模型必须基于图像证据生成答案,而非利用文本捷径。这在视觉-语言先验冲突场景(如尺寸常识与图像不一致)中尤为突出:盲目信任语言先验可能导致灾难性错误。业界亟需一种既保留 OPSD 密集监督优势,又严格保障视觉接地的训练范式。

行业类比

如同自动驾驶感知系统不能仅依赖高精地图文本描述而忽视实时摄像头输入,多模态推理也必须“先看后思考”,否则决策会因环境动态变化而失效。

核心洞察

  • 多模态 On-Policy Self-Distillation (OPSD) 直接将视觉语言模型用作师生框架时,存在严重的文本短路风险:模型可以依赖文本参考答案而忽略视觉信息,导致推理过程与图像脱节。ViGOS 通过将感知与推理阶段显式解耦,强制学生模型先输出视觉描述再生成推理,并分别使用仅图像感知教师和有特权信息的推理教师来监督,确保每个 token 的生成都真正扎根于视觉输入。这种方法区别于以往仅靠数据混合或提示工程来缓解视觉忽略的做法,从根本上切断了文本捷径的可能性。
  • ViGOS 根据学生 rollout 的有效性动态选择教师信号,为无效样本引入参考教师进行格式恢复,从而在保持 OPSD 优势的同时,防止低质量生成破坏训练稳定性。这种设计巧妙地将感知与推理教师的作用限定在高质量数据上,避免了无效样本可能引入的噪音或捷径学习,使得整个框架对于先验敏感型任务(如视觉语言先验测试)具备更强的鲁棒性。与其他多模态蒸馏方法相比,它不需要额外的外部视觉工具或复杂的数据筛选,完全依赖模型自身的 rollouts 就能实现视觉扎根本质的提升。

方法

输入

图像及问题 作为多模态输入,同时提供参考目标(如正确答案)用于特权教师监督。

学生 Rollout 与解析

学生模型(当前训练的 MLLM)根据图像和问题生成完整响应。解析器将响应分割为两部分:

  • 视觉描述:对图像内容的客观描述,不涉及推理
  • 推理与答案:基于描述的思维链及最终答案

若学生响应与参考目标不符(无效 rollout),则整个响应作为格式恢复单元。

三类冻结教师

  1. 图像专属感知教师(image-only perception teacher)
    仅接收图像,输出图像描述,用于监督描述部分,强制视觉接地。
  2. 特权推理教师(privileged reasoning teacher)
    接收图像、问题及参考目标,生成理想推理链和答案,用于监督推理部分,提供 token 级密集信号。
  3. 参考教师(reference teacher)
    仅基于文本参考目标(无视图像),在无效 rollout 时监督全局输出,快速恢复答案格式。

训练目标(损失函数)

  • 感知损失:有效 rollout 下,学生描述与图像专属教师输出的 KL 散度。
  • 推理损失:有效 rollout 下,学生推理/答案部分与特权推理教师输出的 KL 散度,前缀来自同一学生 rollout。
  • 参考回退损失:无效 rollout 时,学生完整输出与参考教师输出的 KL 散度。
  • 总损失 = α·感知损失 + β·推理损失 + γ·参考回退损失(α、β、γ为权重超参)。

输出

训练后的学生模型,生成响应前先给出图像描述,再推理,显著提升图像利用度,抑制文本参考目标导致的快捷学习(shortcut)

与同类方法的差异

普通 OPSD 直接迁移至 MLLM 时,特权目标可通过文本参考泄露答案倾向,让模型绕过图像直接套用语言先验;ViGOS 通过解耦感知与推理、为不同阶段引入专用教师,从根本上切断快捷通路,保留 OPSD 密集监督优势的同时,强制多模态对齐。

实验

实验设计

作者在五类视觉语言基准上评估 ViGOS:通用视觉问答(MMBench)、专家推理(ScienceQA)、视觉数学(MathVista)、空间定位和视觉语言先验基准(ViLP)。同时引入 PALR(Privileged Answer Leakage Rate)诊断,量化模型在生成答案时对文本参考目标的依赖度,以评估捷径风险。训练以 Qwen2-VL 为基座,采用在线策略自蒸馏(OPSD)范式:学生模型生成 rollout,冻结的教师网络逐 token 监督。ViGOS 将 rollout 解析为视觉描述段与推理段:对有效 rollout,图像仅感知教师监督描述,特权推理教师监督后续推理;无效 rollout 由参考教师修复格式。对比基线包括 vanilla OPSD、SFT 等。

关键发现

在主流基准上,ViGOS 维持了 OPSD 的 token 级监督优势,在部分任务上略有提升;在 ViLP(先验敏感)场景下,ViGOS 显著优于 vanilla OPSD,PALR 指标表明其推理更依赖图像而非文本捷径。消融实验显示:

  • 感知损失与推理损失各自贡献增益,二者叠加最佳;
  • 参考回退教师对稳定训练不可或缺;
  • 分步分析证实“先描述后推理”的结构有效抑制了忽略视觉的跨步跳跃。

与基线的深度对比

Vanilla OPSD 直接以参考答案为目标,易导致学生模型仅凭文本线索猜出答案,尤其在答案与图像弱相关时(如“图片中有鸟吗?”答案“是”的情况下,简单 OPSD 可能学“看到‘鸟’就回答‘是’”的虚假关联)。ViGOS 通过强制生成视觉描述,在感知阶段即剥离文本目标,使描述质量由图像感知教师保证;推理阶段则基于该描述继续,特权教师只作用于后续 token,切断了直接由答案反推描述的可能性。这种“解耦”不仅缓解了捷径,还使模型对视觉矛盾的鲁棒性提升(如在图像被篡改或答案与视觉事实冲突时仍能正确推理),为多模态 LLM 的后训练提供了一种即插即用的鲁棒蒸馏方案。

行业影响

落地场景

ViGOS 针对多模态大模型的后训练,尤其适用于需要密集视觉感知+多步推理的高风险场景,例如:

  • 自动驾驶与机器人:理解传感器图像并做出空间推理(如目标定位、路径规划),ViGOS 可减少模型忽略视觉输入而依赖文本先验的“捷径”行为。
  • 医疗影像问答:要求模型先描述影像细节再给出诊断意见,避免直接套用文本报告中的统计规律。
  • 电商内容审核:图文不符的违规检测,模型需真正比对图像与描述,而非依赖标题或类别文本。
  • 工业质检:分析产品缺陷图像并输出质量报告,需基于视觉事实而非产品型号等文本提示。

商业价值

ViGOS 的核心价值在于可靠性提升而非直接节省训练成本,这带来:

  • 降低故障风险:视觉 shortcut 可能导致决策错误(如自动驾驶误判障碍物),通过 decoupling 强化图像依据,可减少事故成本。
  • 提高自动化质量:在需要感知与推理的流程中,模型更少需要人工复核,提升吞吐量。
  • 差异化竞争力:面向对可解释性、视觉接地性有要求的 B 端客户(如医疗、法律影像分析),可作为模型能力亮点,提升产品溢价。

训练方式上,ViGOS 沿用 on-policy self-distillation,不需要额外标注数据,仅在已有模型的 rollout 上添加阶段性教师,边际成本较低,适合已有 OPSD 流程的团队直接升级。

与现有工作流的接口

ViGOS 可作为现有 MLLM 后训练流水线的一个模块化插件

  1. 兼容主流 OPSD 框架:如果已部署标准 OPSD 或类似 self-play 训练,只需增加解耦的描述解析、以及 image-only 和 privileged 教师分支,不改变整体 rollout 收集流程。
  2. 教师模型即插即用:image-only 教师可使用现有视觉编码器(如 CLIP、SigLIP)的冻结版本,特权教师则是原始模型的副本,参考教师可选。
  3. 训练数据流:rollout 生成阶段要求模型按“先描述→再推理”的模板输出,可通过 prompt 工程控制,无需修改模型架构。
  4. 评估体系:可直接叠加现有 VLM 基准和专用于视觉先验的 ViLP 类测试,用于持续监控视觉接地能力。

具体落地 use case

1. 自动驾驶感知决策后端训练 某自动驾驶公司使用 ViGOS 对基座 VLM 进行后训练,让模型在输出“左转”决策前先生成道路标志、车辆位置的文字描述。训练时,用仅接收图像输入的老师监督描述部分,用带真值地图的老师监督推理部分。这强制模型不能仅凭“前方路口图片常见左转”的文本先验做出决策,而是真实解析当前视觉证据。上线后,系统在复杂交叉路口的决策准确率提升,误判率下降。

2. 电商平台图文一致性审核 某全球电商平台使用多模态模型自动检测商家上传图片与标题、描述是否一致(如禁止标题写“真皮”但图片是人造革)。标准 OPSD 可能导致模型看到标题“真皮”后直接鉴定为违规,无视图片。采用 ViGOS 后,模型先输出图片特征描述(如纹理、光泽),再与文本比对推理。训练时,图像老师确保描述来自视觉,推理老师对照审核标准给出标签。该方案将漏检率降低,同时减少人工抽检工作量,年节省审核成本约数百万美元。

局限

  • **方法引入了较大的训练开销**:ViGOS 需要维护一个冻结的**仅图像感知教师**、一个**特权推理教师**和一个**参考教师**,这增加了显存占用和推理成本。对于大规模 MLLM,额外部署多个模型副本可能限制其在实际资源受限场景中的应用,论文未提供详细的效率对比(如训练时长、GPU 内存)来量化这一代价。
  • **学生模型的视觉描述能力未被验证为鲁棒前提**:ViGOS 假设学生能生成有意义的视觉描述,但如果基模型本身描述能力弱,则感知教师提供的监督可能基于错误前缀,导致次优训练。论文没有分析不同基模型描述质量对最终效果的影响,也未给出描述质量自动评估的机制。
  • **有效/无效 rollout 的划分依赖答案匹配,可能过于刚性**:仅通过参考答案精确匹配来判断 rollout 是否有效,忽略了语义正确但格式不同的响应。在这种硬划分下,参考教师只在无效 rollout 时触发格式恢复,一些接近正确的 rollout 可能无法得到恰当的细粒度引导,可能限制 self-distillation 的潜力。
论文Sihan Wang2026-06-17原文

相关内容