视觉对比自蒸馏 (Visual Contrastive Self-Distillation)
策略内自蒸馏 (OPSD) 去除了策略内蒸馏所需的外部教师,但仍需教师与学生间的非对称信息以确保自教师提供更强的学习信号。现有方法通过特权答案或视觉证据构建非对称性。本文探索是否可同时移除两者,得到一种仅由输入条件驱动的更简形式。 为此,我们提出 VCSD (Visual Contrastive Self-Distillation),将图像内容擦除转化为策略内自蒸馏信号。在每个学生生成的响应前缀处,指数移动平均 (EMA) 教师在相同提示和前缀下产生两个下一词元分布:一个以原始图像为条件,另一个以内容擦除的控制为条件。二者的词元级对数概率差突出那些因实例级视觉内容而可能性增加的候选词。利用该对比,我们锐化教师原始图像分布在其合理支撑内的概率,并将得到的完整分布目标蒸馏到学生中。 在 ViRL39K 数据集上,VCSD 在 Qwen3-VL 和 Qwen3.5 模型上持续优于匹配的 OPSD。例如,在 Qwen3-VL 上,七基准聚合得分在 2B 规模从 62.27% 升至 67.04%,4B 从 71.30% 升至 73.16%,8B 从 72.51% 升至 76.26%。此外,VCSD 无需外部教师、特权答案、视觉证据信号、推理轨迹或额外推理代价。
论文精读
TL;DR VCSD 通过对图像做内容擦除构造对比自蒸馏信号,无需外部教师或答案先验,在多个 VLM 上显著提升 benchmark 分数,且无额外推理开销。
问题
问题背景
随着视觉语言模型(VLM)在复杂推理与理解任务上的应用深化,如何低成本、高效率地提升模型性能成为产业界关注焦点。On-policy self-distillation (OPSD) 通过让学生模型从自身策略生成的轨迹中自蒸馏,避免了依赖外部大型教师模型的昂贵开销,成为有前景的后训练范式。
现有方法局限
当前 OPSD 仍需制造教师与学生之间的信息不对称 才能让自教师提供更强学习信号,常见策略包括:
- 引入特权答案(privileged answers),即在蒸馏时使用 ground-truth 答案构造教师分布;
- 引入视觉证据信号(visual evidence),如图像增强或对比视图。
这些方法要么依赖额外的人工标注(答案),在推理时不可用从而导致训练-推理不一致;要么依赖精心设计的图像变换和对比策略,增加了系统复杂度与超参数调优负担。本质上,它们都未能摆脱对非输入条件的外源信息 的依赖。
为什么这个问题难/重要
完全移除特权答案与视觉证据,仅利用输入条件(image conditioning)自身产生自蒸馏信号,是一个极具挑战但价值巨大的目标。难点在于:如何在不引入任何额外模型、答案或变换的前提下,从原始输入中提取出“视觉内容对 token 预测的贡献度”这一监督信息。成功解决该问题,将使得 OPSD 的训练流程极度简洁,无需修改数据或模型架构,可无缝嵌入现有 VLM 训练管线,极大降低规模化自蒸馏的门槛。尤其在 VLM 规模指数增长的当下,产业界迫切需要此类“零额外成本”的性能增强方法。
行业类比
类似自动驾驶系统通过对比完整图像与被遮挡关键区域后的图像,让感知模型自主聚焦于真正重要的视觉线索,提升长尾场景下的决策可靠性。
核心洞察
- **纯输入条件化的在策略自我蒸馏**: VCSD 通过对比原始图像与内容擦除后的控制图像,从学生模型自身生成的前缀中提取仅由视觉内容驱动的 token 概率差异作为蒸馏信号,完全消除了对特权答案、视觉证据或外部教师等非对称信息的依赖,将自我蒸馏简化为纯粹的输入条件化对比,这一极简范式显著区别于已有 OPSD 方法。
- **基于实例级视觉对比的隐式 grounding 与分布锐化**: 该工作将图像内容移除转化为对比信号,利用 token 级对数概率差异突出因实例视觉内容而概率提升的候选 token,在教师分布的 plausible support 上锐化原始图像条件,既实现了对视觉相关知识的精细调节,又保持了完整的分布监督,无需推理时额外开销即能稳定提升多模态模型的基准表现,为高效自我蒸馏提供了新思路。
方法
输入与蒸馏框架
VCSD 建立在 On-Policy Self-Distillation (OPSD) 框架之上。训练时,学生模型自回归地生成响应前缀,以此前缀作为后续蒸馏的上下文。关键输入包括:
- 原始图像
- 同一图像的内容擦除控制图(通过随机掩码或模糊等方式构造)
- 相同的文本 prompt
核心模块:视觉条件对比
对于学生生成的每一个前缀,EMA 教师(学生模型的指数移动平均)执行两次条件推理:
- 以原始图像为视觉条件,得到下一个 token 的分布 (p_{\text{orig}})
- 以内容擦除控制图为视觉条件,得到分布 (p_{\text{ctrl}})
计算两个分布中每个 token 的 log-probability 差值: [\Delta = \log p_{\text{orig}} - \log p_{\text{ctrl}}]
该差值直接量化了每个候选 token 的似然因实例级视觉内容而被提升的程度——视觉关联越强的 token,(\Delta) 越大。
输出:对比锐化后的蒸馏目标
VCSD 并不直接使用 (p_{\text{orig}}) 作为教师分布,而是利用 (\Delta) 对 (p_{\text{orig}}) 进行锐化:
- 在教师分布的合理支持集内(plausible support),将 (\Delta) 作为权重重分配概率,使得与视觉内容高度相关的 token 获得更高概率
- 被锐化的目标分布保留了原始分布的多样性,同时强化了视觉对齐的 token
最后,通过 KL 散度等损失函数,将锐化后的全分布目标蒸馏到学生模型中,学生以 on-policy 的方式学习自身前缀下的视觉对齐预测。学生参数更新后,EMA 教师随之缓慢更新。
与同类方法的差异点:现有 OPSD 方法通过特权答案(如 ground-truth 文本)或视觉证据(如检测框、分割掩码)构建师生不对称性;VCSD 首次证明仅通过图像内容移除这一简单的输入条件操作,就能生成高质量的自蒸馏信号,完全去除了对额外标注或外部模型的依赖。
实验
实验设计
在 ViRL39K 数据集上,以 Qwen3-VL 和 Qwen3.5 系列模型为基础,采用 on-policy 自蒸馏框架进行训练。评估使用 7 个多模态基准的聚合得分,基线为 matched OPSD(On-Policy Self-Distillation)。消融实验覆盖 plausibility restriction、contrastive strength、控制图像构造等关键模块。
关键发现
- VCSD 在所有模型规模上一致超越 OPSD,且无需外部教师、特权答案、视觉证据信号或额外推理成本。
- 核心机制:教师模型在相同 prompt 和 prefix 下分别基于原图与内容擦除控制图生成 next-token 分布,计算 token-wise log-probability 差,形成视觉条件对比信号,用于锐化教师分布并蒸馏给学生。
- 小模型受益更明显:Qwen3-VL 2B 从 62.27% 提升至 67.04%(+4.77%),4B 从 71.30% 到 73.16%(+1.86%),8B 从 72.51% 到 76.26%(+3.75%)。
与基线对比的深度解读
相比需要外部教师或特权信息的 OPSD 变体,VCSD 仅依赖输入条件的差异(原图 vs. 擦除图)产生教师-学生不对称信息,彻底简化了训练管线。该方法将图像内容移除转化为自蒸馏信号,保持 on-policy 轨迹对齐的优势,同时避免依赖更强外部模型,对实际多模态模型迭代部署具有重要工程价值——无需额外大模型即可实现持续性能提升。
行业影响
落地场景
VCSD 为多模态大模型(VLM)提供了一种低成本、高收益的自蒸馏增强方案,适用于任何依赖 细粒度视觉理解 和 指令遵循 的产品场景。具体包括:
- 电商与内容平台:商品图片描述生成、视觉搜索、UGC 内容审核。
- 企业服务与自动化:财报/合同扫描件中的图表解读、GUI 导航、工业质检报告生成。
- 自动驾驶与具身智能:复杂场景的视觉推理与指令遵循,提升安全性。
- 医疗影像分析:辅助报告生成,提高细微病灶的捕获率。
商业价值
- 降本:无需外部教师模型或人工标注的推理链/特权信息,显著降低 post-training 的计算与数据成本。
- 增收:更准确的视觉回答直接提升用户信任与转化率(如商品推荐、检索精度),增强产品竞争力。
- 体验提升:模型能更稳定地关注图像中的实例证据,减少幻觉,使交互更可靠、更自然。
与现有工作流的集成方式
VCSD 是一种轻量级训练方法,可无缝插入现有 VLM post-training 流水线:
- 数据侧:只需对训练集图像生成内容擦除的“控制图”(如像素化、模糊等),其余 prompt/输出不变。
- 模型侧:保持模型架构不变,采用 EMA 更新的教师模型策略,与现有蒸馏框架(如 TRL 或自定义训练循环)兼容。
- 推理侧:无任何额外开销,蒸馏后的学生模型可直接部署,对延迟和计算量零影响。
具体落地用例
- 用例一:奢侈品电商的视觉描述生成
平台需为每件商品自动生成风格化的文案。VCSD 增强的 VLM 能精准辨识材质纹理、品牌 Logo 等细节,避免描述错误导致退货纠纷,同时减少人工编辑的昂贵成本。 - 用例二:社交媒体 UGC 内容安全审核
视频/图文平台每天需审核海量内容。VCSD 提升模型对违规图片(如隐性暴力、敏感标志)的判别力,降低误判率,减少人工审核团队的工作负荷,在合规前提下提升内容分发效率。
局限
- **方法局限于多模态模型**:VCSD 的核心是通过对比原始图像与内容擦除控制图像来构造教师分布,这天然依赖视觉输入,无法直接扩展到纯文本模型或非视觉模态任务。对于文本生成、代码生成等场景,该方法不适用,限制了其作为通用自蒸馏框架的潜力。
- **控制图像构造方式影响显著**:论文消融实验(4.6节)表明,不同的控制图像构造策略(如像素模糊、随机遮挡、固定颜色填充)会导致性能差异,且最优策略可能随数据集或任务变化。这种敏感性意味着实际部署时需要额外的超参数搜索,增加了工程调优成本。此外,对于复杂图像,简单的擦除可能无法完全消除语义线索,影响对比信号的质量。
- **实验覆盖面有限**:所有实验仅基于 ViRL39K 合成数据集和 Qwen3-VL / Qwen3.5 模型族,未在其他多模态架构(如 LLaVA、Molmo)或更大规模真实场景数据上进行验证。尽管 2B–8B 参数范围内提升一致,但方法在更大规模模型(如 >70B)或不同预训练策略下的可迁移性尚不明确,可能面临 EMA 教师稳定性、蒸馏效率等新的挑战。