论文

自监督视觉在策略蒸馏

自监督视觉在策略蒸馏

视觉在策略蒸馏 严重依赖信息丰富的师生不对称性,通常来自更大更强的教师或特权监督(如参考答案、真实兴趣区域)。这引出一个根本问题:当没有任何特权信息可用时,不对称性从何而来?我们通过颠倒不对称性的来源来回答:不是向教师添加特权信息,而是从学生中减去信息。这种不对称方式能免费产生与教师获取学生不可见信息时相同的有效学习信号——无需标注、奖励或单独的大型教师模型。 基于这一原理,我们提出 S²VOPD(Self-Supervised Visual On-Policy Distillation),一种简单而有效的方法:将教师以原始图像为条件的在策略分布,蒸馏到学生以同一图像强增强视图为条件的分布。我们系统探索视觉增强设计空间,得到三点核心发现: 1. 不对称性至关重要:所有四类增强函数均提升性能,而对称自蒸馏反而造成性能下降。 2. 强度存在最优区间:性能在中等增强强度时达到峰值。 3. 差异必须保持任务一致性:若增强完全移除问题相关证据,会产生大而无信息量的偏差,危害学习。 在 6 个细粒度感知基准 上,S²VOPD 将 Qwen3.5-4B 的准确率从 70.7% 提升至 77.4%,超越所有对比的开源模型(含 Qwen3-VL 235B),并超过 GPT-5.4。在训练数据相同的条件下,它恢复了特权信息方法所带来提升的 96%。项目主页:https://williamium3000.github.io/s2vopd

论文精读

TL;DR S²VOPD 通过不对称增强视图的自蒸馏,无需特权标注或更大教师,让小型视觉语言模型在细粒度感知上大幅提升,甚至超越大模型。

问题

问题背景

视觉 on-policy distillation (OPD) 领域当前关注如何构建有效的教师-学生不对称性,以提升小模型在多模态感知任务上的表现,常见做法是引入更大教师模型或特权监督(如 ground-truth 区域、参考答案)。

现有方法局限

传统 OPD 依赖“信息不对称”来源:要么教师模型更强(如更大参数量),要么教师拥有特权信息(标注、reward、区域框)。然而这些条件在真实场景中往往不可得:

  • 特权监督成本高:标注细粒度视觉证据(如感兴趣区域)需要大量人工,难以扩展到开放域任务。
  • 依赖强教师:若没有更大更强的教师模型,蒸馏信号不足;对称自蒸馏(教师与学生结构相同且输入相同)缺乏信息差异,甚至导致性能退化。
  • 可用性受限:无标注、无奖励、无外部模型时,现有 OPD 方法基本失效。

为什么这个问题难且重要

核心挑战在于如何在没有特权信息的前提下构造有效的学习信号。论文提出的思路是“倒转不对称来源”:不是给教师添加信息,而是从学生侧减去信息(例如强增强视图),从而产生与特权教师等效的差距。难点在于:

  • 增强策略设计空间大,需要保证“差距”与任务相关,同时不破坏问题相关证据;
  • 细粒度感知任务对视觉细节敏感,过度增强可能导致无信息差异;
  • 业界关注低资源场景下的小模型能力提升,自监督蒸馏符合这一趋势,具有直接落地价值。

行业类比

类似对比学习(如 SimCLR)通过数据增强构造正负样本,将图像变换带来的差异转化为自监督信号,无需人工标注即可学习表征。S²VOPD 将这一思想迁移到 on-policy 蒸馏,让模型从自身的多视图差异中提升细粒度感知能力。

核心洞察

  • **蒸馏中的不对称性可以来自信息减法而非信息加法**。之前的工作要么使用更大的教师模型,要么给教师提供特权监督(如参考答案、ground-truth 区域),而 S²VOPD 反其道行之:保持教师输入原图不变,强迫学生仅观察强增强视图,通过削弱学生可见的信息来制造学习差距。这种方式无需额外模型、额外标注或奖励信号,却产生了与特权教师等价的有效梯度。它打破了“更强的教师或更多信息才能蒸馏”的固有假设,为资源受限场景下的视觉-语言模型后训练提供了极低成本的提升路径。
  • **增强策略的有效性不仅取决于强度,更取决于任务一致性**。论文系统探索了四类增强并发现:所有不对称增强(如遮挡、模糊、裁剪等)都能提升性能,而对称自蒸馏反而有损;性能在中等强度达到峰值,过强增强虽然造成大差异,但若完全移除与问题相关的视觉证据,该差异就失去监督价值。这一发现给出了实际工程中的选择原则:设计增强时应保留足够的问题相关信息,制造可控的、可恢复的扰动,而不是一味追求视觉上的破坏程度。与简单应用强数据增强作为正则化相比,S²VOPD 将增强强度与任务语义绑定,使自蒸馏信号具有方向性。

方法

方法核心

S²VOPD 将 on-policy 蒸馏中的不对称来源从“给教师增加特权信息”反转为“从学生减去信息”。具体流程:

  1. 输入:原始图像 x 与问题提示。
  2. 教师分支:教师模型以原始图像 x 为条件,前向推理得到当前策略下的 token 分布(软标签)。
  3. 学生分支:学生模型以同一图像的强增强视图 x' 为条件,其中 x' 经过裁剪、模糊、遮挡等强视觉扰动,信息量显著少于原始图。
  4. 蒸馏损失:用教师分布作为软标签,计算学生分布与教师分布的差异(如 KL 散度),端到端优化学生模型。教师与学生共享同构网络(或教师为 EMA 权重),但输入不对称。
  5. 输出:训练后的学生模型,在原始图像条件下推理时性能提升。

关键设计原则:

  • 不对称性:原始图与强增强图之间的不对称分布匹配是核心,对称自蒸馏反而会退化。
  • 增强强度:中等强度效果最佳,过强会破坏任务相关证据。
  • 任务一致性:增强不能完全移除问题相关区域,否则产生大但无信息的分布差异。

与原作论断一致:“Rather than adding privileged information to the teacher, we subtract information from the student.”

与同类方法的差异

与依赖特权监督或大型教师模型的 on-policy 蒸馏不同,S²VOPD 通过原始图与增强视图的视觉不对称性,在完全自监督条件下构造有效学习信号,无需任何标注、奖励或额外教师模型。

实验

实验设计叙述

论文在六个 fine-grained perception benchmarks 上评估 S²VOPD,基线为学生模型 Qwen3.5-4B,不引入额外标注或更强教师。方法通过将原始图像作为教师分布,对强增强视图的学生分布进行蒸馏,构建自监督不对称学习信号。对比基线覆盖开源模型(最高至 Qwen3-VL 235B)和专有模型 GPT-5.4,并与使用特权信息(如参考答案、感兴趣区域真值)的方法在相同训练数据下比较。

关键发现

  • 不对称性有效:所有四类增强家族均带来提升,而对称自蒸馏反而下降。
  • 强度需适中:性能在中等增强强度达到峰值。
  • 任务一致性:增强若完全移除问题相关证据,会产生大但无信息的差异。
  • 整体结果:S²VOPD 将 Qwen3.5-4B 从 70.7% 提升至 77.4%,超越所有对比开源模型和 GPT-5.4。

与基线对比解读

在保持训练数据相同前提下,S²VOPD 恢复特权信息方法 96% 的改进,说明通过“从学生减去信息”构造的不对称性几乎可以替代外部特权监督。这为资源受限或缺乏标注场景提供了实用的 fine-grained 感知增强路径:无需更大的教师模型或额外标注,仅靠数据增强策略即可获得大部分收益。工程上需注意增强强度和任务相关性,避免破坏关键视觉证据。

行业影响

落地场景

S²VOPD 适用于需要细粒度视觉理解的轻量级部署场景。例如:

  • 电商商品识别:商品多属性识别(材质、纹理、缺陷)中,微调小型 VLM 达到接近大模型精度,满足移动端或边缘设备延迟要求。
  • 自动驾驶感知:交通标志、车道线等小目标识别,通过不对称增强(随机遮挡、颜色扰动)提升鲁棒性,无需额外标注。
  • 内容审核与检索:敏感图像元素或细粒度分类,通过自蒸馏提升小模型判别力。

商业价值

主要贡献在 降本 与 体验提升 两条线:

  • 降本:避免训练大模型作为教师(节省 GPU 推理与存储成本),且无需特权标注(目标框、参考回答),显著降低人工标注费用。
  • 体验提升:小模型精度提升赋能实时应用(AR 试妆、工业质检),减少云端大模型调用延迟和成本。

与现有工作流集成

  • 训练阶段:即插即用的蒸馏损失,对同一输入构造 teacher(原图)和 student(强增强视图)的前向分布,计算 KL 散度或交叉熵。可集成到 HuggingFace Trainer 或 PyTorch Lightning,不修改模型架构。
  • 数据 pipeline:在现有图像预处理时增加强增强分支,无需额外存储或标注。
  • 推理阶段:完全复用原模型,无额外开销。

注意:增强强度需保持任务一致性,避免移除问题相关证据(如完全遮挡关键区域),否则性能不升反降。

具体 use case:某全球电商平台在商品属性识别中,使用 S²VOPD 将 4B 参数模型提升到超过 235B 模型的精度,节省大量 GPU 推理资源。

局限

  • **对增强策略高度敏感**:方法的核心依赖于构造 `task-consistent` 的增强变换,若增强过强导致问题相关证据被完全移除,会产生大而不具信息量的差异,反而损害性能。论文指出性能在中等强度达到峰值,这意味着实际使用中需要针对具体任务和数据集仔细调参,增加了部署的复杂度与试错成本,削弱了方法的即插即用性。
  • **任务覆盖范围较窄**:实验主要围绕六个细粒度感知基准展开,模型为 Qwen3.5-4B,尚不清楚该方法在更广泛的视觉语言任务(如复杂推理、多模态对话、文档理解)或不同架构上的表现。此外,与使用特权信息的蒸馏方法相比仍存在约 4% 的性能差距,说明纯自监督信号还不能完全替代真实标注或强教师提供的监督。
  • **自蒸馏框架的固有限制**:教师和学生来自同一模型,仅通过输入视图的不对称来创造学习信号,因此无法引入跨模型的知识差异(例如大模型特有的推理能力或更丰富的表示)。在需要更强教师指导的场景下,S²VOPD 可能不如传统的异构模型蒸馏有效。
论文Yijiang Li2026-08-14原文

相关内容