SCOPD:面向高效视觉语言模型的稀疏上下文在线策略自蒸馏
推理型视觉语言模型(VLM)将图像与视频处理为长序列的视觉 token,导致推理成本高昂。免训练 token 剪枝可降低成本,但激进压缩会显著损害性能,这通常被归因于任务相关视觉信息的不可逆丢失。 我们发现这一解释并不完整。 在固定上下文 Pass@K 分析中,从同一剪枝后的视觉表示重复采样,可以找回许多贪心解码漏掉的样本,说明有用的视觉证据仍可被获取,只是未被可靠利用。我们将其称为表示—利用鸿沟。 基于此,我们提出 SCOPD,一个稀疏上下文在线策略自蒸馏框架:学生模型基于剪枝后的视觉 token 生成推理轨迹,而拥有完整上下文的特权教师模型对相同的在线策略前缀进行监督。SCOPD 无需真实答案、无需改动网络结构,也不增加推理时计算。我们还提出 SCOPD+,通过小视觉预算干预定位对视觉敏感的回复位置,并有选择地蒸馏这些位置。 在 10% 视觉 token 保留率下,Vanilla 模型在 13 个基准上保留了未剪枝性能的 86.37%;SCOPD 将其提升至 90.49%,SCOPD+ 进一步达到 92.43%。跨 token 预算、基准与剪枝算子,结果表明高效推理不仅取决于哪些视觉信息在剪枝后存活,也取决于模型能否学会可靠地使用它们。
论文精读
TL;DR VLMs 推理成本高,本文发现 token 剪枝后性能下降源于表示-利用差距,而非仅信息丢失;提出 SCOPD / SCOPD+ 在线自蒸馏,使模型更可靠利用稀疏视觉 token,10% 保留率下性能 86.37%→92.43%。
问题
当前,推理型视觉语言模型(VLMs)将图像/视频编码为长视觉 token 序列,导致自回归推理开销高昂。训练无关 token 剪枝可降低成本,但激进压缩常导致性能大幅下滑。
现有方法局限:主流无训练剪枝方法假设被剪掉的视觉 token 包含不可恢复的任务信息,因而聚焦于优化保留子集。但本文的固定上下文 Pass@K 分析表明,在相同剪枝表示上重复采样能恢复大量贪心解码失败的样本,说明视觉证据仍然可达,只是模型利用不可靠。作者将这一现象称为 表征-利用差距(representation-utilization gap)。仅改进剪枝算子无法解决该问题,因为瓶颈在于模型策略而非数据保留。
为什么难/重要:该问题同时涉及离散子集选择(保留哪些 token)与策略学习(如何利用保留 token),两者耦合紧密,难以解耦优化。无训练方法无法调整模型行为,全量微调则成本高且易破坏通用能力。SCOPD 采用在线策略自蒸馏:剪枝学生生成推理轨迹,特权全上下文教师蒸馏同一前缀,无需标注答案、架构改动或额外推理计算。这为高效多模态推理提供了新的训练范式,对受推理成本约束的行业场景有直接价值。
行业类比:类似移动端部署大模型时,仅对骨干网络做剪枝/量化不够,还需让推理策略适配受限上下文,否则保留的信息也无法被可靠调用。
核心洞察
- 剪枝后性能下降的根因不仅是视觉信息丢失,更是模型对保留信息的利用不可靠,即 representation-utilization gap。固定上下文 Pass@K 分析显示,在同一剪枝视觉表示上重复采样能恢复许多 greedy 解码错过的正确回答,说明关键视觉证据仍然可访问但未被稳定使用。这挑战了以往将性能损失归因于不可逆信息损失的主流假设,将优化目标从“保留哪些 token”转向“如何让模型可靠利用保留 token”,为训练式补偿方法提供了新依据。
- SCOPD 提出 sparse-context on-policy self-distillation,让剪枝后的学生模型生成推理轨迹,full-context 教师模型对同一 on-policy 前缀进行监督,全程无需 ground-truth 标签。与需要外部标注或离线数据的传统蒸馏不同,SCOPD 利用模型自身在完整上下文下的推理能力作为监督信号,实现策略内对齐。该方法无需架构改动或推理时额外计算,可泛化到不同剪枝算子和 VLM 架构,为高效视觉推理提供了一种低成本的训练范式。
方法
输入与框架
SCOPD 以视觉语言模型(VLM)为骨干,输入为图像或视频编码后的长视觉 token 序列与文本 prompt。学生模型接收经训练时剪枝后的稀疏视觉 token(如保留 10%),生成推理轨迹;教师模型使用完整视觉上下文,对学生生成的 on-policy 前缀(即学生自己采样的序列)进行监督。蒸馏损失采用 KL 散度或类似形式,不依赖 ground-truth 答案,也不改变模型架构。
关键模块
- 稀疏上下文推理:学生仅在保留的视觉 token 上自回归生成,推理阶段无额外计算开销。
- on-policy 自蒸馏:学生采样得到前缀,教师对该前缀的 logits 提供监督,缩小稀疏与全上下文表示之间的利用差距。
- 视觉敏感位置识别(SCOPD+):通过一个小型视觉预算干预(例如保留极少额外 token 或附加轻量探测器),估计每个生成位置对视觉信息的敏感度,仅对高敏感位置的 token 施加蒸馏,其余位置使用常规语言建模损失。
输出与效果
训练后,学生模型可在相同稀疏视觉输入下推理,无需教师参与。在 13 个基准上,10% 视觉 token 保留率下,SCOPD 将基础模型性能从 86.37% 提升至 90.49%,SCOPD+ 进一步提升至 92.43%,且可泛化到不同剪枝算子和视频理解任务。
与同类训练时剪枝蒸馏方法相比,SCOPD 无需真实标注、不增加推理开销,并通过 on-policy 采样和视觉敏感度感知的选择性蒸馏,更有效地缓解了表示-利用差距。
实验
实验设计
在 13 个多模态基准上评估,涵盖图像与视频理解任务。使用多种视觉 token 剪枝算子,测试不同保留率(如 10%)。基线包括 Vanilla 模型(直接剪枝)、训练时剪枝方法等。此外,通过固定上下文 Pass@K 分析验证表示-利用差距。
关键发现
- 在 10% 视觉 token 保留率下,Vanilla 模型保留 86.37% 性能,SCOPD 提升至 90.49%,SCOPD+ 达到 92.43%。
- 实验表明,即使视觉信息未完全丢失,模型可能无法可靠利用,这称为 表示-利用差距。SCOPD 通过 on-policy 自蒸馏让学生在剪枝后的视觉上下文上生成推理轨迹,由全上下文教师监督,缩小该差距。
- SCOPD+ 进一步通过视觉敏感度识别关键 token 位置进行选择性蒸馏,在多个 token 预算、基准和剪枝算子上均表现稳健。
与基线对比解读
SCOPD 无需真实标签、无需架构改动、不增加推理成本,相比需要额外训练或架构调整的方法更轻量。与 Vanilla 直接剪枝相比,SCOPD 和 SCOPD+ 分别提升 4.12 和 6.06 个百分点,证明模型学习如何可靠利用保留信息的重要性。SCOPD+ 的选择性蒸馏策略在保持效率的同时进一步提升性能,体现了对视觉信息利用的精细控制。
行业影响
落地场景
SCOPD 面向 视觉-语言模型 (VLM) 的高推理成本问题,适用于所有需要处理图像/视频的多模态应用:电商商品识别与描述生成、内容平台视频摘要与审核、医疗影像辅助诊断、自动驾驶场景理解、企业服务中的文档与图表分析等。尤其适合推理量大的云端 API 服务、边缘设备实时处理以及长视频批处理任务。
商业价值
核心价值在 降本与体验提升。通过将视觉 token 保留率降至 10% 并保持 92.43% 的无剪枝性能(论文数据),可大幅降低推理算力与内存开销,直接转化为 API 服务商的毛利改善或客户侧的更低延迟。对于按 token 计费的商业化模型,降低视觉 token 数意味着更低的单位成本,同时保持输出质量,可增强价格竞争力。在边缘部署场景,可降低硬件门槛,扩大应用范围。
与现有工作流的接口
SCOPD 是一种后训练自蒸馏方法,不要求架构改动或额外推理时计算。集成路径清晰:在已有 VLM 微调流程中加入一个蒸馏阶段,学生模型使用剪枝后的视觉 token 生成推理轨迹,教师模型使用全量 token 监督同一批前缀。训练完成后,直接部署学生模型即可,无需额外插件。该框架与主流 training-free 剪枝算子兼容,可作为统一增强层叠加在现有剪枝方案之上。
具体 use case
- 电商商品视频理解:某电商平台需要为海量商品视频自动生成标签与描述。使用 SCOPD+ 将视觉 token 保留率设为 10%,推理成本下降约 90%,同时生成描述质量接近完整输入。这直接提升吞吐量,允许平台在相同算力下处理更多视频。
- 自动驾驶数据挖掘:自动驾驶公司积累大量路测视频,需提取关键事件(如急刹车、行人穿行)。用 SCOPD 训练后的 VLM 可快速扫描视频流,以低计算成本完成事件检测与描述,加速数据闭环。
局限
- **训练依赖全上下文教师模型**:SCOPD 与 SCOPD+ 均需要未剪枝的完整 VLM 作为特权教师进行蒸馏,这要求使用者能够访问并运行完整模型。在模型权重受控或部署环境资源有限时,该方法难以应用。此外,蒸馏过程引入额外的训练计算,虽无推理时开销,但相比纯粹训练自由剪枝(如 FastV)增加了训练阶段的工程复杂度与成本,可能限制在快速迭代场景中的适用性。对于已经压缩至边缘设备的模型,重新训练可能不可行。
- **视觉敏感位置识别的鲁棒性未充分验证**:SCOPD+ 通过小视觉预算干预确定蒸馏目标,其性能可能对超参数(如 ρ 和 δ)及基准分布敏感。论文仅在部分基准上展示结果,未系统评估跨域迁移(如从自然图像到医学影像)或极端压缩率(如 5% token 保留,附录 D 虽有提及但正文未详细讨论)下的表现。与直接端到端训练的高效 VLM 相比,该方法引入了额外的后训练蒸馏阶段,且对剪枝算子的泛化性虽在 Q2 中验证,但缺乏与在线剪枝策略组合的分析。
- **评估指标与真实推理可靠性存在差距**:论文主要使用基准准确率衡量改进,但 representation-utilization gap 涉及模型对保留视觉信息的使用可靠性,现有指标未直接量化推理不确定性或一致性。在真实开放域生成任务中,剪枝后模型可能对特定视觉属性(如文字、空间关系)产生系统性偏差,实验未覆盖此类细粒度评估。除此之外,尽管方法声称无需 ground-truth 响应,但训练数据仍依赖教师生成的推理轨迹,若教师本身存在错误推理,学生可能继承并强化这些偏差,影响可靠性。