面向细粒度 MLLM 感知的区域级策略优化
MLLM 的细粒度视觉感知常靠提高分辨率来改善,但新增的视觉 token 会推高视觉编码与语言模型 prefilling 开销。受控诊断显示,定位感兴趣区域(RoI)与识别其内容这两个操作对分辨率的需求并不相同:定位 可承受比 识别 强约 3–4 倍 的 token 压缩,因此可以从粗视图定位、把分辨率集中到被选中的证据上。 用 MLLM 直接解码坐标可端到端训练,但每次查询需完整前向,且依赖 grounding 能力;从模型注意力蒸馏出的轻量 proposal network 虽快,却继承了注意力目标的噪声。RoI 要经过离散的区域选择才影响答案,其忠实度无法监督该网络。为此作者提出 Vision-RL2,把连贯区域视作动作,由冻结的 MLLM reader 按「移除该区域后答案似然的变化」打分,并用互补的 subtractive 与 additive 目标抑制干扰提议、找回缺失证据;整个过程只更新预测器,无需区域标注、响应采样或推理轨迹。 精炼后的提议还支持 稀疏编码,放大证据并排除背景 token。在 6 个 细粒度基准与 4 个 MLLM 主干上,Vision-RL2 在每个 token 预算下都优于基座模型,并以约 4 倍 更少的视觉 token 超过其最大预算下的准确率。
论文精读
TL;DR Vision-RL2 用区域级强化学习优化轻量 proposal network,通过减除干扰区域并恢复遗漏证据,在不牺牲精度下将 MLLM 细粒度感知的视觉 token 减少约 4 倍。
问题
问题背景
多模态大模型(MLLM)在细粒度视觉感知(如视觉问答、区域定位)中通常依赖提升输入分辨率来获取更多细节,但这使视觉 token 数量激增,显著推高视觉编码与语言模型 prefilling 的算力成本。
现有方法局限
- 统一高分辨率处理:对所有区域使用相同分辨率,未区分定位与识别对分辨率需求的差异。论文诊断显示,定位可容忍 3 到 4 倍更强的 token 压缩,而识别需要更多细节,统一处理造成大量冗余。
- 直接解码坐标:让 MLLM 输出 RoI 坐标可以端到端训练,但每次查询需要完整模型前向,且依赖模型自身的 grounding 能力,对弱 grounding 模型不适用。
- 轻量 proposal 网络:从注意力蒸馏得到,速度快,但继承注意力目标的噪声;RoI 通过离散区域选择影响答案,其“忠实度”无法直接作为监督信号,难以有效优化。
为什么这个问题难 / 重要
核心挑战在于:在没有区域标注、没有响应采样、没有推理轨迹的条件下,如何让 proposal 网络学会选择对答案最有贡献的视觉证据,同时抑制干扰背景。该问题直接关系到 MLLM 推理 token 效率,是视觉-语言模型从实验室走向高吞吐生产环境的关键瓶颈。
行业类比
类似视频理解系统中先用低分辨率检测关键区域,再对候选区域做高分辨率识别,以平衡精度与计算开销。
核心洞察
- 定位与识别分辨率需求不对称:细粒度视觉感知中,定位 RoI 可容忍约 3-4 倍更强的 token 压缩,而识别其内容需要高分辨率。基于此,先用粗粒度视图定位,再将分辨率集中于所选证据区域,可大幅减少视觉 token 数量。与传统统一提升分辨率的方法相比,这种分离设计在维持准确率的同时显著降低编码和预填充成本。
- 利用冻结 MLLM 的答案似然变化作为奖励信号进行 region-level 强化学习,解决离散区域选择不可微和缺乏监督的问题。与直接从 MLLM 解码坐标(每个查询完整前向、依赖 grounding 能力)或从注意力蒸馏 proposal 网络(继承噪声)不同,该方法只更新轻量 proposal 网络,无需区域标注、响应采样或推理轨迹,且减法目标抑制干扰、加法目标恢复缺失证据,精确指导 proposal 改进。
方法
输入与整体流程
Vision-RL2 面向 fine-grained MLLM 感知,输入为图像和文本问题,以及一个冻结的 MLLM reader(如 LLaVA、Qwen-VL 等)。方法将感知分解为定位(localization)和识别(recognition):定位只需粗粒度视图,识别则需高分辨率证据。整体流程为:轻量级 proposal network 从粗粒度视觉特征中提出候选区域,这些离散区域选择作为动作,通过区域级强化学习优化;优化后的 proposal network 输出高质量区域 masks,用于稀疏视觉编码,最后将压缩后的视觉 token 送入冻结 MLLM reader 得到答案。
关键模块
区域提议网络(Proposal Network)
一个轻量级模块,从低分辨率图像特征中预测一组候选区域(离散 masks)。初始训练可以蒸馏自 MLLM 的 attention,但因 attention 噪声,后续需通过强化学习进行精修。功能性区域评分(Functional Region Scoring)
对每个候选区域,利用冻结的 MLLM reader 计算其对最终答案的贡献:移除该区域后,答案似然的下降量(subtractive signal);或仅保留该区域时,答案似然的恢复量(additive signal)。这些信号作为奖励,无需任何区域标注或额外采样。区域级强化学习(Region-Level RL)
将区域选择视为策略,以 answer likelihood 变化为奖励,采用互补的 subtractive objective(抑制对答案有害的干扰区域)和 additive objective(恢复缺失的关键证据)优化 proposal network 的参数。训练只更新 proposal network,冻结 MLLM reader,且不依赖 region annotations、response sampling 或 reasoning trajectories。稀疏视觉编码(Sparse Visual Encoding)
优化后的 proposal network 输出高质量区域 masks,编码时对证据区域的 visual tokens 进行保留或放大,同时排除背景和冗余 token,实现约 4 倍的 token 压缩。
输出与差异点
输出为经过区域筛选后的稀疏视觉 tokens 与文本输入,送入冻结 MLLM reader,在低视觉 token budget 下完成 fine-grained 基准任务。相比直接解码坐标或仅依赖 attention 蒸馏的方法,Vision-RL2 用答案似然变化作为区域级奖励,能够端到端优化离散区域选择策略,无需额外监督信号,训练更稳定且高效。
实验
实验设计
论文在 六个细粒度视觉感知基准 上评估 Vision-RL2,覆盖 四种 MLLM 骨干网络。实验对比了不同 token 预算 下的准确率,并重点验证了以下设计:
- 使用轻量级 proposal network 从粗粒度视图定位 RoI,再通过 稀疏编码 仅编码证据区域;
- 用 region-level reinforcement learning 优化 proposal network,无需区域标注、响应采样或推理轨迹;
- 与基础 MLLM(高分辨率输入)及其他 token 压缩方法对比。
关键发现
- Vision-RL2 在每个 token 预算下均提升准确率,且以约 4 倍更少的视觉 token 达到基础模型最大预算的准确率。
- 该方法通过 additive 和 subtractive 目标 有效抑制干扰区域并找回缺失证据,提升定位与识别的协同效率。
- 稀疏编码排除了背景 token,进一步降低计算开销,同时保持细粒度感知能力。
与基线对比的深度解读
与直接提高分辨率的基线相比,Vision-RL2 利用 定位与识别对分辨率需求不同 的观察,将分辨率集中在选定的 RoI 上,从而在相同计算预算下获得更高精度。与依赖 MLLM 解码坐标的方法(每次查询需完整模型前向)相比,轻量 proposal network 仅需一次粗粒度前向,极大降低了推理成本。与注意力蒸馏方法相比,RL 优化避免了注意力噪声传递,使 proposal 更忠实于最终答案。该方法在多个骨干网络上的泛化性表明其与模型架构无关,具有工程落地潜力。
行业影响
落地场景
Vision-RL2 适用于需细粒度视觉感知 且视觉 token 成本敏感 的场景:
- 电商商品问答:用户上传图片询问局部细节(如服装纹理、产品接口),模型快速定位区域并回答,无需全图高分辨率。
- 医疗影像:病灶定位与报告生成,sparse encoding 排除背景,集中算力于可疑区域。
- 自动驾驶:小目标识别(交通标志、行人),低延迟端侧推理。
商业价值
- 降本:约 4 倍更少视觉 token 达到同等精度,直接降低 vision encoder 与 LLM prefilling 成本。
- 体验提升:相同算力下提升准确率,支持更高并发或实时响应。
- 数据成本:RL 仅需答案似然变化作为奖励,无需区域标注或采样,减少标注开销。
与现有工作流接口
作为即插即用前端模块:
- 训练:冻结 MLLM reader,只更新轻量 proposal network,仅需 QA 对。
- 推理:proposal network 输出 RoI/mask,驱动 sparse encoding,复用现有 vision encoder 和 LLM。
- 兼容性:已验证 4 个 MLLM backbone,降低集成风险。
工程启示:将定位与识别解耦,用 RL 优化区域选择,为视觉 token 压缩提供新路径。
局限
- 该方法依赖一个冻结的 MLLM reader 作为评分器,其细粒度感知能力直接决定训练信号的质量。若 backbone 在细粒度任务上本身较弱,移除区域引起的答案似然变化可能不明显,导致奖励稀疏或噪声较大,影响提案网络的优化效率。此外,提案网络由模型注意力蒸馏初始化,继承了注意力中的噪声;强化学习虽能部分纠正,但无法完全消除初始偏差,且训练过程中需要多次前向评分,计算开销高于传统的单次推理方法。
- 区域构建策略和动作空间粒度对性能影响显著,但论文未系统探讨不同区域划分方式(如超像素、滑动窗口、目标提议等)对最终结果的影响。实验仅在六个静态图像细粒度基准上验证,对于视频、文档或需要跨模态时序推理的任务,该方法的泛化性未知。另外,稀疏编码作为后续步骤,与策略优化之间的贡献没有完全消融分离,读者难以判断精度提升主要来自更好的区域选择还是稀疏编码本身。
- 与同类工作的对比不够全面:缺少与基于 Grounding DINO 等强定位模型的显式检测流程的直接比较,也未与最新的视觉 token 剪枝方法(如 ToMe、FastV)进行系统性基准测试(尽管附录有提及,但主实验未突出)。此外,四倍视觉 token 减少的结论在部分基准上可能依赖于稀疏编码和放大证据的设计,而不是纯区域策略优化,这削弱了方法作为独立贡献的说服力。对于实际部署,训练阶段的高计算成本和超参数敏感性(如 RL 中的温度、基线等)也可能增加工程调优难度。