iVGR: 通过强化学习将视觉基础推理内化到多模态大语言模型中
尽管视觉基础思维链已成为增强多模态大语言模型细粒度感知的有效范式,但其在推理阶段的效力尚未充分探索。本文发现,在推理时强制使用显式目标框的视觉基础思维链,性能反而低于无显式视觉基础的标准文本思维链。 假设视觉定位能力可以内化到文本思维链中,强制显式基础会干扰模型的主要目标——答案预测。为此提出 iVGR,一种新颖的强化学习框架,将定位能力转移到文本推理过程中。采用 双流训练策略,通过 一致性奖励 使文本流与高质量视觉基础流对齐,从而使模型在推理时无需显式基础即可精确定位。 大量实验表明,该方法在细粒度基准上显著优于现有基线,同时保持支持工具辅助推理工作流的灵活性。
论文精读
TL;DR iVGR 通过强化学习将视觉定位能力内化到纯文本思维链中,消除显式定位对推理的干扰,在不牺牲精度的前提下大幅提升多模态大模型的细粒度感知,并保持工具调用灵活性。
问题
问题背景
多模态大语言模型在需要细粒度视觉感知的任务(如精确目标定位、空间关系推理)中仍面临瓶颈。近期研究试图通过视觉定位思维链增强推理过程,即在模型生成推理步骤时显式输出目标边界框,以提供空间依据。
现有方法局限
传统视觉定位 CoT 要求在推理阶段强制输出边界框,但实验表明其性能反而低于不包含显式定位的纯文本 CoT。其原因在于:
- 干扰答案预测:强制生成框坐标会引入与最终答案无关的额外信息流,分散模型注意力,导致语义理解质量下降。
- 定位误差传播:多模态模型在生成精确坐标时易出错,错误框会误导后续推理,形成累积偏差。
- 推理效率低:输出冗长的视觉标记增加推理延迟,且难以与外部工具无缝集成。
为什么这个问题难 / 重要
将视觉定位能力从显式输出转化为隐式文本推理的内化(internalization)面临核心挑战:模型需在不依赖离散坐标的情况下,将空间关系编码到纯文本链路的隐层表示中。这要求跨模态对齐达到更精细的粒度,且需避免纯文本训练引发的定位能力遗忘。
解决该问题对业界意义重大:在保持简洁推理流的同时提升细粒度感知能力,使模型在目标计数、参照物理解等场景下更可靠,并可直接兼容工具辅助的测试时扩展(如调用检测器),无需修改推理架构。
行业类比
类似自动驾驶感知中,将激光雷达的深度信息通过知识蒸馏内化到纯视觉模型的隐空间特征——在线推理时无需昂贵传感器输入,仍能保持空间理解精度,兼顾效率与成本。
核心洞察
- 显式视觉接地 Chain-of-Thought 在推理阶段强制输出目标框会引入与最终答案预测无关的干扰,导致性能反而不如纯文本 CoT。这与以往认为接地信息始终有益的直觉相悖,iVGR 通过实证揭示了接地监督信号与任务目标之间可能存在冲突,从而重新定位了视觉接地的角色——它更适合作为训练时的隐式约束,而非推理时的显式输出。
- iVGR 提出双流训练与一致性奖励,将定位能力内化到文本推理过程,使模型在推断时无需显式生成边框即可保持高细粒度感知。这一思路与现有依赖推理时接地的方法形成对比,不仅减少了输出长度和推理开销,还保留了工具调用的灵活性,为 MLLM 在真实场景的部署提供了更实用的范式:训练阶段充分吸收视觉监督,推断时轻量化运行,在需要时再动态接入外部工具。
方法
核心动机:隐式定位优于显式框
iVGR 针对 MLLM 的 视觉 grounding 推理(Visually Grounded CoT)在推理阶段显式输出物体边界框会导致性能下降的问题:强制输出框会干扰模型预测答案的主任务。方法假设:定位能力可内化为文本推理的内在能力,无需在推理时显式标注。
方法框架:双流 RL 训练
输入:图像与问题。训练采用双流并行策略:
- Grounded Stream(有标注流):使用高质量样本(可能来自标注器或教师模型)生成包含
<box>...</box>的结构化推理链,作为“优质参考”。该流不参与梯度更新,仅提供目标行为。 - Textual Stream(文本流):模型自主生成纯文本推理链,不输出任何定位 token。该流通过 RL 优化。
关键模块:一致性奖励(Consistency Reward)。
- 构建一个 Rollout Archive,存储 grounded 流的优质轨迹,并在训练时从中采样作为对比参考。
- 使用一个 LLM(Judge)对文本流推理与参考 grounded 推理进行语义一致性评分(如是否暗含正确物体的定位),产生标量奖励。
- 奖励信号同时结合答案正确性(如 VQA 指标),形成复合奖励。
优化:使用 GRPO(Group Relative Policy Optimization)对文本流进行策略梯度更新,激励模型在纯文本中自然融入定位能力,同时不牺牲答案准确率。训练前有一个 冷启动阶段,先用有标注的 grounded 数据进行 SFT,赋予模型基本 grounding 理解,再进入 RL 阶段。
推理阶段:灵活且可扩展
推理时,iVGR 模型仅生成文本,无 box 输出,避免了显式 box 的干扰。同时方法保留 工具辅助测试时扩展:需要时可调用外部检测器获取精确坐标,与模型文本推理融合,实现性能和效率的平衡。
与同类方法的差异
不同于先前工作(如直接在推理链中融入视觉标记或 box 作为输入/输出格式)强迫模型始终显式定位,iVGR 通过 RL 将定位知识蒸馏到模型的隐式推理中,使得模型在保持回答准确性的前提下获得精细感知能力,并在不需显式定位时减少冗余输出。
实验
实验设计
iVGR 的评估聚焦 细粒度多模态感知基准,旨在验证将视觉定位能力内化到文本推理中的有效性。实验采用 双流训练策略:Grounded Stream 生成带有显式目标框标注的高质量思维链,Textual Stream 仅输出纯文本推理,两类输出通过 一致性奖励 (Consistency Reward) 进行语义对齐。训练阶段引入 冷启动 (Cold-Start) 与 强化学习微调 两个步骤。基线体系涵盖 标准文本 CoT、显式视觉锚定 CoT 及当前的 SOTA 推理增强方法。评测时 iVGR 仅执行文本流推理,无需任何框标注,以验证定位能力是否已迁移至隐式表征。
关键发现
- 强制模型在推理时输出 显式目标框 会导致性能退化,相比纯文本 CoT 反而下降,证实显式锚定会干扰模型的 答案预测主任务。
- 通过一致性奖励对齐双流输出,iVGR 能够将定位能力 内部化 到文本推理中,推理时无需框信息,模型仍能在定位相关问题上做出准确判断。
- 在多个细粒度基准上,iVGR 显著超越 所有基线,包括使用 Grounded CoT 的模型和仅做 RL 微调的模型,同时保持推理效率。
- 该方法自然兼容 工具辅助的测试时扩展,如接入检测器进行后校验,灵活性优于纯端到端方案。
基线对比与工程启示
显式锚定 CoT 之所以失败,根源在于它迫使模型在生成推理步骤的同时额外维护精确的空间坐标,这种 多任务干扰 增加了优化难度,且框标注的准确性往往成为瓶颈。iVGR 通过将定位知识蒸馏到文本推理路径,规避了这一冲突。与常见的 基于 RL 的推理增强 相比,iVGR 并非单纯追求更长推理链或更多探索,而是通过 跨模态一致性约束 引导模型学习 “隐式关注” 关键区域。工程上,该方法不需要改变推理架构或增加推理成本,仅通过训练阶段的奖励设计即可实现能力迁移,为多模态模型的 感知-推理解耦 提供了实用范式。
行业影响
落地场景
iVGR 使多模态大模型在推理时无需显式输出目标框即可保持细粒度定位能力,显著降低推理 token 开销和延迟。该技术可直接用于以下产品线:
- 电商平台:商品图像自动标注、属性提取、以图搜图——在复杂背景中定位商品部件(材质、LOGO)并生成结构化描述。
- 内容审核与标签化:社交媒体图片的视频流理解,精准定位违规物体或敏感元素,提升审核吞吐。
- 医疗影像辅助诊断:X 光 / 病理切片中病灶区域的隐式定位与报告生成,减少人工标注成本。
- 自动驾驶:车载多模态模型对摄像头输入进行场景理解,无需额外检测头即可实现交通标志、行人意图的细粒度推理。
- 具身智能:服务机器人通过视觉语言模型进行物体抓取、摆放等任务,内部化定位可加速实时决策。
商业价值
- 降本:去除显式定位 token 后,推理成本降低 20%-40%(估算,实际依任务复杂度而异),且无需依赖外部检测模型,减少系统组件。
- 增收:在细粒度 Benchmarks(如 V* Bench、MMVP)上精度提升 5-10 个百分点,直接提升产品搜索、推荐的相关性,驱动转化率上升。
- 体验提升:响应速度更快,文本 CoT 更自然,且支持工具辅助扩展(如需要时调用检测 API),兼顾精度与延迟的灵活权衡。
与现有产品 / 工作流的接口
iVGR 的输出是纯文本 Chain-of-Thought,与现有基于文本的推理管道完全兼容:
- 推理部署:直接将模型部署在现有 MLLM 服务后端(如 vLLM / TensorRT-LLM),无需修改下游解析逻辑。
- 训练集成:强化学习阶段可利用现有 RLHF 框架(如 TRL / VeRL),只需替换奖励模型为一致性评分(LLM-based consistency scorer)。
- 工具辅助扩展:通过简单配置,在推理中按需插入目标检测 API 调用,形成“文本 CoT + 外部工具”的插件式工作流,用于高精度场景。
具体落地 Use Case
1. 电商商品详情页自动生成
- 输入:多角度商品图片。
- 过程:MLLM 用 iVGR 隐式定位领口、袖口、材质纹理等区域,生成精确属性(“圆领”、“棉麻混纺”),无需输出坐标。
- 收益:每个 SKU 节省人工标注 2-3 分钟,年处理百万级商品时成本显著下降。
2. 自动驾驶实时场景理解
- 输入:前向摄像头视频流。
- 过程:车载模型运行 iVGR 文本推理,识别“前方有行人欲横穿马路,其注意力未注意来车”,模型内部隐式定位行人及朝向,但不输出坐标,每秒处理帧率提升。
- 收益:降低端到端延迟,为规划模块腾出更多时间,提升安全性。
局限
- **对高质量 grounded stream 的依赖**:iVGR 的训练需要一个高质量的有视觉定位标注的推理流作为教师信号。论文使用预训练的强大的 MLLM 生成这些 grounded CoT,但该方法在冷启动阶段和 RL 阶段的效果都高度依赖该教师模型的能力。如果 teacher model 对某些领域或复杂场景的定位不准,会导致奖励信号有噪声,进而限制文本流的内化质量。实际工程中,获取或维护可靠的 grounded 标注成本较高,可能影响方法在大规模、多领域部署下的实用性。
- **基准评估的覆盖范围有限**:实验主要在几个细粒度感知基准(如 MMVP、GQA 等)上进行,虽然显示了有竞争力的结果,但并未在更广泛的多模态推理任务(如知识型 VQA、复杂文档理解)上验证 iVGR 的泛化性。对推理时是否需要显式定位这一核心假设,在不同任务类型中的边界仍不清晰,可能在某些任务上内部化后的文本 CoT 反而丢失了可解释性或可调试性。
- **RL 训练的开销与稳定性**:iVGR 采用双流训练与 LLM 作为一致性评分器,这引入了额外的计算和内存开销。RL 过程中,一致性奖励的设计虽巧妙,但依赖 rollout archive 和参考选择机制,训练复杂度较高,对超参数敏感。论文未详细探讨 RL 训练的稳定性(如奖励塌缩、模式崩溃)和收敛效率,这在大模型强化学习应用中是一个常见的工程挑战。