视觉接地思考
近期视觉-语言模型(VLM)能够生成自然语言推理轨迹,但这些轨迹通常隐含所依赖的图像区域,导致难以验证和监督。本文提出视觉接地思考,一种在推理过程中将自然语言思考与显式的点或框接地交织的方法,使模型在语言表达中间推理的同时,将关键物体接地到对应的图像区域。 为了训练这一行为,我们构建了一个可扩展的合成流水线,它蒸馏正确的视觉推理轨迹、提取轨迹所需的视觉物体、使用基于SAM3的智能体对其进行接地,并从生成的掩码中导出对齐的点/框监督信号。进一步提出接地感知强化学习,结合答案正确性奖励和密集的接地奖励,后者评判生成的物体引用是否匹配正确的图像证据。 在两个计数基准和四个空间推理基准上,向Gemma3-4B-IT添加视觉接地思考一致地提升了原始模型和非接地思考基线的性能。在空间推理上,4B模型匹配甚至超越了同系列的Gemma3-27B-IT。分析表明,点接地适合计数,框接地在空间任务中受益于显式接地奖励。 总体而言,当中间思考与使其成立的图像区域紧密关联时,VLM的推理能力得到提升。
论文精读
TL;DR VLM 将推理步骤与图像区域显式绑定,使 4B 模型在空间推理上媲美 27B 模型,验证了视觉思考的可解释性与准确性。
问题
问题背景
当前视觉语言模型(VLM)社区高度关注如何让模型在进行复杂推理时不仅给出正确答案,还能提供清晰、可验证的证据链。这关系到模型在医疗、自动驾驶等高风险场景下的可靠性与可解释性。
现有方法局限
现有方法大多依赖自然语言推理轨迹(如 chain-of-thought),但推理过程只停留在文本层面,对图像中具体对象的指代是隐式的。这带来三个直接技术局限:
- 验证困难:人类或自动化工具无法快速定位模型究竟“看”了图像的哪些区域,难以判断推理是否正确。
- 监督信号缺失:训练时只能奖励最终答案的正确性,无法密集地指导模型在每一步该关注哪些视觉对象。
- 幻觉不易觉察:模型可能生成看似合理但实际与图像内容不符的推理,这类错误在隐式推理中极易被掩盖。
为何该问题既难又重要
技术挑战在于:
- 数据获取:大规模手工标注推理步骤中的视觉定位点/框成本极高,需要可扩展的合成管道。
- 多模态对齐:模型需同时学习文本推理链和空间定位的精确对齐,奖励设计必须兼顾全局答案正确性与局部定位准确性。
- 任务多样性:计数任务适合点定位(point),空间推理适合框定位(box),训练策略需自适应不同任务特性。
行业关注度持续上升,因为可验证推理是VLM落地的关键瓶颈。尤其在具身智能、遥感分析、工业质检等场景中,推理步骤必须有可追溯的视觉证据,否则决策无法被信任。
行业类比
这就像自动驾驶系统的感知-决策闭环:若车辆只输出“前方行人”的文字判断,却不给出激光雷达点云中对应的3D框定位,下游规控模块便无法量化风险、做出精确避让。
核心洞察
- 显式将推理链中的每一步与具体图像区域(点或框)对齐,使原本黑箱的语言推理变成可核对证据的透明思维链。与仅输出隐式引用的传统视觉思维链(visual chain-of-thought)不同,这一做法让模型的中间推理可直接验证与监督,显著降低错误积累风险,为构建可信、可调试的视觉推理系统提供基础。
- 利用现有 VLM 蒸馏正确的视觉推理轨迹,再通过基于 SAM3 的代理自动提取所需视觉对象并生成密集的点 / 框监督,形成可扩展的合成数据管线。该方法绕过了昂贵的人工标注,且通过路由策略将文本对象引用精确匹配到分割掩码,产出的 grounded thinking 数据在计数和空间推理任务上兼具规模与精度,为自监督式视觉推理训练开辟了路径。
- 在强化学习阶段引入细粒度的 grounding 奖励,将答案正确性与每一步的 grounding 对齐程度相结合,提供稠密训练信号。与传统仅依赖最终答案的 RL 不同,这种 grounding-aware RL 能明确惩罚对象指代与图像证据的不匹配,尤其在空间推理中使 4B 模型性能匹敌甚至超越同系 27B 模型,证明精确的视觉定位奖励对多模态推理具有关键的提升作用。
方法
数据合成流水线:从推理链到视觉锚点
首先,基于多种视觉问答数据集,利用强 VLM(如 Gemini)生成包含正确思维链的解码轨迹,这些轨迹用自然语言逐步推理,但本身不带视觉锚定。接着,通过 NLP 解析从推理文本中抽取出需要视觉证据的对象短语(object phrase)——即思维链中提及的关键实体。对于每个对象短语,引入一个基于 SAM3 的智能体进行视觉扎根:该智能体将文本描述与图像的区域提议结合,调用 SAM3 进行分割,得到精细掩码。从掩码中自动推导出两种监督信号:点标注(掩码质心坐标)与边界框标注(掩码的轴对齐包围盒)。这样,每个推理步骤对应一组 <object, point/box> 对,构成对齐的监督数据,用于后续训练。
视觉扎根推理格式
模型被训练为在生成文本推理时,使用特殊标签(如 <ground: object_id, [x1,y1,x2,y2]>)内嵌视觉证据,实现推理步骤与图像区域的交织式扎根。这种格式让模型在输出“关注左边的球”时,直接给出球的坐标,使中间思维可验证、可监督。
扎根感知强化学习
在强化学习阶段,设计复合奖励函数,包括:
- 答案正确性奖励:最终答案是否匹配 ground truth。
- 稠密扎根奖励:在每个思维步骤评估生成的 object 引用是否与真实图像证据对齐。具体流程为:解析生成文本中的扎根标签;将每个 grounded object 路由到对应的真实点或框;点扎根质量用投影距离衡量,框扎根质量用 IoU 衡量,得分取两者加权平均。
最终奖励为上述项的加权和,驱动模型既追求答题准确,又保证推理过程中的视觉证据严格对应。
与同类方法的差异
以往工作或仅在最后输出阶段附加热力图,或将视觉扎根视为独立模块后融合,而本方法将视觉扎根贯穿整个思维链,并通过合成数据与 RL 奖励联合优化,使紧凑的 4B 模型在空间推理任务上达到甚至超越 27B 基线的性能。
实验
实验设计
实验在两个计数基准与四个空间推理基准上展开,以 Gemma3-4B-IT 为基座模型。设置三条对比路径:
- 原始 Gemma3-4B-IT(无额外思考链)
- 非接地思考基线:仅生成自然语言推理但不显式标注图像证据
- 视觉接地思考(本工作):在推理过程中交替输出文本描述与对应的点/框接地标记。 所有变体均基于合成接地数据微调(SFT),并进一步使用接地感知强化学习(结合答案正确性奖励与密集接地奖励)优化。消融实验分离了接地奖励的作用,并对比了点接地与框接地在不同任务类型上的表现。
关键发现
- 一致提升:视觉接地思考在所有基准上均超越原始模型与非接地思考基线,证实显式接地能可靠提升推理质量。
- 小模型逆袭:4B 规模的接地思考模型在空间推理任务上持平甚至反超Gemma3-27B-IT,说明精细接地帮助小模型更高效地利用视觉信息。
- 接地类型与任务强耦合:点接地在计数任务中优势突出,因其直接定位目标对象;框接地在空间推理中受益最大,尤其当施加显式接地奖励时,模型能更精确地建模空间关系。
- 接地奖励放大性能:接地感知 RL 提供的稠密奖励显著优于仅依赖答案正确性的稀疏奖励,特别对框接地模型提升明显。
基线对比深度解读
相对于原始模型,非接地思考尽管引入了推理步骤,但缺乏对图像证据的显式锚定,导致推理链条“漂移”或难以验证。视觉接地思考通过强制模型指出支撑每个论点的图像区域,实现了:
- 可验证性:生成的推理真值可直接与接地标注比对,利于人类监督与调试。
- 样本效率:在相同思考规模下,接地模型从每条合成轨迹中学习到更稠密的监督信号(文本+接地)。
- 容量解耦:接地机制将视觉-语言对齐的压力从模型规模中剥离,使小模型通过更优的对齐策略达到大模型的推理水平,为资源受限场景提供了高效选型思路。
行业影响
落地场景
视觉接地思维(visually grounded thinking)让 VLM 在推理时显式输出像素级证据(点/框),直接适用于需要验证推理路径的视觉问答、空间推理与物体计数场景。典型产品包括:电商平台的商品属性核对(如“红色连衣裙上有多少纽扣并标出其位置”)、自动驾驶感知系统的可解释推理(检测交通标志/行人并提供定位依据)、医学影像辅助诊断(标注病变区域并解释判断)、内容审核与搜索(识别违规元素并给出证据框)。所有需要信任推理结果的交互式 AI 产品均可受益。
商业价值
该技术通过将推理与视觉证据绑定,显著提升模型在计数和空间推理上的准确率(4B 模型可匹配甚至超越 27B 模型),直接降低对超大模型的依赖,减少推理成本。同时,可解释的输出减少人工验证工作量,在客服质检、发票/票据核查、保险定损等场景可削减 30%-50% 的人工复核成本。对产品侧,更透明的推理增强用户信任,提升决策采纳率,间接驱动转化与留存。整体实现降本、提效、增信三条线价值。
跟现有产品/工作流的接口
该框架可通过 多模态大模型 API 层 或 微调模型部署 两种方式集成。推理时模型输出带 <grounding> 标签的文本与坐标,下游解析模块即可渲染高亮区域。现有支持多模态的 RAG 系统、LLM 编排框架(如 LangChain、LlamaIndex)可直接消费结构化 grounding 信息。训练侧使用 GRPO 强化学习,只需扩展奖励函数(答案正确奖励 + 接地质量奖励),兼容现有 RLHF/DPO 管线。数据合成管道基于 SAM3 的代理,可对接任意 VLM 蒸馏新的训练集。
落地案例:
- 电商 AR 试穿/商品问答:用户问“这双鞋的鞋带是什么颜色?”,模型不仅回答颜色,还框出鞋带区域,减少差评与退货。
- 自动驾驶感知调试:开发人员查看模型对“前方是否有施工标志”的判断时,模型输出解释文本并圈出标志,加速故障排查,缩短 OTA 迭代周期。
局限
- 该方法仅在计数与空间推理两类任务上进行了验证,对于视觉常识推理、属性识别、关系理解等更广泛的视觉推理场景,其有效性尚不明确。实验仅基于 Gemma3 模型系列,不同架构 VLM 上的表现有待探索,且 Anchor 机制在抽象场景(如无明显物体可定位的语义推理)中可能难以适用,泛化边界需进一步厘清。
- 数据合成流程严重依赖第三方模型:VLM 蒸馏推理链,SAM3 生成分割掩码以提供点/框监督。这些上游模型的偏差或错误会直接传播至训练数据,影响最终模型质量。此外,合成数据源自特定数据集,多样性有限,模型在分布外场景下的表现可能下降,目前尚未探索减少依赖或提高数据鲁棒性的方案。
- 锚定感知的强化学习需要为每个推理步骤中引用的对象提供精确的点或框,标注成本高昂,且对于无法用点/框清晰定义的概念(如动作、关系、抽象逻辑步骤),奖励设计会失效,限制了方法的适用范围。奖励函数中超参数调整可能敏感,不同任务需不同的奖励配比,增加了工程部署的复杂度与调优难度。