论文

重新思考潜在视觉推理:将潜在推理锚定于视觉证据

重新思考潜在视觉推理:将潜在推理锚定于视觉证据

潜在视觉推理(LVR)让多模态大模型(MLLMs)在连续 latent token 中完成中间计算,而不必用文字表达每一步推理。但与 textual CoT 不同,潜在推理无法被直接观察,因此难以监督 latent token 究竟学到了什么。本文首先系统分析 latent token 的行为,发现存在 latent evidence-credit gap:当图像扰动改变正确答案时,latent token 的响应却非常微弱。作者推测这一问题源于 GRPO 训练缺少显式监督——仅依赖最终答案奖励,对「应保留哪些视觉证据」以及「credit 如何在各 latent token 间分配」的指导都过于不足。 为弥合该缺口,作者提出 ReaLVR,把视觉证据监督引入模型自身自由运行的 latent 轨迹:通过对比正确答案与模型生成的错误答案,判断哪些位置需要更强监督;通过对比相关视觉证据与不匹配证据,明确应当保留什么。 实验上,ReaLVR 在三个模型家族中一致优于所评估的 LVR 基线,在 Qwen2.5-VL-7B 上取得五任务平均 63.7% 的最佳成绩。该工作首次在 latent 空间扩展视觉推理,并显示框架在最高 235B 的前沿模型规模下仍能带来稳定提升。进一步分析表明:latent token 位置对问题更敏感,与相关视觉区域的对齐更强,且最受关注的 latent token 对固定上下文的依赖也更强。

论文精读

TL;DR ReaLVR 针对 latent visual reasoning 中 latent tokens 对视觉证据响应弱的问题,通过对比正确/错误答案与相关/不相关视觉证据分配信用,监督模型自身 latent 轨迹,在多个模型与基准上稳定提升,首次扩展至 235B。

问题

问题背景

多模态大模型(MLLMs)的复杂视觉推理通常依赖文本思维链(CoT),但逐词生成中间步骤会带来显著解码开销。latent visual reasoning (LVR) 提出在连续 latent token 中进行隐式计算,只在最后输出答案,提升推理效率。

现有方法局限

LVR 两阶段训练中,第二阶段用 GRPO 对自由运行的 latent trajectory 做结果优化,但最终答案奖励高度稀疏:它只能判断输出对错,无法指定哪些视觉证据应被保留、错误如何分配到各个 latent token。论文诊断发现 latent token 存在 evidence-credit gap——对会改变正确答案的图像扰动(counterfactual perturbation)响应很弱,表明模型可能没有真正绑定视觉证据,而是依赖文本先验或捷径。这种 gap 源于自由运行阶段缺少显式视觉监督。

为什么这个问题难/重要

连续 latent 空间没有自然语言标注,无法像文本 CoT 那样逐 token 对齐;同时需要同时回答“在哪里监督”和“监督什么”。若 latent 计算不可观察且不可控,LVR 的部署会面临可靠性与可解释性风险。业界关注 LVR 的原因是它可能带来比显式 CoT 更高效的推理,但训练信号不足会限制其在复杂视觉问答、空间推理等任务上的泛化。

行业类比

类似端到端自动驾驶模型中,若只按最终行驶结果做奖励,模型可能忽略路侧行人等关键视觉线索而依赖道路纹理捷径;必须将中间表征显式对齐到关键视觉证据,才能保证安全关键场景下的稳健性。

核心洞察

  • - **latent evidence-credit gap**:最终答案奖励对视觉证据保留与 credit 分配指导不足,latent token 对改变答案的图像扰动响应弱。与以往仅用 GRPO 结果奖励的 LVR baseline 相比,这项工作通过 counterfactual perturbation 显式诊断了 latent 轨迹的归因缺陷,为 latent reasoning 的可监督性提供了新证据。
  • - **ReaLVR** 采用 outcome-contrastive evidence credit,在模型自身的 free-running latent trajectory 上施加视觉证据监督。它对比正确与模型生成的错误答案来定位监督位置,对比相关与不相关视觉原型来指定保留内容,并通过 readout-weighted visual evidence 实现细粒度 credit assignment。与 target-conditioned stage 1 不同,ReaLVR 不依赖 GT 中间步骤,弥合了 latent reasoning 与视觉证据之间的 gap。
  • - 首次在 frontier 规模(up to 235B)验证 latent visual reasoning 的扩展性,并提供机制证据:latent token 位置更 question-sensitive、与相关视觉区域 alignment 更强、在 fixed-context 下更 load-bearing。这弥补了以往 LVR 多在 7B 级模型上验证的不足,说明 visual-evidence supervision 不仅提升准确率,还改变了 latent 计算的性质。

方法

输入与轨迹构建

ReaLVR 接收图像、问题以及 MLLM 在 free-running 模式下生成的 latent token 序列。同时准备两种对比样本:

  • 答案对比:模型生成正确答案与错误答案时各自的 latent 轨迹。
  • 视觉对比:与问题相关的视觉区域特征,以及与问题无关或错配的视觉区域特征。

关键监督模块

  1. 定位监督位置(Answer Contrast)
    比较正确与错误答案的 latent 轨迹,识别哪些 token 位置对答案变化最敏感;这些位置被赋予更高的监督权重,解决“在哪里加强监督”的问题。

  2. 指定保留内容(Visual Contrast)
    利用相关视觉证据与错配视觉证据的对比,构造视觉监督信号,约束 latent tokens 保留与正确答案相关的视觉信息,解决“保留什么”的问题。

  3. Readout-weighted 损失
    最终监督损失以 readout 权重加权,使梯度主要流向对答案解码影响最大的 latent tokens,避免均匀分配信用。训练时直接在模型自身生成的 latent 轨迹上施加该损失,无需外部标注轨迹。

输出与效果

输出为经过微调的 MLLM,其 latent tokens 对图像扰动更敏感、与目标区域对齐更强,并在多个视觉推理基准上超越 LVR 基线。

与同类方法的差异:ReaLVR 将 latent 推理的监督从单纯依赖最终答案 reward 拓展为显式的位置+内容双重 credit assignment,并首次在最高 235B 参数的模型规模上验证了 latent 视觉推理的可扩展性。

实验

实验设计

ReaLVR 在 三个视觉语言模型家族 上评估,包括 Qwen2.5-VL-7B,并缩放至最高 235B 参数。实验覆盖五个视觉推理基准,沿用两阶段 LVR 训练:第一阶段目标条件视觉监督,第二阶段自由运行 outcome 优化。ReaLVR 在第二阶段引入 outcome-contrastive evidence credit,用正确与错误答案对比定位监督位置,用相关与不匹配视觉证据指定保留信息。

关键发现

  • 在 Qwen2.5-VL-7B 上,ReaLVR 取得 63.7% 五任务平均,超过所有评估 LVR baseline。
  • 机制分析:latent tokens 对改变答案的图像扰动更敏感;token 位置的问题敏感性分化更明显;注意力更集中目标区域。
  • Fixed-context 干预显示模型更依赖高注意力 latent token。
  • 在 235B 规模上仍稳健提升,是首个 latent space 规模化视觉推理。

与基线对比

Vanilla LVR 依赖 GRPO 的最终答案 reward,导致 latent tokens 对视觉证据变化响应弱,形成 latent evidence-credit gap。ReaLVR 在自身 free-running latent trajectory 上引入视觉证据监督,将信号从 “answer-only” 扩展为 “answer + evidence”,从而更好地 credit 哪些视觉信息应保留。相比仅优化 outcome 的 baseline,ReaLVR 在需要细粒度视觉证据的任务上更稳定,同时保留 latent 推理不逐词生成的计算优势。

行业影响

ReaLVR 通过对比正确答案/错误答案与相关/不相关视觉证据,对隐式视觉推理轨迹施加监督,弥补证据-信用差距,在不增加推理 token 的前提下提升多模态模型的视觉推理准确率,并已验证可扩展至 235B 参数。

落地场景

  • 电商视觉问答:商品详情图复杂问答,隐式推理降低响应延迟,同时提高对关键属性区域的关注,改善导购与客服体验。
  • 自动驾驶感知决策:需要对传感器图像进行快速中间推理但不输出自然语言,ReaLVR 的隐式空间训练可直接增强此类系统的判断可靠性。

商业价值

  • 降本:隐式推理避免生成冗长 CoT 解释,显著减少输出 token 费用,适合高并发 API 服务。
  • 体验提升:模型对图像扰动更敏感、注意力更贴合证据区域,减少错误答案,增强用户信任。

与现有产品/工作流的接口

  • 作为 GRPO 风格的强化学习训练增强,可直接嵌入现有 MLLM 微调流程,无需改动推理引擎。
  • 依赖对比样本构造(正确答案 vs 模型错误答案,相关 vs 不相关视觉原型),可通过自动数据管道批量生成,集成到 MLOps 中。

项目主页:ReaLVR 项目

局限

  • 关于 **answer contrast** 依赖模型生成的错误答案。当模型在训练初期就能正确回答某些样本时,错误答案与正确答案的差异可能很小,导致对比信号过弱,难以有效定位需要额外监督的 latent token 位置。此外,错误答案是通过当前策略采样得到的,其分布受限于模型状态,可能无法覆盖所有类型的推理失败模式(如图像区域误关联、数值计算错误等),从而限制了 ReaLVR 的泛化能力。
  • 关于 **visual evidence** 对比需要显式的 relevant / mismatched 视觉原型。论文使用 visual prototypes 来构建对比,这需要额外的数据准备或先验知识(例如从图像中裁剪目标区域或使用现成的物体检测器)。这种做法使得方法对视觉概念的覆盖依赖于原型库的质量和多样性,对于未出现在训练原型中的新颖物体或细粒度属性,监督信号可能不足。此外,构造 mismatched evidence 的方式(如随机替换区域)可能引入人为的分布偏移,使模型过度关注特定类型的视觉特征而忽略其他关键信息。
  • 关于实验评估范围和两阶段训练的工程开销。虽然作者在三个模型家族(包括 235B)上验证了方法,但实验主要覆盖五个视觉推理基准,缺少对更广泛任务(如视频推理、具身交互或长文档 VQA)的评估。另外,ReaLVR 采用两阶段训练流程,需要额外的视觉监督准备和对比样本构造,增加了训练复杂度和计算成本,相比端到端训练方案在部署和迭代上可能不够高效。此外,latent token 本身不可读,即使通过视觉监督增强了与图像区域的对应关系,人类开发者仍然难以直接审计推理步骤,可解释性相比文本 CoT 仍有差距。
论文Xi Xiao2026-09-28原文

相关内容