透过隐状态推理!让隐式视觉推理成为必要
隐式视觉推理旨在通过隐藏状态计算而非显式文本思维链执行多模态推理。然而,视觉信息存在于隐状态中并不保证模型在生成答案时真正依赖该状态,尤其是在存在其他由图像条件化的替代路径的情况下。为此,我们提出因果视觉循环推理(CVRR),它在保留预训练视觉能力的同时,强制循环计算成为预测所必需的图像条件路径。CVRR 从预训练视觉-语言模型融合图像后的问题隐藏状态出发初始化循环,随后在反复读取同一固定视觉证据的同时更新该状态。在解码之前,视觉状态和原始多模态 KV 缓存被移除,使得只有最终循环状态携带图像条件信息到答案。 在 V^、MMVP、BLINK 和 MME-RealWorld-Lite 基准上,CVRR 在此严格接口下保持强性能,而兼容的隐式推理器即使在相同约束下重训练也无法恢复可比的视觉能力。因果干预进一步表明,当问题保持固定时,预测对循环内容保持敏感,且持续的视觉证据因果修正循环轨迹。这些结果区分了隐状态的信息性与实际用于预测的隐式计算。
论文精读
TL;DR CVRR 通过移除视觉 token 与原始 KV cache,迫使模型仅依靠反复读图的循环隐藏状态作答,证明 latent visual reasoning 可被强制使用且性能不降。
问题
问题背景
多模态模型近期开始尝试在隐藏状态中完成视觉推理,避免生成显式思维链,以降低推理开销并提升响应速度,这一方向被称为 latent visual reasoning。
现有方法局限
已有工作多声称隐状态“包含”视觉信息,但包含不等于使用。技术上,模型在解码时仍可通过其他图像条件路径获取视觉证据,例如原始视觉 token 或预训练期间形成的 KV cache。因此,模型可能仅仅将隐状态作为一个额外的信息存储,并未真正依赖它进行推理。当评估时移除这些旁路后,许多声称具备隐式推理能力的模型出现显著性能下降,说明之前的“推理能力”可能来自捷径,而非隐状态计算。此外,现有训练过程缺乏因果约束,无法保证隐状态是预测的必要路径。
为什么这个问题难/重要
强制使隐状态成为唯一图像条件路径非常困难:直接移除原始视觉 token 和 KV cache 会严重破坏预训练视觉语言模型的对齐能力,因为模型此前依赖这些路径进行视觉感知和跨模态关联。如何在保留预训练视觉能力的同时,让循环隐状态成为图像信息的唯一携带者,是一个技术挑战。从工程角度看,如果隐式推理能够被可靠验证,则可以大幅减少显式 CoT 带来的内存和延迟开销,对部署低延迟视觉问答系统至关重要。但若隐状态推理只是虚假的“表面现象”,模型可能在不稳定或域外数据上出现不可预测的错误。因此,业界需要一种严格因果测试方法来区分“隐状态包含信息”和“隐状态驱动预测”。
行业类比
这类似于软件模块设计中,若某个核心计算模块被旁路(其他路径仍能传递输入),则必须通过接口隔离强制所有数据流经该模块,否则无法保证模块的真实贡献。
核心洞察
- CVRR 通过删除视觉状态和原始多模态 KV cache,使最终循环状态成为唯一的图像条件信息通路,从而在架构层面强制模型真正使用潜在视觉推理,而非仅保留图像信息。相较于以往仅鼓励隐式推理或添加辅助损失的方法,这一硬性接口消除了模型绕过多模态捷径的可能性,是从“潜在状态包含信息”到“预测依赖该信息”的因果性进步。
- 循环从问题隐藏状态初始化(已融入图像信息)并反复重读固定视觉证据,在保持预训练视觉能力的同时,使循环计算成为必要。这种设计与兼容潜推理器相比,即使在同一严格约束下重训练,CVRR 仍能恢复可比的视觉能力,说明其训练策略和接口设计避免了视觉能力灾难性遗忘,对工程上在受限路径下保留模型通用能力有参考价值。
方法
输入与初始化
CVRR 接收图像和自然语言问题,先经预训练视觉语言模型(VLM)编码,得到融合图像信息的问题隐状态 h_q,以及原始多模态 KV 缓存。注意此时 h_q 已包含视觉上下文,但 CVRR 不直接用它解码。
关键模块
- Causal Visual-Read Boundary:以
h_q作为循环初始状态h_1,并固定一份视觉证据(例如图像 patch 特征)供后续反复读取。 - Persistent Visual Recurrence:循环网络在多个步长内更新隐状态,每一步都重新读取相同的视觉特征,使视觉信息持续影响循环轨迹,但不会绕过循环计算进入解码器。
- Strict Causal Decoder Interface:解码前将所有视觉中间状态和原始多模态 KV 缓存移除,只保留最终循环状态
h_T作为唯一的图像条件信息源,强制预测必须依赖循环计算。
训练与输出
训练目标是最大化给定 h_T 的答案似然,同时通过架构约束消除旁路。推理时,编码器计算一次视觉特征,之后循环模块以 h_T 驱动解码器生成文本答案。
与同类方法的差异
现有隐式视觉推理方法通常保留原始视觉路径或 KV 缓存作为 backup,导致隐状态信息虽存在但不一定被实际使用。CVRR 通过“无旁路”的严格接口,使循环计算成为视觉条件预测的必经通路,并在相同约束下重训练竞争方法也未能恢复视觉能力,证明该设计并非简单移除旁路,而是有效保留预训练视觉知识的结构性方案。
实验
实验设计
CVRR 在四个视觉推理基准上进行评估:V*、MMVP、BLINK、MME-RealWorld-Lite。模型基于预训练视觉语言模型,通过引入因果视觉-读取边界和持续视觉循环,强制隐藏状态计算成为图像条件预测的唯一路径。训练时移除视觉状态和原始多模态 KV cache,仅保留最终循环状态进行解码。基线方法包括兼容的潜在推理器,在相同约束下重新训练。该设计严格区分了潜在信息量与实际用于预测的计算。
关键发现
在严格接口下,CVRR 保持了较强的视觉推理性能,而兼容的潜在推理器即使重新训练也无法恢复相当的视觉能力。因果干预显示:当问题固定时,预测对循环内容保持敏感;持续的视觉证据因果地修正循环轨迹。这表明模型确实依赖循环状态进行预测,而非仅仅存在图像信息。
与基线对比
与先前潜在推理方法不同,CVRR 显式移除了其他图像条件路径,使循环计算成为必要环节。此设计解决了“潜在状态包含信息但模型可能不依赖它”的因果利用问题。对工程实践而言,此方法提示在构建推理系统时,应通过架构约束保证信号路径的唯一性,而非仅优化表示的信息量。
行业影响
落地场景
CVRR 将视觉推理压缩到循环隐藏态,并强制模型仅通过该状态输出答案,适合需要低延迟、低成本的多模态问答场景。典型用例:
- 电商商品审查:对上传图片与标题 / 描述做一致性校验,替代人工抽检,模型输出二值判断而非长 CoT,显著降低单次推理成本。
- 医疗影像初筛:在影像辅助诊断中生成简短结构化发现,隐藏态推理避免输出冗长推理链,便于合规审计。
商业价值
- 降本:显式 CoT 会成倍增加输出 token,而 CVRR 的循环隐藏态不产生中间文本,API 调用成本可下降。
- 体验:避免用户等待冗长“思考过程”,提升响应速度。
- 风险控制:不暴露中间推理步骤,减少模型幻觉细节外泄,适合金融 / 医疗等合规场景。
与现有工作流接口
- 推理框架:可作为 VLM 的推理模式开关,集成到 vLLM / Text Generation Inference 等,通过开关切换标准解码与 CVRR 模式。
- 训练侧:需在现有 VLM 上追加循环模块,并用论文的因果接口约束进行微调;论文显示保留预训练视觉能力,迁移成本可控。
- 与检索 / Agent 结合:在 RAG 管线中,召回的多模态证据先由编码器处理,再由 CVRR 做融合推理,减少多轮提示词开销。
局限
- **计算开销与步数敏感性**:CVRR 需要多次循环重读同一视觉证据,这显著增加了推理时的浮点运算量和延迟。论文虽在附录中讨论了效率与计算成本,但并未给出循环深度与性能之间系统的权衡分析。固定循环步数(如 4 步)可能对某些任务冗余、对另一些任务不足,实际部署中需要针对不同场景手动调节,增加了工程负担。与单次前向的潜在推理方法相比,CVRR 的额外计算成本可能限制其在实时或低资源环境中的应用。
- **对预训练 VLM 的强依赖**:CVRR 的循环状态初始化为预训练视觉语言模型在融合图像后的问题隐藏状态,且解码前移除了原始视觉状态和 KV cache,因此最终循环状态必须独自携带所有图像条件信息。如果基础模型的视觉编码质量不高,或对特定图像区域关注不足,CVRR 可能无法通过循环有效恢复丢失的视觉细节。论文主要基于单一 VLM 架构(如 LLaVA)进行实验,跨不同 VLM 家族(例如 Flamingo、BLIP-2)的泛化性尚未验证,工程实践中更换骨干模型可能带来不可预测的性能波动。
- **评估任务范围偏窄**:论文在 V*、MMVP、BLINK、MME-RealWorld-Lite 四个基准上验证,这些任务主要评测细粒度视觉感知、常识和属性绑定,缺乏复杂的多步视觉推理(如视觉数学、场景关系推理)或需要长期记忆的交互式任务。此外,因果干预实验虽然证明了预测对循环内容的敏感性,但这是离线分析,并不能保证真实推理过程中模型一定正确利用了视觉信息。与能显式生成中间文本的 CoT 方法相比,CVRR 的可解释性和错误诊断能力较弱,在需要审计模型决策的应用中可能受限。