论文

How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning

How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning

跨视角空间推理是视觉语言模型(VLM)的薄弱环节:它们常依赖语言推理,丢失任务所需的细粒度几何信息。视觉思维通过生成中间思维图像来应对这一问题,但近期研究表明模型常忽略这些轨迹中的视觉证据。为此,我们探究如何使视觉思维真正发挥作用,以及何种视觉思维最有效。 我们在统一多模态模型(UMM)中研究这些问题,该模型原生支持交错的图像-文本生成。针对第一个问题,我们提出View Dropout(VDrop)——一种训练时干预方法,在答案跨度中隐藏输入视图的部分信息,但保持对思维图像令牌的可见性。这迫使模型在回答时使用思维图像,而非仅依赖输入视图。一旦思维图像被用于答案预测,我们研究哪种视觉思维最有效,将其视为可学习性与信息性的权衡,并比较三种思维图像变体:自上而下、全景和点匹配渲染。 在合成场景上训练,并在五个真实世界域外基准上评估,结合VDrop的全景视觉思维是唯一既信息丰富又易于学习的配置,实现了最佳的域外泛化。

论文精读

TL;DR 提出 View Dropout 强制模型利用视觉思维,结合全景视觉思维,在跨视角空间推理任务上取得最优域外泛化。

问题

跨视图空间推理 (cross-view spatial reasoning) 是视觉语言模型 (VLMs) 的一项重要能力,广泛应用在机器人导航、增强现实和自动驾驶等场景,但当前模型在这方面依然表现薄弱。主流 VLMs 倾向于在语言空间中进行推理(如文本思维链),导致关键的细粒度几何信息丢失。

为解决此问题,近期工作提出思维图像 (thinking-image) 策略——让模型先生成一张中间图像(如鸟瞰图或全景图),再基于该图像推导答案。然而,研究发现这些生成的视觉痕迹往往被模型忽略:答案预测实质上仍直接依赖原始输入视图,思维图像沦为摆设。简单的多模态监督训练无法迫使模型真正利用视觉推理,说明需要更针对性的干预机制。

这一挑战的根源在于,模型必须从 2D 图像推断 3D 结构并理解视角变换下的对应关系,仅靠语言模式匹配难以泛化到新场景。若不能有效利用中间视觉表征,空间推理将退化为脆弱的关联记忆,在具身智能、无人机规划等对空间精度要求高的应用中引发严重失败。因此,如何使视觉思维真正参与推理,以及选择何种视觉思维形式,成为构建可信空间智能体的关键问题。

这与自动驾驶中的多摄像头融合类似:仅靠单视角特征难以感知全局,需要鸟瞰图 (BEV) 等中间表示来稳健表达空间关系——若融合机制失效,整个规划链路便丧失精度。

方法

输入与任务

统一多模态模型 (UMM) 接收 两个不同视角的图像(如俯视图与地面视角)及一个 跨视角空间推理问题(例:“物体 A 在物体 B 的哪个方向?”),要求生成文本答案。为提升几何推理能力,模型在回答前需生成一张中间 思维图像 (thinking image),类似于视觉化的思维链。

关键模块:View Dropout (VDrop)

以往方法中,生成的思维图像常被忽略,模型仅依赖输入视图作答。VDrop 是一种 训练时干预 策略:在计算答案部分的损失时,随机 屏蔽输入视图的部分区域(对答案 token 不可见),但保持这些区域对思维图像生成阶段可见。这迫使模型在预测答案时 必须借助已生成的思维图像,而非直接“偷看”被屏蔽的输入。掩码方案消融表明,视角专属屏蔽(如只覆盖地面视角的关键区域)效果最佳。

视觉思维策略

在 VDrop 约束下,比较了三种思维图像变体:

  • Top-down 渲染:生成俯视地图,标注物体位置关系。
  • Panoramic 渲染:生成融合两视角信息的全景图,上下文更丰富。
  • Point-matching 渲染:显式绘制跨视角关键点匹配,编码几何对应。 图像由模型自回归生成,作为后续答案预测的显式视觉特征。

输出与训练

模型以 交错图像–文本 方式逐 token 生成:先输出思维图像序列,再输出文本答案。损失函数同时覆盖两部分,但 VDrop 仅作用于答案 token 的损失。模型由此学会在思维图像中编码必要的几何线索,并在回答时有效利用,从而大幅提升跨视角推理的 分布外泛化能力

与同类方法的差异

与 STARE 等让模型自由生成思维图像但未约束使用的做法不同,VDrop 强制模型依赖思维图像进行推理,确保视觉思维真正发挥效用。而全景思维在 可学习性与信息量 的权衡中达到最佳,是唯一在五个真实场景分布外基准上稳定提升的配置。

实验

实验设计

训练基于 Unified Multimodal Models (UMMs),使用 Infinigen Indoors 合成场景生成多视图空间推理问题。核心干预手段 View Dropout (VDrop) 在训练时对输入视图部分区域进行遮挡,但仅对答案预测所需的 token 隐藏信息,而思考图像 token 仍可访问完整视图,以此强制模型在回答时依赖生成的思考图像。评估在五个真实场景的跨视图空间推理基准上进行,测试分布外 (OOD) 泛化。比较三种视觉思考策略:自上而下 (top-down)、全景 (panoramic)、点匹配 (point-matching) 渲染,它们在信息量与可学习性间存在权衡。

关键发现

VDrop 显著提升了模型对思考图像证据的利用率,避免了以往工作中视觉信息被忽略的问题。在所有配置中,全景视觉思考 + VDrop 是唯一同时保持高信息量和可学习性的方案,在 OOD 基准上取得最佳泛化。其他策略或信息不足 (如点匹配),或过于复杂难以学习 (如自上而下)。这表明视觉思考的有效性同时取决于生成内容的形式与训练策略。

与基线对比解读

该工作揭示了让视觉思考“真正起作用”的关键机制。VDrop 类似一种正则化,迫使模型放弃纯语言捷径,从根本上解决 VLMs 在空间推理中对视觉信息利用不足的痼疾。全景表示在几何完备性和学习难度之间找到了最佳平衡点,这为多模态模型设计提供了重要启示:中间表示的设计需兼顾表达力与模型的可拟合性。该思路可推广至更广泛的推理任务,推动多模态模型从“看到”转向“利用”视觉信息进行深度推理。

行业影响

落地场景

跨视图空间推理 是 AR 导航、室内机器人、无人机巡检等产品的核心技术瓶颈。本文提出的 View Dropout (VDrop) 训练范式与 全景视觉思维 策略,可直接用于:

  • 自动驾驶/移动机器人:提升环视图像(前/侧/后)间的几何对齐与物体跟踪能力,减少纯语言推理导致的漏检。
  • AR 室内导航与虚拟试摆:用户拍摄局部房间图,模型生成全景思维图并推断家具尺寸与布局兼容性。
  • 工业数字化:对比地面巡检图与建筑平面图,自动定位设备并规划维修路径。

商业价值

  • 降本:仅需合成数据训练,即可泛化到 5 个真实域外基准,显著降低人工标注与场景采集成本。
  • 体验提升:思维图像作为可解释中间件,让用户/开发者直观验证模型推理过程,加速调试与信任建立。
  • 增收:在电商 AR 试穿/试摆、房地产虚拟看房等场景中,更精准的空间理解可直接提升转化率。

与现有产品/工作流的接口

  • 模型集成:VDrop 是一种训练时干预,可直接插入现有 统一多模态模型(UMM) 的训练流程(如 LLaVA-OneVision),无需修改推理架构。
  • 数据管线:配套的 Infinigen Indoors 合成数据生成器可集成到现有 CV 数据合成 pipeline(如 Omniverse Replicator),自动化生成多样化的跨视角 QA 对。
  • 部署兼容:生成的全景思维图像为普通 RGB 格式,可在当前 VLM 推理框架(vLLM/TGI/TensorRT-LLM)的支持下高效部署。

具体落地用例

  1. 电商 AR 家具放置:用户上传房间照片,模型生成全景思维图并推理沙发/餐桌的最佳位置与尺寸,减少退货率。
  2. 自动驾驶数据标注:利用 VDrop 增强的 UMM 自动对齐多相机时间戳帧,生成俯视视角的全局轨迹标注,节省人工对齐成本。

局限

  • **合成数据依赖**:训练仅使用 **Infinigen Indoors** 合成场景,尽管在五个真实世界 **OOD** 基准上展现了不错的泛化,但合成数据在纹理、光照、物体布局等方面的多样性仍可能与复杂真实场景存在差距,极端域外条件下的稳定性未经验证,也未探索混合真实数据进行微调的效果,这可能限制方法在开放世界应用中的鲁棒性。
  • **VDrop 掩码设计手工化**:**View Dropout** 通过对输入视图的部分区域进行遮挡来迫使模型使用思考图像,但掩码的生成策略(如何选择遮挡区域、遮挡比例)在文中未做充分的消融分析,可能对任务敏感且需要大量手动调整,缺乏自动化生成掩码的机制,这会增加在不同下游任务中应用的工程负担,且该方法仅作用于训练阶段,无法在零样本推理时直接启用。
  • **视觉思维策略探索不完整**:比较仅限于 **自上而下**、**全景**、**点匹配** 三种渲染形式,但中间视觉表示的设计空间远大于此(如深度图、语义分割、3D 特征场等)。虽然提出了 **可学习性-信息量** 权衡框架,但结论的普适性受到有限候选策略的限制,可能遗漏了更优的思考图像类型,未来需要在更大范围的视觉思维形式中验证该框架的有效性。
论文Qian Yang2026-05-26原文

相关内容