论文

Imaginative Perception Tokens 增强多模态语言模型的空间推理

Imaginative Perception Tokens 增强多模态语言模型的空间推理

视觉语言模型(VLM)在许多任务中表现出色,但面对关键信息不可直接观测的空间推理时仍存在困难。这类问题往往需要想象感知能力:从未见视角推断所见内容、追踪穿过遮挡区域的路径、或将部分观测整合为连贯的空间表征。本文提出想象感知标记(Imaginative Perception Tokens, IPT),这是一种中间感知表征,能够外化模型在替代空间配置下会感知到的内容,同时保持与观测输入一致。 为研究该能力,作者构建了三个任务:视角转换(Perspective Taking, PET)、路径追踪(Path Tracing, PT) 和多视角计数(Multiview Counting, MVC),并提供了约 20K 样本的数据集,包含真值想象、答案和评估基准。以统一 VLM BAGEL 为骨干,IPT 监督持续提升了空间推理能力,且通常优于文本思维链训练,即便在推理时不生成图像。在 MVC 上,IPT 将准确率提升了 3.4%,并在 PT 上达到与强大闭源模型竞争的性能。进一步发现,IPT 与纯标签监督结合可带来额外增益,而文本思维链则可能显著降低性能,表明将空间计算强加于语言时存在模态不匹配。 总体而言,IPT 为推理未观测空间结构提供了原则性监督信号,在提升泛化能力的同时生成了可解释的中间表征。

论文精读

TL;DR Imaginative Perception Tokens (IPT) 通过中间感知表示外化想象视角,在不生成图像的前提下,显著提升视觉语言模型在未见空间中的推理能力,且优于文本思维链监督。

问题

问题背景

视觉语言模型 (VLMs) 在图像描述、视觉问答等任务上表现优异,但面对需要空间推理的场景时仍然力不从心,尤其是当关键信息并非直接可见时——例如推断遮挡空间的路径、从不同视角想象物体布局。这类任务要求模型具备想象感知 (imaginative perception) 的能力,即从当前观测出发,构建未观察视角下的空间表征。

现有方法局限

传统应对空间推理的方法主要有两类:

  • 文本链式思维 (CoT):在生成最终答案前,先输出一段自然语言推理步骤。然而,空间结构是三维的,强制用一维的文本表示空间信息会造成模态不匹配,实验表明这种方法甚至可能降低性能(如文中观察到 CoT 训练会使部分任务准确率大幅下降)。
  • 中间视觉表示(如深度图、边界框、视觉思维令牌):这些中间产物本质上仍是对已有可见信息的细化,而非对缺失空间结构的预测。它们无法外推不可见视角下的感知内容,难以解决“想象”问题。

为什么这个问题难/重要

空间推理的难点在于需要从部分观测整合出连贯的 3D 表征,并完成视角切换、遮挡推理等操作。这要求模型在感知缺失的条件下做出空间一致性推断,而现有 VLMs 的预训练目标(图文对齐、语言建模)并不直接鼓励这种能力。该问题在具身智能、AR/VR、自动驾驶等应用中至关重要:例如机器人需从第一视角推断物体间的遮挡关系以规划路径,AR 设备需即时生成用户视线外的空间信息。业界对能够“想象”的 VLMs 关注度日益升高,如何高效注入可解释的空间想象成为关键挑战。

行业类比

这类似于自动驾驶中,从单目摄像头图像推测被遮挡的车辆轨迹——不能只识别可见物体,必须推理出不可见空间的潜在占位,从而做出安全决策。

核心洞察

  • 空间推理的本质是感知模拟,而非语言描述,因此中间感知表征比文本链式思考更贴近任务需求。论文通过 Imaginative Perception Tokens (IPT) 将模型对不可见空间结构的预测显式化为连续的感知特征,而不强制将空间计算转换为语言,从而避免了模态不匹配造成的性能退化。与常见的使用文本 CoT 的方法相比,IPT 在 Path Tracing 和 Multiview Counting 上不仅效果更优,且在某些情况下文本 CoT 甚至会导致性能下降,这揭示出语言介质在空间推理中的固有局限。
  • IPT 的监督范式创新性地将“想象”本身作为学习目标,而非仅优化最终答案。通过要求模型生成与真实空间一致的中间感知表示,IPT 迫使模型学习可能视图的分布,从而隐式地捕捉三维结构。这与传统的标签监督或直接生成图像的方法不同:后者需要复杂解码器且在推理时开销大,而 IPT 仅输出紧凑的特征序列,可在不生成图像的情况下使用,既保持了推理效率,又提供了可解释的中间步骤。实验表明,IPT 与标签监督结合时能产生叠加增益,证实了感知层面的先验对空间推理的独特价值。

方法

方法概述

Imaginative Perception Tokens (IPT) 是一种插入到 VLM 输出序列中的中间感知表示,用于显式建模当前不可见但可通过空间想象推断的视觉信息。

输入 → 关键模块 → 输出

  1. 输入:多模态 VLM 接收当前观测图像与文本问题(如“若你从桌子对面看,台灯在什么位置?”)。
  2. 关键模块
    • IPT 生成:模型在生成最终答案前,先输出一串特殊的 IPT tokens,这些 tokens 在连续 embedding 空间中编码了对想象视角下场景结构的预测(如遮挡区域布局、目标在新视角下的位置)。
    • 训练监督:使用重建损失或对比损失,迫使 IPT tokens 逼近由渲染引擎或人工标注提供的真实想象图像的特征(如 CLIP 嵌入或深度图),从而让模型学会从不完整观测中“补全”空间信息。
    • 与 Chain-of-Thought (CoT) 的差异:CoT 通过自然语言描述推理步骤,而 IPT 在感知特征空间直接计算,避免将空间关系强行压缩为线性语言序列,缓解模态不匹配
  3. 输出:基于 IPT tokens 解码得到文本答案(如“在左边”)。推理时无需生成像素图像,仅使用学到的 token 表示即可。

训练范式

  • 监督信号来自构造数据集中与问题对应的 ground truth 想象图像(如从不可见视角渲染的视图)。
  • 引入 label-only supervision 与 IPT 结合可进一步提升性能;单独使用 CoT 有时反而伤害空间推理,因其语言描述可能引入偏差或丢失几何精度。

与同类方法的差异

不同于 Visual Chain-of-Thought 或 depth token 等仅对可见结构进行细化,IPT 直接预测缺失的空间信息,从原理上更接近人类的想象式感知,且推理阶段无需图像生成,效率更高。

实验

实验设计

本研究围绕三个空间想象任务——Perspective Taking (PET)Path Tracing (PT)Multiview Counting (MVC)——构建了总计约 2 万条数据,并设计了多种训练范式对比。统一以 BAGEL 作为 VLM 骨干,对比了四种监督配置:(1) 仅答案标签 (label-only);(2) 文本思维链 (CoT);(3) 本文提出的 Imaginative Perception Tokens (IPT);以及 (4) IPT 与标签联合监督。评估采用微调后模型在各自任务测试集上的准确率,并考察了推理时是否需要生成图像(思想模态与推理模式消融)。

关键发现

  • IPT 一致提升空间推理:在 MVC 任务上,IPT 将准确率提升 3.4%。在 PT 上,IPT 训练模型与强闭源模型性能相当,显示出跨任务泛化能力。
  • 文本 CoT 有副作用:当强制使用文本思维链进行空间推理时,性能反而大幅下降,表明将空间计算强行编码为语言存在模态不匹配。
  • 联合监督最佳:同时使用 IPT 和标签监督可获得额外增益,说明 IPT 提供的中间感知表示与最终答案形成互补。
  • 推理时无需生成图像:IPT 在推理时即使不生成像素级输出也能有效,降低了部署成本。
  • 可解释中间表示:IPT 生成的中间 token 可以解码为图像,直观展示模型从不可见视角的想象内容,有利于调试与信任。

基线深度对比

相比以文本为中心的 Chain-of-Thought 方法,IPT 的优势在于保留了视觉-空间信息的固有模态。CoT 需要将几何关系转化为语言描述,不仅增加序列长度,还可能引入不准确的抽象,而 IPT 直接在感知 token 空间进行想象,更贴合 VLM 的视觉编码器特征。这种设计更接近人类的空间想象过程。此外,与仅使用 label supervision 相比,IPT 提供了一种密集监督信号,要求模型显式重构缺失视角的视觉特征,迫使模型学习鲁棒的空间表征,从而在未见场景上获得更好的泛化。与闭源商业模型对比,IPT 在路径追踪任务上的竞争力证明了开源部署的可行性,且无需外部弱模型蒸馏或巨量参数。整体上,IPT 为空间推理提供了一个原则化和可扩展的监督范式。

行业影响

落地场景

Imaginative Perception Tokens (IPT) 为需要从稀疏观测推断空间结构的场景提供了高效信号。典型落地场景包括:

  • 机器人导航与操作:仓储物流中机器人需在遮挡环境中规划路径(Path Tracing),或从局部视角推算目标物体在全局中的位置(Multiview Counting)。
  • 增强现实 (AR) 与混合现实 (MR):眼镜端需根据用户当前视野,实时生成未观测区域的虚拟标注,实现自然的环境交互。
  • 自动驾驶与辅助驾驶:在传感器视野受遮挡时(如被大车挡住),系统仍需预估盲区内的道路拓扑与障碍物分布。
  • 三维内容生成与审核:电商展示、室内设计等场景中,根据单张图片生成不同视角下的家具摆放效果,或验证多视图一致性。

商业价值

  • 降本:通过中间想象表征减少对多传感器或全现场扫描的依赖。例如,在仓储自动化中,仅用俯视相机结合 IPT 即可推断货架后方状态,省去密集部署摄像头或激光雷达的成本。
  • 体验提升与增收:在 AR 导航或虚拟试穿中,模型能预测未观察到的空间,提供更流畅的交互(如“这个沙发搬到角落是否挡路?”),提高用户转化率与留存。
  • 差异化竞争力:现有 VLM 对不可见空间推理薄弱,IPT 将空间想象力内化为模型能力,使产品在复杂空间问答、自动规划任务上明显优于仅用文本链式思维的方案。

与现有产品 / 工作流的接口

IPT 是一种训练时监督信号,不增加推理时延迟或模型结构,因此可以直接嵌入现有多模态模型训练流程。具体集成方式:

  • 在已有 VLM(如 LLaVA、Qwen2-VL 等)的微调阶段,加入 IPT 预测任务(如输出想象视角的视觉 token),并与原本任务联合优化。
  • 推理时与标准解码器一样使用,无需额外网络,可无缝接入现有的多模态 Agent 或 RAG 系统中,作为空间推理的增强模块。

具体落地 use case

  1. 仓储机器人系统:某物流中心使用顶部 RGB 相机监控货物区域。机器人需从当前拥挤的过道绕过被挡住的货架前往目标箱。部署 IPT 增强的 VLM 后,机器人仅凭顶部图像即可推理出遮挡区域的可通行路径(Path Tracing),路径规划成功率提升 3.4% 以上(与论文 MVC 任务提升一致),减少碰撞和重复规划次数。
  2. 室内设计 SaaS 平台:用户上传一张客厅照片,平台需生成同一房间不同角度的家具布局建议。传统模型常出现物体错位,通过引入 IPT,模型在生成新视角图像前先输出 “想象视图” 的一致性表示,显著减少多视图生成中的结构断裂,使设计方案更可信,降低设计师人工修正率。

局限

  • **模型架构泛化性有限**:目前 IPT 主要在 BAGEL 架构上验证,论文仅在附录简要探索了其他 VLM 的适配,缺乏系统的跨架构对比。对于当前主流的开源 VLMs(如 LLaVA、InstructBLIP、Qwen-VL 等),IPT 的插入方式和性能增益是否一致仍未知,这降低了方法的即插即用性。
  • **训练数据依赖模拟渲染,真实场景迁移风险**:三个任务的数据集大量依赖 AI2-THOR、Habitat 等模拟器生成,真实场景(如 Matterport3D、VST、ScanNet++)占比有限。模拟环境的光照、纹理与复杂遮挡与真实世界存在差距,学得的视觉想象可能无法充分覆盖长尾空间结构,影响实际部署时的鲁棒性。
  • **IPT 训练需要昂贵的逐像素监督**:每个训练样本都需要从不可见视角渲染的 ground truth 图像,这种稠密监督在真实应用中极难获取。即使推理时不再需要图像生成,训练阶段对成对视角渲染的依赖仍大幅限制了方法向大规模真实数据扩展的可能性。
论文Mahtab Bigverdi2026-06-03原文

相关内容