ConsiSpace: 学习几何一致性对于视频空间推理至关重要
视频空间推理对于导航感知和长视频问答至关重要,模型需要在变化视角下跨长序列推断空间关系。然而,现有多模态大语言模型 (MLLMs) 主要偏向语义中心,往往无法可靠地从冗余视频观测中聚合一致的空间证据,导致推理低效或不稳定。 为解决这些问题,我们提出 ConsiSpace——一个几何一致性感知框架,将空间一致性转化为证据组织原则和显式的后SFT学习信号。我们构建了几何一致性记忆 (GCM),包含隐式证据令牌和显式几何线索,并通过高效组织策略紧凑保留任务相关空间证据。此外,在监督微调后,我们采用统一一致性自监督强化学习 (UC-SSRL),以答案、度量和拓扑一致性奖励提升跨视角稳定性。 在VSI-Bench、OSI-Bench和MMSI-Video-Bench三个空间推理基准上的大量实验显示一致提升,平均得分比最强基线提高12.6个百分点。
论文精读
TL;DR ConsiSpace 通过几何一致性记忆与自监督强化学习,将空间一致性转变为证据组织和学习信号,显著提升 MLLM 在长视频跨视角空间推理中的稳定性与准确性,平均提升 12.6 分。
问题
问题背景
视频空间推理是导航感知和长视频问答的关键能力,要求模型在视角变化下推断长时间跨度的空间关系。当前多模态大模型(MLLMs)大多以语义为中心,难以从冗余的视觉观测中可靠地聚合一致的空间证据。
现有方法局限
主流 MLLMs 依赖采样帧序列或隐式特征融合,缺乏显式的几何约束与一致性检验机制。当视频包含大量重复背景或微小视角偏移时,模型容易产生跨帧不一致的预测,例如对同一物体的方位给出矛盾判断。这种不稳定性源于:
- 证据聚合低效:仅靠注意力机制聚合长序列空间信息,容易丢失或混叠关键位置线索;
- 训练信号缺失:标准指令微调(SFT)仅优化单帧问答,未能显式惩罚跨视角不一致性。
为什么这个问题难且重要
空间推理的难点在于几何一致性需同时满足多个层次:答案层面的语义一致、度量层面的位置精度、拓扑层面的关系保持。视频序列提供了天然的多视角监督,但如何将这种冗余转化为无监督的强化学习信号是重大挑战。业界对此高度关注,因自动驾驶、服务机器人、AR 导航等场景均要求模型在长时序中维持稳定空间认知,任何不一致都可能导致定位错误或不良决策。
行业类比
这类似于自动驾驶中的多传感器融合,如果不同时刻的激光雷达点云在没有外参校准的情况下直接拼接,目标检测框会剧烈跳动;同样,视频空间推理也需要一种“内参校准”机制来保证时序一致性。
核心洞察
- 将几何一致性作为视频空间推理的证据组织原则,突破了现有 MLLMs 仅依赖语义线索的局限。ConsiSpace 构建了融合隐式证据令牌和显式几何线索的几何一致性记忆(GCM),通过高效组织策略紧凑保留任务相关空间证据。相比 Semantic-centric 模型容易从冗余视频中提取碎片化、不一致的空间信息,GCM 显式维护跨帧几何一致性,使证据聚合更稳定,从源头解决了推理不稳健的问题。
- 在后监督微调阶段引入统一一致性自监督强化学习(UC-SSRL),将空间推理从静态监督学习升级为跨视角稳定性的动态对齐。通过答案一致性、度量一致性和拓扑一致性奖励,模型无需额外标注即可自监督地强化对视角变化的鲁棒性。这与仅依赖 SFT 的 baseline 不同,有效缓解了同一样本不同视角下推理结果波动的问题,为导航、长视频问答等需时空稳定感知的应用提供了新的训练范式。
方法
整体流程
ConsiSpace 以长视频及对应问题作为输入,先通过视觉编码器逐帧提取特征,结合几何编码器(如深度估计或相机位姿)获取显式几何线索,再送入几何一致性记忆模块(GCM)进行时空聚合与压缩。最终由多模态大语言模型(MLLM)解码出空间推理答案。训练分为两阶段:监督微调(SFT)和统一一致性自监督强化学习(UC-SSRL)。
几何一致性记忆(GCM)
GCM 是核心组织模块,包含两类信息:
- 隐式证据令牌:由跨帧注意力筛选出的任务相关视觉特征,动态更新。
- 显式几何线索:如深度、相对位姿、点云片段,作为一致性约束的锚点。
记忆采用高效组织策略:按时间窗口分层聚合,并通过拓扑结构先验(如邻接图)引导压缩,在保留多视角空间证据的同时剔除冗余帧。该设计将空间一致性从启发式规则提升为显式的记忆架构原则。
统一一致性自监督强化学习(UC-SSRL)
在 SFT 后,UC-SSRL 通过无人工标注的自我对弈方式,用三种一致性奖励优化跨视角推理稳定性:
- 答案一致性奖励:同一场景的多个变体(如不同采样帧序列)应产生相同答案。
- 度量一致性奖励:预测的距离/角度应与几何线索保持数值一致。
- 拓扑一致性奖励:对象间的相对方位、遮挡关系等拓扑布局应一致。
模型生成多个候选推理路径,根据上述奖励计算优势值,用策略梯度更新,使 MLLM 学会利用 GCM 中的一致性证据,而非依赖单帧语义猜测。
差异点
与常见的事后提示增强或纯数据驱动方案不同,ConsiSpace 将几何一致性同时作为记忆构建的归纳偏置与强化学习的优化目标,从结构上迫使模型关注多视角稳定证据,而非仅仅拟合答案表面模式。
实验
实验设计
在三个视频空间推理基准 VSI-Bench、OSI-Bench 和 MMSI-Video-Bench 上评估 ConsiSpace,覆盖导航感知与长视频问答等不同场景。对比方法包括主流多模态大语言模型(MLLM)及消融变体,统一使用监督微调(SFT)后接本文提出的 统一一致性自监督强化学习(UC-SSRL) 进行训练。除准确率外,还引入效率与可扩展性分析、导航导向验证及定性案例。
关键发现
- 在所有三个基准上,ConsiSpace 均取得一致提升,平均得分比最强基线高出 12.6 点。
- 消融研究表明 几何一致性记忆(GCM) 与 UC-SSRL 各组件均有贡献,特别是答案一致性、度量一致性和拓扑一致性奖励共同提升了跨视图推理的稳定性。
- 定性结果显示模型能更可靠地聚合冗余视频观测中的空间证据,减少语义中心方法常见的推理波动。
与基线对比解读
现有 MLLM 主要依赖语义信息,在视角变化下难以保持长程空间关系的一致性。ConsiSpace 通过将空间一致性同时作为记忆组织原则和后训练学习信号,使模型从冗余视频流中提取稳定几何证据。与仅使用 SFT 的变体相比,UC-SSRL 带来的额外增益验证了自监督一致性优化对几何敏感任务的关键作用;而相比其他引入空间先验的工作,ConsiSpace 的记忆压缩与组织策略在效率上具有优势,证明无需过度增加计算即可获得显著精度提升。
行业影响
落地场景
ConsiSpace 的核心能力是跨视角视频空间推理与几何一致性建模,可应用于需要理解动态场景中物体间空间关系的产品。典型场景包括:
- 增强现实(AR)/混合现实(MR) 导航:室内外导航应用可通过手机或头显的实时视频,持续感知用户周围物体的相对位置,即使视角大幅变化也能稳定给出空间指引。
- 视频监控与安防:多摄像头场景下,模型能够跨不同视角跟踪可疑对象的活动轨迹,消除视野切换带来的空间歧义。
- 自动驾驶感知:环视摄像头拼接与跨时序的占用网络预测中,几何一致性可作为先验约束,减少相机间标定误差导致的空间漂移。
商业价值
- 降本:模型对冗余观测的筛选与一致性聚合能力,可减少视频理解任务所需的稠密帧采样,降低推理算力消耗。同时,UC-SSRL 自监督强化学习无需额外人工标注即可提升稳定性,节省数据成本。
- 增收:在电商直播、短视频平台的内容审核或商品空间展示中,更可靠的空间推理能力能提升自动化标签质量、优化推荐体验,间接驱动用户留存与转化。
- 体验提升:面向自动驾驶与辅助驾驶的人机交互系统,准确稳定的空间描述可减少误报,增强用户信任。
与现有产品/工作流的接口
该方法不是端到端模型替代,而是作为 几何感知器 接入现有 MLLM 或多模态推理管道:
- 特征提取模块:从视频帧序列提取空间特征,可与主流视觉编码器(如 ViT、VideoMAE)并行工作,输出几何一致性增强的隐式 token 和显式线索。
- 推理增强组件:GCM 可部署为 MLLM 前端的 查询感知缓存,在 prompt 中加入历史空间证据,使 LLM 能直接引用而不必重复处理冗余帧。
- 后训练校准模块:UC-SSRL 可作为通用微调阶段,对齐不同数据增强或视角变换后的输出一致性,尤其适用于域适应或跨设备部署前校准。
具体落地 Use Case
- 电商直播智能解说:在带货直播中,主播会手持商品在镜头前转动、走位,导致视角频繁变化。ConsiSpace 能帮助系统持续理解商品的三维结构及其与背景的相对位置,从而自动生成稳定的商品空间描述,用于自动切片、商品卡片关联与 AR 试穿叠加。
- 仓储机器人空间感知:在大型仓库中,移动机器人需在不同货架之间导航,视角持续变化。利用几何一致性强化学习后的模型能够融合前后帧的深度线索,稳定估计货架间距与自身位置,降低碰撞风险,提高拣选效率。无需依赖昂贵的高精度 SLAM 系统,仅从视觉输入即可维持空间记忆的连贯性。
局限
- **计算开销与训练复杂度**:ConsiSpace 引入的**几何一致性记忆 (GCM)** 需要提取显式几何线索(如深度、相机位姿),并结合**统一一致性自监督强化学习 (UC-SSRL)** 进行后训练优化。这一流程增加了特征提取和奖励计算的开销,对长视频或高分辨率输入尤为显著。UC-SSRL 的多目标奖励设计(答案一致性、度量一致性、拓扑一致性)需要精细的系数调整,否则可能因奖励冲突导致训练不稳定。实际部署中,如何平衡性能提升与计算成本是工程落地的关键障碍。
- **对显式几何信号的依赖**:GCM 依赖显式几何信息(例如深度图、相机参数)来构建空间一致的记忆表征。在无约束现实视频中,这些信号往往难以精确获取或根本缺失,限制了方法在通用视频理解任务上的即插即用能力。论文实验主要基于合成或受控环境生成的数据集,虽然展示了显著提升,但缺少对大规模、噪声真实视频的鲁棒性验证,其泛化边界尚不明确。