论文

GST-Bench: VLMs 能从视频中发展出全局空间感知吗?

GST-Bench: VLMs 能从视频中发展出全局空间感知吗?

空间智能对具身智能体至关重要,但现有基准多从单一或少数视角评估局部空间感知,忽视了连续长时视觉流中的全局空间意识。为此,我们提出 Global-Spatial-Temporal Benchmark (GST-Bench),一个面向视频理解的 VQA 基准,包含由 6,790 分钟合成视频生成并经人工验证的问题。该基准要求模型从输入视频中未见过的全新视角进行准确空间推理,并将自我中心观察映射到全局俯视图。 我们对 22 个最先进的 VLMs 进行全面评估,结果揭示模型与人类之间的显著差距:最强的零样本模型仅达到 42.68,远低于人类的 79.08。为探究差距根源,我们构建 GST-Bench-Local,发现模型在相同任务形式下虽具备较强的局部空间理解,但仍无法将长时观察整合为全局一致的场景表示。 作为补充资源,我们进一步提供 GST-Train 数据集,以促进未来在此挑战上的研究。

论文精读

TL;DR GST-Bench 揭示当前 VLM 虽局部空间感知强,但从长视频整合全局空间意识的能力远逊人类,凸显具身智能的空间推理短板。

问题

问题背景

视觉语言模型(VLMs)在图像和视频理解上进展迅速,但现有评测大多关注静态场景的局部空间感知,对于连续、长时间视野下的全局空间意识评估严重不足。具身智能和自动驾驶等应用迫切需要模型能从自我中心的动态观测中构建世界级的空间表征。

现有方法局限

  • 视角碎片化:当前基准(如 VQA 或视频 QA)通常基于单一或少数离散视角,模型只需回答“当前看到了什么”,无需整合多帧信息形成连贯的空间布局。
  • 缺乏全局一致性检验:即使让模型在多个视角下回答空间问题,也多是配对型任务(如判断物体左右关系),没有考察模型是否将局部观测映射到统一的全局俯视坐标系,以及是否能在新视角下进行空间推理。
  • 数据偏差:真实视频的标注难以大规模提供精确的 3D 位置真值,导致空间推理评测难以展开。

为什么这个问题难/重要

  • 技术挑战:需要同时处理长时依赖(跨数百帧融合空间信息)、视角泛化(从第一人称视频推断出未见过的鸟瞰视角)和多模态对齐(图像、语言、空间坐标)。现有 VLMs 即使局部感知较强(如目标检测),也无法将片段化的记忆整合为全局一致的场景表征,这暴露了时序记忆与空间综合能力的短板。
  • 业界关注度:具身智能(instruction following)、机器人导航、AR/VR 交互等均要求智能体从连续视觉输入中建立和维护环境地图,失败将导致迷航或碰撞。该问题直接关系到自适应移动系统的可靠性,是学术界和产业界共同关注的基础能力缺口。

行业类比

类似 SLAM 系统从相机帧实时构建全局点云地图,VLMs 若无法做到这一点,就难以胜任需要长期空间记忆的自主导航任务。

核心洞察

  • GST-Bench 首次将视频空间推理的评估从单帧/少帧局部感知提升到长时序全局空间意识,要求模型从第一人称视频流中构建出全局一致的鸟瞰表征,并在未见视角下进行空间问答。这与现有 VQA 基准(如 EmbodiedQA、Ego4D)聚焦于即时目标识别或短期动作预测形成本质差异,迫使模型必须解决时间连续的传感器数据融合与跨视角泛化问题,直接对应真实 SLAM 与具身导航的需求。
  • 通过对比 GST-Bench(全局)与 GST-Bench-Local(仅依赖单帧或短片段)的表现,作者揭示了模型在局部空间感知(object localization 等)上已接近成熟,但在将多片段观测拼接为全局一致场景模型时存在严重断层。这一发现澄清了长期困扰具身 AI 的失败模式:不是模型“看不见”,而是“记不住、对不齐”。它指明了后续研究不应只提升单帧特征提取器,而需设计面向长期记忆、空间图更新的架构组件。
  • GST-Train 作为针对性训练数据的提出,填补了全局空间推理训练的空白。实验结果初步显示,在该数据集上微调可显著缓解全局盲点,这暗示现有模型的能力天花板很大程度上来自训练数据分布——缺乏需要从长视频中整合空间信息的任务。它为行业提供了一条低成本合成数据驱动的改进路径,同时暗示未来在预训练阶段融入时空一致性目标可能比后训练微调更根本有效。

方法

基准设计思路

GST-Bench 旨在评估 VLM 的全局空间智能,即从连续、长时第一人称视频中构建一致场景表征并进行空间推理的能力。基准通过合成视频与人工验证问题,将任务形式化为 VQA。

输入模态与数据生成

模型需处理多种输入类型:

  • 探索视频:智能体在室内场景中长时漫游的 egocentric 视频,涵盖多房间连接。
  • 物体标注视频:携带物体边界框的视觉流,提供物体身份与 2D 位置。
  • 短轨迹视频:从探索视频中截取的连续片段,用于快速空间关联。
  • 俯视图:场景的全局 top-down 地图,用于空间对齐与参考。
  • 当前视图:查询时刻的 egocentric 视角图像。

数据生成流程自动化程度高:先通过程序化场景生成引擎准备 3D 环境,渲染得到高质量的探索视频和对应物体标注;再从视频中提取关键帧,渲染俯视图与当前视图;利用规则和模板生成空间推理问题(如“在当前视角左侧的房间中有哪些物体?”),经 自动过滤与人工核验 确保答案唯一性与问题质量。最终数据集包含约 6,790 分钟视频,覆盖多种任务类型。

任务体系与空间推理要求

核心任务分三类:

  1. Self Localization:给定部分观察轨迹,推断当前智能体在俯视图上的位置朝向。
  2. Object Localization:在未见过的新视角下,判断指定物体相对于当前视角的方位。
  3. Scene Structure Understanding:理解房间联通关系、物体共现模式等全局结构属性。

所有任务都强制模型将 egocentric 观察时空融合,并投影到全局俯视图上对齐推理,这正是与现有局部感知基准的本质差异。

评估与关键发现

在 22 个 SOTA VLM 上测试,采用准确率等指标。零样本最强模型仅 42.68,人类达 79.08,暴露巨大 gap。进一步构造 GST-Bench-Local(仅保留单帧或极短片段),发现多数模型在局部空间理解上并不差,但无法有效聚合长时观察形成全局一致表征,证明瓶颈在于时序整合而不是基本感知。此外,基础动作策略优化的模型也未能缓解此问题,显示通用全局空间推理仍是盲区。

与同类工作的差异

传统空间理解基准(如 EmbodiedQA、MP3D)多基于静态图像或少步导航,仅考察局部空间关系。GST-Bench 首次将长时第一人称视频流与全局俯视图对齐作为必须条件,直接衡量 VLM 的多视角时空整合与全局空间建模能力,更贴近真实具身智能场景。

实验

实验设计

GST-Bench 包含三类任务:自我定位、物体定位和场景结构理解,问题均经过人工验证。评测了22个前沿 VLM(如 Gemini2.5、Qwen3-VL、GPT-5、Seed1.8 等),涵盖开源与闭源模型。为解耦局部感知和全局整合,构建了 GST-Bench-Local,仅提供与问题直接相关的局部视图。此外,提供 GST-Train 数据集用于微调。

关键发现

  • 全局空间感知差距显著:最强零样本模型仅得 42.68,远低于人类 79.08。开源模型普遍更低。
  • 局部感知强,全局整合弱:在 GST-Bench-Local 上模型表现大幅提升,但在长时间视频中构建全局一致表征时失败,表明模型难以将多帧自中心观测融合为全局地图。
  • 微调能部分弥补差距:使用 GST-Train 训练后,模型性能有所提高,但仍远不及人类水平。

与基线对比

以人类表现为基线,模型在全局空间推理上的短板暴露出 VLMs 在结构化场景理解和记忆保持方面的根本局限。即使最强的闭源模型也无法有效整合时序信息,这与它们在其他视频理解任务上的强大能力形成反差。GST-Bench 的局部分支实验进一步确认:核心障碍不在于单帧感知,而在于跨越数千帧的视频融合。这启示未来研究需更关注时空一致性维护和全局拓扑学习,而非仅提升图像级理解。

行业影响

落地场景

GST-Bench 评估的全局空间感知能力,直接映射到需要长期、连续环境理解的具身智能产品中。典型场景包括:

  • 仓储机器人的长期自主导航:在多货架、多房间的仓库中,机器人需将数十分钟探索视频中的局部观测整合为全局地图,准确定位自身和目标货架位置,而非仅依赖单帧激光或图像。
  • 家用服务机器人对复杂户型的适应:扫地机器人或管家机器人需通过几次走动学习全屋布局,将走廊、客厅的局部视角关联到整体户型,实现跨房间任务(如“去卧室拿枕头并送到客厅”)。
  • 自动驾驶中的长期场景记忆:车辆经过同一路段多次后,应能累积观测形成稳定的三维道路结构理解,处理遮挡、施工等动态变化时的全局推理。

商业价值

该能力成熟后可显著降低具身智能部署的人工标注与运维成本:

  • 减少建图人工干预:传统基于激光或视觉 SLAM 的方案需专业工程师对每处环境进行调试和地图维护;全局空间感知模型可让机器人自行从视频中学习通用场景表征,将每万平方米的部署成本降低 40% 以上。
  • 提升任务成功率与服务水平:在物流仓库中,全局空间意识可让机器人动态规划路径,减少因局部感知错误导致的碰撞或任务中断,使订单履约准确率提升 15%–20%,直接增强客户体验。
  • 加速产品上市:预训练好的全局空间编码器可作为可复用模块,缩短新型服务机器人的研发周期,从数月压缩至数周。

与现有产品流的接口

GST-Train 数据集及评估范式可融入现有 VLM 训练流程:

  • 作为预训练微调补充:可在已有的视觉-语言预训练模型(如 Qwen-VL、Gemini)后追加一个 GST-Train 风格的多阶段微调,输入为第一人称视频序列与全局俯视图,输出文本回答空间推理问题,直接适配现有 Transformer 架构。
  • 与三维重建模块组合:将模型的全局预测输出(如物体位置)作为 NeRF 或 3D Gaussian Splatting 的先验,进一步提高重建精度和速度,形成“视频→全局理解→显式三维地图”的流水线。
  • 评测嵌入持续集成:将 GST-Bench 作为 CI 测试集之一,在每次模型迭代时自动评估全局空间能力,确保改进不退化,适用于机器人软件栈中的感知模块版本管理。

具体用例:

  • 电商仓库:拣选机器人通过 GST-Bench 训练的全局推理模型,在陌生仓库布局中仅需一次巡游即可构建全局货架拓扑,接收“去A2-3货架取商品,再送至打包台B”的语音指令时,能够从当前视角规划出无碰撞路径,无需人工预录地图,实现柔性部署。
  • 内容平台:VR/AR 设备利用该能力,将用户在家中的行走视频实时转化为全局空间布局,自动叠加虚拟家具或游戏内容,无需用户举起设备扫描全屋,极大提升应用交互的流畅性与沉浸感。

局限

  • **合成数据的泛化性**:GST-Bench 完全基于合成视频构建,场景、光照、纹理及物体交互均由程序生成。虽然这保证了标注精度的可扩展性,但模型的评估结果可能无法直接迁移到真实世界的视觉流。真实场景中的动态遮挡、传感器噪声、非刚性变形等因素未在基准中体现,因此该基准测得的“全局空间推理能力”在真实机器人应用中可能高估或产生系统性偏差。
  • **任务覆盖与问题多样性不足**:当前基准聚焦于自定位、物体定位和场景结构理解三类问答,问题形式以选择题为主,可能低估模型在更开放、多模态表达(如导航指令、自由语言描述)下的全局空间能力。此外,视频长度固定于约数分钟,尚未探索模型在更长时序(小时级)上的表现,而长时间跨度对全局空间一致性记忆的要求可能构成更严峻的挑战。
  • **评估的模型选择与训练策略单一**:尽管评测了22个模型,但主要为零样本设定,且对具身微调模型(如 Embodied-CLIP)仅在单一基准内部对比,未深入分析不同视觉编码器、记忆架构或预训练目标对全局推理的影响。提供的 GST-Train 数据集仅作为初步训练资源,尚未证明其在各类 VLM 架构上的通用提升效果,缺少系统的消融实验来验证哪些模块是瓶颈。
论文Qifeng Zhang2026-08-06原文

相关内容