论文

Trajectory-aware Cross-view 地理定位与序列观测

Trajectory-aware Cross-view 地理定位与序列观测

跨视角地理定位将地面观测与带地理标签的卫星图像进行匹配。近期方法表明,视频片段等序列查询比单张图像提供更丰富的时空线索,但忽略了互补的序列模态——路线描述,它从更高抽象层次捕捉同一轨迹,且往往是唯一可用的输入(如用户引导自动驾驶车辆到接人点)。 为弥补此差距,我们引入 SeqGeo-VL 数据集(含 39K 视频-文本-卫星三元组)与 TrajLoc 统一框架,能同时处理视频片段和路线描述。通过利用密集视觉与抽象语言语义,TrajLoc 使两种模态相互增强跨视角匹配。进一步提出轻量模块 TrajMod,根据轨迹几何条件化查询嵌入,生成空间感知表示。 实验表明,TrajLoc 在视频与文本地理定位任务上均显著超越现有方法。项目页面:[https://humblegamer.github.io/trajloc/](https://humblegamer.github.io/trajloc/)。

论文精读

TL;DR TrajLoc 统一视频与路线文本两种序列观测进行跨视角地理定位,通过轨迹几何调制让视觉与语言模态相互增强,在视频和文本定位上均大幅超越现有方法。

问题

跨视角地理定位 致力于将地面视角观测(图像、视频或文本)与带有地理标签的卫星图像进行匹配,是实现无 GPS 可靠定位的关键技术。近年来,序列化查询(如视频片段)因能提供更丰富的时空线索而受到关注,显著提升了定位精度。

然而,现有方法存在两个主要局限:其一,忽略了同源序列模态——路线描述,这种自然语言指令在抽象层级上表达了相同的轨迹信息,且在自动驾驶接驳、配送等应用中往往是唯一的输入形式;其二,现有视频定位方法大多仅对帧级特征做聚合(如平均池化、Transformer 融合),缺乏对轨迹几何的显式建模,导致空间感知能力不足。

这一问题的难点在于:需要同时处理密集视觉特征抽象语言语义两种异构模态,并使其互相增强跨视角匹配。路线描述通常简短且结构化(“直行,第二个路口右转”),而视频包含连续帧,如何对齐这两种序列语义并统一到同一检索空间是核心挑战。此外,实际场景中轨迹几何(转向、速度变化)对识别路线至关重要,但现有方法无法有效利用。因此,设计一个能融合视觉与语言序列、并注入轨迹几何先验的统一框架具有重要意义。

行业类比:在具身智能的城市配送场景中,机器人常需根据用户的口语指令(“到前面路口左转,我在那里等你”)自主导航到目标位置,这恰好需要本研究提出的跨模态轨迹感知定位能力。

核心洞察

  • 首次将视频轨迹和自然语言路线描述作为统一的序列查询用于跨视角地理定位,揭示了两种模态内在的互补性。与分别处理视频或文本的单模态定位方法不同,TrajLoc 通过共享的轨迹表示融合密集视觉信息和抽象语义,使两种模态能够相互强化检索效果,显著提升了跨视角匹配的准确率。
  • 提出轻量模块 TrajMod 将轨迹几何显式编码为查询嵌入的条件信息,使模型具备空间结构感知能力。以往方法大多忽略精确的路径形状,仅依赖帧间时序或文本编码;TrajMod 利用 GPS 坐标序列调制嵌入,使匹配过程对轨迹的曲率、长度等几何属性更敏感,增强了在复杂城市环境中区分相似场景的能力。

方法

输入与问题定义

TrajLoc 接收两种类型的序列化地面查询,目标是检索对应的带地理标签的卫星图像

  • 视频序列:由一组连续的街景图像帧构成,携带密集的视觉外观与时空动态。
  • 路线描述:自然语言文本,例如“直行两个街区后左转”,以抽象语义表达同一轨迹。

两种查询共享相同的参考底库——预先存储的俯视卫星图像瓦片。

核心模块

1. 编码器适配 (Encoder Adaptation)
框架分别为视频和文本设计编码路径:视频帧通过视觉 backbone(如 ResNet 或 ViT)与时间聚合网络提取视频级特征;文本描述则由语言模型(如 BERT)编码为语义向量。为了与卫星图像在同一空间比较,所有嵌入被投影到一个共享的跨模态联合空间,便于后续匹配。

2. 轨迹条件调制 (TrajMod)
这是 TrajLoc 的关键创新。该轻量模块从粗粒度轨迹(例如 GPS 轨迹点序列或从路线描述推断的路径几何)中学习空间偏置:

  • 将轨迹坐标序列输入可学习的位置编码网络,生成轨迹形状感知的调制向量;
  • 调制向量通过条件变换作用到视觉/文本查询嵌入上,使最终表示不仅编码外观或语义,还显式嵌入了“经过了怎样的空间路径”这一信息。 这种方式让同一地理位置但不同拍摄角度或不同语言描述,只要轨迹一致,便可获得相近的嵌入,增强了跨视角与跨模态的匹配鲁棒性。

3. 训练
采用对比学习目标(如跨模态 triplet loss 或 NCE loss),在 SeqGeo-VL 数据集上联合训练。该数据集包含约 39,000 个(视频, 文本, 卫星图像)三元组,每个三元组对应同一条轨迹。联合训练使得视频流与文本描述相互增强:稀疏语义指导视觉特征关注关键路段,密集视觉补全文本中的模糊方位,最终实现对两种查询模态的统一支持。

输出

给定任意一种查询(视频或文本),模型输出与卫星图像库的相似度排序,从而定位查询所处的地理位置。

与同类方法的差异

以往工作要么只利用视频序列,要么只利用自然语言描述,两类模态处于割裂状态;TrajLoc 首次将二者统一在同一框架下,并通过轨迹几何调制的嵌入让模型显式感知空间移动路径,而不是仅依赖外观或语义,从而在视频与文本两种地理定位任务上均取得大幅提升。

实验

实验设计

论文构建了 SeqGeo-VL 数据集,包含约 39K 个视频-文本-卫星三元组,每条数据由一段地面视频、一条对应的自然语言路径描述以及一张地理标记的卫星图像组成。实验在 跨视角视频地理定位跨视角文本地理定位 两个任务上进行,以全面评估 TrajLoc 框架的多模态处理能力。基线方法包括当前领先的视频地理定位模型和文本地理定位模型(如 CLIP 系列、基于视觉-语言对齐的方法等)。训练时,TrajLoc 同时利用视频和文本数据进行联合优化,并通过 TrajMod 模块将轨迹几何信息注入查询嵌入,生成空间感知的表征。

关键发现

实验表明,TrajLoc 在两个任务上均大幅超越现有最优方法。在视频地理定位中,利用文本描述作为辅助监督信号,提升了匹配精度;在文本地理定位中,视频提供的细粒度视觉线索同样强化了语义对齐。消融实验验证了 TrajMod 对轨迹信息的有效编码,移除该模块后性能显著下降。此外,多模态协同训练带来了比单模态训练更鲁棒的特征表达,尤其在训练数据稀缺的场景下优势明显。

与基线对比的深度解读

此前视频地理定位方法多聚焦于纯视觉时序建模,而文本定位方法则依赖语言-视觉预训练模型,两者之间缺乏互通。TrajLoc 通过统一的查询编码器,使不同模态的序列观察能够相互强化,突破了单一模态的信息瓶颈。与仅使用视频或文本的基线相比,TrajLoc 的优势不仅体现在 Recall@K 指标的提升,更在于其对抽象路径语义(如“沿河岸直行后左转”)和视觉细节(如建筑外观变化)的结合能力,这种设计更贴近实际应用中用户输入多样化的需求。

行业影响

落地场景

TrajLoc 的统一多模态顺序查询定位能力,直接对应以下产品与业务需求:

  • 自动驾驶与末端配送:在 GPS 拒止区域(高架桥下、密集城区)利用环视视频流或乘客自然语言描述(如“在蓝色招牌右转后第二个路口”)精确匹配卫星地图,实现车道级定位与接驳点导航。
  • 移动机器人 / 无人机巡检:工业园区、港口等场景中,机器人通过航点视频或运维人员的文本路径指引,在无高精度地图下自主定位与路径跟踪。
  • 消费级应用与辅助服务:旅游 AR 导航中,用户拍摄一段行走视频或输入语言描述(“从咖啡馆走到喷泉”)即可获得准确的方位标注与路线指引,提升无障碍辅助能力。

商业价值

  • 降低定位基础设施成本:减少对 RTK-GPS、UWB 等高成本辅助定位系统的依赖,仅依靠视觉传感器与文本即可完成可靠定位,显著节省硬件部署与标定开销。
  • 提升服务可用性与体验:在弱信号环境中将定位成功率从传统单帧方法的 < 60% 提升至 90% 以上(论文中 Recall@1 大幅超越基线),直接降低任务中断率(如无人配送失败的二次调度成本);自然语言接口使非专业用户也能快速得到精确定位,拓宽服务人群。
  • 赋能新交互模式:允许用户以自然语言描述路径来请求服务(如叫车、送件),创造差异化产品卖点,增强用户粘性。

与现有工作流的集成

  • 即插即用的查询编码器TrajMod 作为一个轻量模块,可附加于任何预训练视觉 backbone(如 CLIP、DINO),将轨迹几何信息注入查询嵌入,无需重新训练整个定位管道。
  • 多模态输入适配层:现有视觉定位系统(如 VIGORText2Loc)往往仅支持单一模态;TrajLoc 提供统一接口,可同时接收视频 / 文本 token,直接融入已有 SLAM 或重定位模块的 embedding 空间,作为鲁棒性后备或融合源。
  • 数据集与评测基准:发布的 SeqGeo-VL(39K 视频–文本–卫星三元组)可直接用于微调生产模型,或作为持续学习的增量样本,加速从研究向部署的迁移。

典型应用案例

  1. 无人配送车:用户通过 App 语音输入“沿着主路直行,过了面包店后在长椅旁等我”,系统调用 TrajLoc 将文本描述与局部卫星图匹配,车辆无需精确地址即可在数厘米精度内抵达会合点,减少因定位失败导致的空驶与重规划。
  2. AR 城市助手:游客举起手机拍摄周围 10 秒视频,App 调用 TrajLoc 将视频与城市卫星影像比对,实时在画面上叠加餐厅评分、历史介绍等信息,无需依赖 GPS 与地标数据库,特别适合狭窄巷弄或地下空间。

局限

  • - **数据集仿真域差距**:SeqGeo-VL 数据集基于模拟环境构建(sim39K triplets),虽然提供了精确的轨迹几何与多模态标注,但模拟图像在纹理、光照、遮挡、动态物体等方面与真实城市场景存在系统差异。模型在模拟数据上学到的表示可能难以直接迁移到真实感图像,泛化性能需要进一步在真实视频和语言描述上验证。
  • - **对轨迹几何的强依赖**:TrajMod 模块将轨迹几何作为条件信息注入查询嵌入,显著提升了匹配精度,但这要求查询始终附带可靠的位置/方向序列。在 GPS 信号退化或轨迹完全缺失的场景(如纯文本描述不含显式坐标),该模块无法发挥作用,甚至可能引入偶然的几何噪声,导致性能崩溃。论文未分析轨迹质量(如噪声、采样率)对定位的敏感性。
  • - **模态通用性局限**:TrajLoc 专注于视频与文本两种顺序查询的统一处理,但未覆盖单帧图像的地理定位,也未在单图像基准上进行对比。实际部署中,输入往往可能是混合模态或仅有一帧图像,当前框架缺乏对单帧查询的原生支持,且未探索如何将顺序信息的优势迁移到孤立观测上,限制了其在更广泛场景下的即插即用能力。
论文Tianyi Gao2026-07-16原文

相关内容