论文

SceneAligner: 3D支撑的真实场景Floorplan Localization

SceneAligner: 3D支撑的真实场景Floorplan Localization

许多公共建筑提供带有“您在此处”指示的平面图,帮助访客定位。平面图定位旨在通过计算确定视觉观察在平面图中的位置,从而复制这一能力。然而,现有方法通常假设受控的小规模环境和精确的矢量平面图,限制了其在大型建筑和栅格化平面图中的应用。 本文提出了一种在真实场景中进行平面图定位的方法,通过将任务建立在场景的重建3D表示上。给定无约束的图像集合,我们的方法重建重力对齐的3D场景,并将其投影为二维密度图,作为平面图代理。平面图定位随后被表述为通过2D相似变换将此代理与输入平面图对齐。为了弥合密度图与建筑平面图之间的外观差异,我们适配2D基础模型学习跨模态对应关系,并引入一种微调方案,在保持结构一致性的同时鼓励语义对齐的匹配。 大量实验表明,我们的方法在极稀疏设置(仅用单张输入图像)下也显著优于先前方法。代码和数据将公开。

论文精读

TL;DR SceneAligner 通过重建重力对齐的 3D 场景并将其投影为密度图,再与目标平面图进行跨模态对齐,即使在单张图像输入下也能实现野外环境的鲁棒楼层定位。

问题

室内视觉定位领域长期探索如何利用建筑平面图实现精确的“你在这里”式定位。然而,现有方法普遍存在三个关键局限:一是依赖精确的矢量化平面图(如墙线、门洞),而真实场景多为栅格化图像(扫描图、PDF 截图),矢量提取本身易出错且耗时;二是假设受控的小规模环境(如单房间或小楼层)与密集的图像采集(全景序列),无法应对大型公共建筑中无约束的互联网照片集(视角杂乱、元数据缺失);三是缺乏对场景3D 几何的显式建模,难以处理遮挡、视角变化及跨楼层对齐。

该问题的核心难点在于跨模态语义鸿沟:平面图是抽象的结构符号,而视觉观测是现实的光度外观,二者在纹理、尺度、遮挡上差异巨大。尤其在极度稀疏观测(甚至单张图像)下,匹配线索极其薄弱,且需同时保持全局结构一致性,避免错位或扭曲。业界对此高度关注,因为鲁棒的平面图定位是AR 室内导航、机器人自主探索、应急响应等领域的关键使能技术,直接决定系统在非标环境中的部署可行性。

从技术路径看,该任务可类比为利用卫星地图校准航拍图像:借助已有结构化先验(平面图),将零散的视觉观测配准到固定参考系,本质是跨模态的相似变换估计问题,但复杂度更高,因为室内场景缺乏全局纹理且几何约束更复杂。

核心洞察

  • 将 3D 场景重建作为 floorplan localization 的中间表征,使方法不再依赖精确的矢量化平面图,从而能够处理现实中更常见的栅格化平面图与大尺度建筑。以往方法多假设已知矢量平面图或严格可控的小范围环境,而 SceneAligner 从无约束图像集合重建重力对齐的 3D 场景,并投影为 2D 密度图作为与平面图对齐的代理,有效弥合了视点外观与建筑符号之间的鸿沟,大幅提升了在真实场景中的适用性。
  • 通过微调 2D 基础模型来学习密度图与建筑平面图的跨模态对应,并引入结构一致性正则化,使得在极稀疏输入甚至单张图像下仍能建立可靠匹配。传统基于手工特征或决策树的方法面对稀疏观测时极易失效,而该工作利用基础模型的描述能力与针对性的微调策略,强制语义对齐同时保持几何结构稳定,在公开数据集上显著超越现有方法,为低数据量下的室内定位提供了新的范式。

方法

输入 → 关键模块 → 输出

输入为一组无约束图像(如游客拍摄的室内照片)和一张光栅化建筑平面图

关键模块分为三步:

  1. 3D 场景重建与代理生成:首先使用现成的运动恢复结构(SfM)方法从图像中重建重力对齐的 3D 点云,然后将其沿重力方向投影到水平面,生成一张2D 密度图——像素值反映场景点在水平位置的分布密度。该密度图作为平面图的代理(proxy),无需精确的向量化图纸。
  2. 跨模态对应学习:为弥合密度图与建筑平面图之间的巨大外观差异,方法微调了一个2D 基础模型(如基于 ViT 的特征提取器),学习两种模态间的像素级对应关系。微调引入三部分目标:
    • 特征匹配目标 利用对比损失拉近匹配像素对的嵌入,推远非匹配对;
    • 坐标回归目标 直接预测对应点在平面图中的坐标,采用 L1 回归损失;
    • 结构一致性正则化 鼓励邻近像素的预测偏移保持局部平滑,避免碎片化匹配。 所有训练数据通过自动增强(密度图旋转、缩放、裁剪,平面图对应变换)生成,无需人工标注。
  3. 可靠对应与平面图对齐:在预测的对应关系中,通过几何一致性筛选出高置信度匹配点,然后用这些点估计一个2D 相似变换(旋转、缩放、平移),将密度图(即场景代理)注册到输入平面图上。变换后的结果即为相机位姿估计,实现平面图定位。

输出是图像拍摄位置在平面图上的坐标及朝向,可用于“You are here”指示、室内导航等下游应用。

与同类方法的差异:现有方法多依赖精确的向量化平面图并假设小范围受控环境,而本方法直接从光栅化图纸出发,通过 3D 重建生成密度图并利用预训练视觉模型学习跨模态对应,在大规模建筑、稀疏输入(甚至单张图片) 下仍能鲁棒工作。

实验

实验设计

  • 真实世界 C3 数据集(无约束网络图像)和合成 Structured3D 数据集上评估,涵盖室内外多种场景。
  • 基线分为两类:基于跨模态对应的 2D 匹配方法(如 SuperGlue 变体)和传统室内定位方法(依赖矢量平面图)。
  • 评估指标包括相机位姿误差(旋转、平移)和对应点精度;专门测试极稀疏输入(1~数帧)下的鲁棒性。
  • 消融实验分析微调策略、LoRA 配置、密度图超参数、3D 重建模型选择等。

关键发现

  • 在杂乱真实场景中显著超越所有基线,即使仅单张图像也能完成平面图定位,证明 3D 几何先验对稀疏输入至关重要。
  • 密度图代理成功弥合图像与栅格化平面图的模态差距,通过微调 2D 基础模型 学习到的跨模态对应具有强鲁棒性。
  • 结构一致性正则化 有效防止过拟合到错误匹配,坐标回归分支 进一步提升端到端对齐精度。

与基线的深度对比

  • 纯 2D 对应学习易在弱纹理或重复结构区域失败,而本方法借助 3D 场景重建 获取全局几何约束,匹配更可靠。
  • 对比依赖精确矢量平面图的定位方法(如 LAM),本方法直接处理未经矢量化的栅格图,更贴近实际部署需求,且无需语义分割等预处理。
  • 多视图 3D 重建赋予密度图视角一致性,即使输入图像存在遮挡或大视角变化,仍能生成稳定的平面图代理,保证相似变换对齐的精度。

行业影响

落地场景

SceneAligner 将平面图定位任务从受控小规模环境拓展到大规模真实建筑栅格化平面图,核心落地场景包括:

  • 大型公共场所导航:购物中心、机场、医院、博物馆等,用户通过手机拍照即可在建筑平面图中定位自身位置,弥补 GPS 室内失效的不足。
  • AR/VR 内容对齐:将虚拟内容精准叠加到现实建筑结构上,支持沉浸式导览、游戏和远程协作。
  • 机器人室内定位:为服务机器人提供低成本的视觉定位方案,无需部署额外信标,仅需平面图和摄像头。
  • 紧急疏散与安全管理:结合实时图像快速定位人员位置,辅助应急响应。

商业价值

  • 降本:无需昂贵的室内定位基础设施(如 UWB、蓝牙信标),仅利用现成平面图普通图像即可实现精确 3-DoF 定位,大幅降低部署和维护成本。
  • 增收:精准室内定位可赋能 LBS 广告推送、店铺引流和用户行为分析,提升商业空间坪效。
  • 体验提升:解决用户在陌生大型建筑中的迷路问题,提升满意度与停留时长;低至单张图像即可定位的鲁棒性,保证极端情况下仍能工作。

与现有产品/工作流的接口

该方法输出重力对齐的 3D 场景重建二维密度图,可作为中间表示与现有系统集成:

  • 前端:从任意图像集合重建 3D 场景,生成密度图代理,用户只需上传图片或视频流。
  • 后端:密度图与建筑平面图通过2D 相似变换对齐,结果以 JSON 形式返回相机位姿和对应关系,易于接入任何移动端或 Web 端导航应用。
  • 扩展性:利用 2D 基础模型(如 DINOv2) 学习跨模态对应,无需针对不同建筑风格重新训练,可直接迁移到新场景。

具体落地 Case

  1. 大型电商平台线下零售店导航:顾客在 App 内拍摄货架照片,系统实时匹配商场平面图,引导顾客找到目标商品或促销区域,提升购物体验和转化率。
  2. 会展中心智能导览:参观者拍照后自动定位,App 推送附近展位信息和会议日程,支持个性化路线规划,提升展会组织效率与参展商曝光。

局限

  • **3D 重建质量依赖**:方法需要从非约束图像集合重建重力对齐的 3D 场景,当输入图像极度稀疏(如单张)或视角覆盖不足时,重建的密度图可能出现空洞或几何失真,直接影响后续对齐精度。实验虽展示了稀疏设置下的鲁棒性,但未系统分析极端几何退化场景(如长走廊、重复纹理)下的失败模式,实际部署时可能需配套重建失败检测与降级策略。
  • **跨模态泛化边界不明**:通过微调 2D 基础模型学习密度图与建筑平面图的语义对应,但微调数据来源(C3 数据集)与测试场景可能存在分布偏移(如手绘平面图、非标准符号),其泛化能力未在跨风格平面图上充分验证。此外,模型依赖的“结构一致性正则化”可能压制跨模态匹配的灵活性,导致在结构差异较大的平面图中错失有效对应。
  • **计算开销与实时性瓶颈**:3D 重建(如 COLMAP 或 DUSt3R)及跨模态推理的端到端流程耗时较长,论文未提供推理时间的具体对照,但在实际应用中(如移动端即时定位)难以满足实时性要求。密度图生成与对齐均假定静态场景,动态物体或临时遮挡可能引入额外噪声,方法对此类干扰的鲁棒性未经评估。
论文Junhyeong Cho2026-05-21原文

相关内容