密集空间感知的视觉预训练
密集空间感知是物理智能的核心,视觉系统需从像素观测中恢复结构化、度量化和可操作的表示。现代视觉基础模型倾向于优先语义不变性,往往牺牲细致的空间理解。本文以边界为中心研究视觉预训练,认为边界和形状不连续性为感知几何属性提供了关键线索。 具体地,我们提出掩码边界建模(masked boundary modeling),一种自监督范式:动态学习子像素边界表示,并利用发现的边界承载令牌作为掩码目标,促进密集视觉令牌学习。通过扩展该框架,我们开发了LingBot-Vision,并以DINOv3为强基线,在多种下游视觉任务中验证其有效性。 显著地,LingBot-Vision驱动深度补全从LingBot-Depth 1.0演进至LingBot-Depth 2.0,从而提升深度估计质量——这是具身人工智能的关键支柱。我们的发现表明,边界建模超越简单线段,而是学习空间结构化视觉表示的可扩展预训练原则。
论文精读
TL;DR 通过掩码边界建模让视觉模型学习亚像素级空间结构,显著提升深度估计等密集空间感知任务,为具身智能提供更强视觉基础。
问题
问题背景
视觉基础模型(如 DINOv3)在语义不变性上表现优异,但对密集空间感知(dense spatial perception)支持不足——此类任务需要从像素观测中恢复结构化、可度量的几何表征,例如精确深度、物体边界与形状。物理智能(embodied AI)的兴起将这一需求推向台前。
现有方法局限
当前主流自监督预训练范式主要沿两条路径:基于自蒸馏的 DINO/iBOT 系列擅长全局语义,但 patch 级特征对几何细节不敏感;掩码图像建模(MAE)虽重建像素,却偏向低频纹理,无法显式捕捉子像素(sub-pixel)精度的边界结构。更本质的是,边界/形状线索难以通过简单回归或边缘检测来稳定学习——边缘图稀疏、非连续,且缺乏对长距离几何关系的编码,导致下游深度补全(depth completion)、视频物体分割等任务中,空间结构信息大量丢失。
为何困难且重要
边界建模的挑战在于:① 边界信号天然稀疏,需要从离散像素中提取连续的子像素表示;② 传统边缘检测无固定“类别”,难以直接适配自蒸馏框架的教师-学生机制;③ 大规模预训练时,边界目标的在线生成需高效并行化,并避免引入人工标注。然而,一旦克服,它将为深度估计、3D 场景理解、机器人操作等具身场景提供通用可迁移的空间先验,这正是业界从感知走向交互的咽喉技术。
行业类比
类似自动驾驶中的高精地图构建:若基础模型能像人类一样从单目图像中“看到”物体轮廓与空间关系,下游的深度估计模型便无需重新学习几何,大幅降低数据依赖。
核心洞察
- 边界建模不是简单的线检测,而是一个可扩展的预训练原则。传统视觉基础模型侧重语义不变性,容易丢失像素级空间结构。该工作将边界视为几何线索,通过掩码边界建模动态学习亚像素表示,让密集视觉 token 自带空间感知能力。这不同于常规的边缘监督或 low-level 任务,它无需边界标注,在自蒸馏框架下将几何归纳偏置注入自监督学习,为下游任务提供了可推广的空间结构化特征。
- 在线生成边界目标并通过几何验证消除噪声,打通了自蒸馏与密集空间学习的结合路径。既往方法难在自监督预训练中有效引入几何监督。该工作利用动态边界场重参数化和 A-contrario 校验,在训练中自动涌现、筛选并利用高质量的边界 token 作为掩码目标,避免了外部标注依赖。这种 bootstrapping 机制让模型先学会“看边界”,再以边界为锚点学习更复杂的空间关系,为具身 AI 的高分辨感知提供了新范式。
方法
基线自蒸馏框架
输入未标注图像,采用 DINOv3 的联合蒸馏:图像级 [CLS] token 蒸馏(DINO)与块级 token 蒸馏(iBOT),并随机掩码部分块。
边界引导的掩码建模
核心在于 Boundary-Forcing Masked Modeling:在线估计图像边界场,生成几何导向的掩码,使被掩码的 token 集中在边缘附近。这些“边界承载 token”作为预测目标,迫使模型恢复掩码区域的空间结构。
边界场的分类重参数化
传统边界检测输出连续概率,与自蒸馏的离散目标不匹配。Categorical Reparameterization 将边界场重定义为有限类别的有向线段或参数化形状的分类问题,每个像素预测其所属边界实例或背景。这稳定了训练,继承了蒸馏的乘积量化优势,并提供“空假设”用于验证。
在线目标生成与 A-contrario 验证
一个轻量 token 级头在线预测边界分类,随后通过 A-contrario 验证 过滤随机结构,仅保留有显著几何意义的边界段作为掩码目标。此过程无需人工标注,解决了边界先验与目标引导的“自举”问题。
多任务训练
总损失为 L_total = L_DINO + L_iBOT + L_boundary_masked,边界损失仅作用在掩码位置,使用交叉熵。数据经大规模策展(2B→161M 图像),实现上利用稀疏融合与在线目标批量 GPU 生成,以控制开销。
输出与应用
预训练编码器 LingBot-Vision 输出密集、空间敏感的视觉表示,显著提升深度补全(从 LingBot-Depth 1.0 到 2.0)、语义分割与视频对象分割。
与同类方法的差异:不同于 MAE 的随机掩码重建或 DINOv2 的语义蒸馏,本方法显式引入边界几何先验,引导模型学习结构化空间表示,在小数据规模下即超越密集任务基线。
实验
实验设计
该方法首先在 ImageNet-1K 上进行概念验证,通过 masked boundary modeling 自监督预训练 ViT,并与 DINOv3 基线对比。消融实验验证了边界掩码、几何路由和类别重参数化的贡献。随后,基于一个从 20 亿原始图像中筛选的 1.61 亿图像数据集训练 LingBot-Vision,并扩展到多种下游密集空间感知任务:深度估计、语义分割、视频对象分割等,使用线性探测评估。还蒸馏出不同规模的学生模型,测试密集与全局任务性能。
关键发现
- 边界建模远不止线段检测;动态学习的子像素边界场可作为强有力的几何训练目标,驱动密集视觉令牌学习。
- PCA 显示,LingBot-Vision 的 patch 特征包含更丰富的结构信息,边界令牌可跟踪视频中的物理边界,验证了空间感知能力。
- 在 LingBot-Depth 2.0 中,将 LingBot-Vision 作为密集感知编码器,结合数据规模扩展,深度补全和估计性能大幅提升,显著超越 1.0 版本。
- 蒸馏模型在保持全局分类能力的同时,密集任务性能损失很小,表明空间结构化表征可压缩迁移。
基线对比深度解读
与 DINOv3 相比,LingBot-Vision 的核心差异在于训练目标从纯语义自蒸馏转向语义+几何联合。DINOv3 擅长语义不变性,但密集空间任务上不足;引入边界掩码目标后,模型被迫编码精细几何信息。实验结果表明,密集任务(深度、分割)提升明显,全局分类持平,证明了边界建模是一种可扩展的预训练原则。该方式无需额外标注,利用自监督发现边界令牌并在训练中作为目标,弥补了现有视觉基础模型在物理空间理解上的缺口。
行业影响
落地场景
密集空间感知预训练可惠及一切需要像素级几何理解的产品:
- 自动驾驶:深度补全、道路边界检测、可行驶区域分割,直接提升安全冗余。
- 机器人:仓储分拣、家庭服务机器人对物体形状和位姿的精确理解。
- 增强现实:虚拟物体的真实遮挡和物理放置,依赖准确的场景深度与边界。
- 电商 3D 展示:商品 3D 模型自动重建、虚拟试穿中衣物与人体轮廓的对齐。
- 医学影像:器官边界勾画、病灶分割,减少标注负担。
商业价值
- 降本:该预训练范式不依赖密集标注,仅通过自监督学习即可获得强空间表征,在微调阶段可大幅降低对昂贵像素级标注的需求,例如深度补全任务中只需少量真实深度点即可恢复完整深度图。
- 增收:在电商场景中,精准的边界建模可自动生成高质量商品 3D 模型与尺寸估计,提升商品转化率并降低退货率。
- 体验提升:在自动驾驶中,更鲁棒的边界感知能减少漏检和误检,提供更平顺的控车体验;在 AR 应用中,虚拟物体与真实场景的边界融合更自然,提升沉浸感。
与现有工作流的接口
该框架输出密集视觉令牌(dense visual tokens),可无缝接入现有视觉任务管道:
- 作为通用编码器:直接替换现有 ViT 或 ConvNet 主干,例如将
LingBot-Vision作为 DINOv3 的替代,通过线性探测或端到端微调适配下游任务。 - 蒸馏轻量模型:论文展示了通过蒸馏得到的小模型在保持空间感知能力的同时大幅提速,适合端侧部署。
- 即插即用的深度补全模块:
LingBot-Depth 2.0可集成到已有的深度传感器后处理流程中,增强稀疏深度点云。
具体落地用例
- 自动驾驶深度补全:采用
LingBot-Depth 2.0对雷达稀疏点云进行稠密化,为路径规划提供更致密的几何信息,在低线束雷达方案中尤为关键,可替代昂贵的高线束雷达,降低硬件成本。 - 电商家具 AR 摆放:利用边界预训练的编码器生成精确的物体轮廓和场景深度,用户通过手机即可预览家具在自己房间的真实尺寸和遮挡关系,减少因尺寸不符导致的退货。
局限
- 边界建模的泛化性可能受限:模型通过亚像素边界预测提供几何线索,但在缺乏清晰边界或结构的场景(如均匀纹理、天空区域)中,边界令牌可能不可靠,导致学习信号减弱。论文未系统评估此类场景下的性能衰减,也未讨论如何缓解,这在实际部署中可能成为瓶颈。
- 训练效率与可扩展性:尽管采用了稀疏和融合的边界计算优化,在线生成边界目标和维护边界令牌仍引入额外开销。与纯 MAE 类方法相比,训练吞吐量可能有所下降。大规模预训练(161M 图像)的具体计算资源和训练时间未详细披露,可能影响复现和工程落地时的资源规划。
- 下游任务覆盖面有限:当前评估集中在深度补全、语义分割和视频对象分割等任务,尚未扩展到其他对空间感知要求较高的密集预测任务(如 surface normal 估计、光流、多视图立体)。此外,论文仅展示了在 LingBot-Depth 2.0 上的应用,对于更广泛的具身 AI 任务(如机器人操作)的直接价值尚待验证。