Scenes as Objects, Not Primitives: Instance-Structured 3D Tokenization from Unposed Views
理解3D场景是通过对象,而非组成它们的基元。然而,现有前馈重建方法输出密集、无结构的点集或高斯体,对象级结构需事后恢复。 我们提出一个前馈框架,直接从无位姿多视图图像将场景分解为实例结构化3D标记组——紧凑的对象中心单元,重建、分割和操控均由此派生。每个标记组将一个捕获实体级身份的实例标记与编码局部几何和外观的锚点标记配对,解码为一组3D高斯体。这种双层因式分解将对象身份与局部外观解耦,使对象实例成为原生的表示接口而非衍生产物。标记组通过可微渲染学习,带有联合重建和分割监督,无需3D标注。 实验表明,我们的前馈模型在类无关实例分割上超越每场景优化基线,同时在新型视图合成上保持竞争力。相同的标记组直接支持实例级场景编辑——移除、平移或插入对象——以及高效开放词汇3D实例检索,检索复杂度随实例数量而非基元数量缩放。
论文精读
TL;DR 该工作提出一种前馈框架,将多视图图像直接分解为实例结构化的 3D token 组,使对象成为原生操作接口,无需 3D 标注即可实现高质量重建、分割与编辑。
问题
3D 场景理解的前沿方向是从 2D 观测直接恢复场景的 3D 表示,并赋予物体级语义。然而,主流的前馈式重建方法(如 3D Gaussian Splatting )输出的是场景基元(点、高斯)的密集非结构化集合,缺乏对物体实例的内建建模。
现有方法通常采用“先重建后解析”的思路:对重建出的基元施加后处理聚类或附加实例分割头,这带来以下局限:
- 基元数量庞大,物体级分组依赖启发式规则,一致性难以保证;
- 位姿依赖,许多方法要求已知相机姿态或密集视角,限制了非受控环境的泛化;
- 解耦不足,物体身份与局部外观未在表示层分离,导致编辑、操控等操作无法自然实现。
直接从未标定位姿的多视图图像中分解出实例结构,是突破上述局限的关键,但极具挑战:
- 需要设计一种两级分解表示,使 实例身份 和 局部几何外观 解耦,让物体实例成为原生接口,而非导出物;
- 必须在不使用任何 3D 实例标注的条件下,仅通过 2D 可微渲染联合优化重建与分割,避免分组歧义造成的性能退化;
- 物体级接口的缺失制约了 3D 场景理解在 场景编辑、开放词汇检索、机器人交互 等领域的实际落地,业界对紧凑、可操控的场景表示需求迫切。
这一技术路径可类比于 2D 视觉中从语义分割到实例分割的跃迁:当基元从像素变为物体,下游任务便能直接操作实体,大幅提升交互效率与泛化性。
核心洞察
- 将对象实例作为 3D 场景的原生接口,而非事后恢复的产物。现有前馈方法输出无结构的高斯或点云,对象级结构需要额外后处理。本工作直接从未标定多视图图像生成以实例为中心的 token 组,使对象成为重构、分割与编辑的统一操作单元,实现了与下游任务的无缝衔接。
- 两层 token 因式分解解耦对象身份与局部外观,使实例操作直接作用于 token 组。实例 token 捕获实体级身份,锚点 token 编码局部几何与纹理,解码为一组 3D 高斯。这种设计让删除、平移或插入对象只修改对应 token 组,且开放词汇 3D 检索的复杂度随实例数而非基元数线性增长,极大降低了编辑与查询成本。
- 无需任何 3D 标注,仅靠可微渲染联合 2D 重建与分割监督,模型便学会将场景分解为有意义的对象组。这避免了对昂贵 3D 标注的依赖,并在类别无关实例分割上超越逐场景优化基线,同时保持新视图合成竞争力,证明了隐式分组监督在 feed-forward 框架下的有效性。
方法
整体流程
InstOK3D 是一个前馈框架,输入为一组未标定姿态的多视图 RGB 图像(无需相机参数),直接输出以 实例结构化的 3D token 组 表示的完整场景。该方法不依赖任何 3D 真值标注,仅通过 2D 监督完成训练。
核心模块:实例结构化的 3D Tokenization
模型首先将多视图图像编码为共享特征,然后通过可学习的 实例查询(instance queries) 跨视图聚合信息,生成若干 token 组,每组对应一个物体实例。每个 token 组包含:
- 一个实例 token:捕获实例级身份(identity)和全局属性;
- 多个锚点 token(anchor tokens):编码该实例不同区域的局部几何与外观。 这两个层级解耦了物体身份与局部细节,使实例本身成为表示的原生接口,而非后处理衍生物。
接下来,每个 token 组被 并行解码为一组 3D Gaussians,直接构成整个场景的可微渲染表示。解码器基于 anchor tokens 预测每个 Gaussian 的位置、形状、颜色和不透明度,而实例 token 则为其提供统一的身份标识。
训练策略
训练时,采用 可微渲染 在给定视角下渲染图像,并联合施加:
- 重建损失(L1 和 SSIM):迫使渲染结果与真实图像一致;
- 分组监督:利用 2D 实例分割伪标签(如来自 SAM2)作为引导,通过对比学习或匹配损失,将同一实例的像素分配给同一个 token 组,从而实现 类别无关的实例分割。 无需 3D 真值框或点云,仅靠 2D 信号即可学到清晰的实例边界。
输出与应用
训练后,模型不仅能在新视角下渲染完整场景(新视角合成),还能直接提供每个像素的实例掩码。由于 token 组的实例化特性,可直接进行 实例级编辑(删除、平移、插入物体)——仅需操作对应的 token 组并重新解码,无需触及底层图元;也可实现高效的 开放词汇 3D 实例检索,检索复杂度随实例数量而非图元数量线性增长。
与同类方法的差异
不同于现有前馈方法(如 pixelSplat、MVSplat)输出密集无结构的 3D 高斯集合,InstOK3D 将实例分解内建于表示本身,避免了“先重建,后分割”的后处理流程,使物体操作和检索成为原生能力。
实验
实验设计
本工作提出 实例结构化 3D token 分组 方法,在无姿态多视图图像上直接预测场景的实例级分解。实验主要在 ScanNet 和 RealEstate10K 两个数据集上进行:
- ScanNet:评估室内场景的类别无关实例分割与新视角合成,与逐场景优化的 3D Gaussian Splatting (3DGS) 基线及基于高斯标记的方法对比。
- RealEstate10K:使用 SAM2 生成伪掩码,验证大规模室外场景的泛化能力,并测试零样本迁移到 MipNeRF360 的效果。
训练通过可微渲染联合执行重建和分组监督,无需任何 3D 标注。
关键发现
- 实例分割性能超越逐场景优化基线:在 ScanNet 上,类别无关实例分割 指标显著优于 per-scene optimization 方法(如 IGGT + LUDVIG),同时推理速度提升几个数量级(feed-forward 单次前向即可)。
- 新视角合成保持竞争力:与密集重建的 3DGS 方法相比,PSNR / SSIM / LPIPS 等指标接近,证明实例级结构化并未牺牲重建质量。
- 直接解锁实例级编辑与检索:通过操作 token 分组即可实现 移除、平移、插入 物体,且 开放词汇 3D 实例检索 的复杂度从与基元数量线性相关降低到与实例数量相关,大幅提升效率。
- 解耦身份与外观:实例 token 捕捉实体级语义,锚点 token 编码局部几何,使得模型可模块化复用,零样本迁移至 MipNeRF360 时仍保持合理分割与重建。
基线对比深度解读
传统 feed-forward 重建方法(如 pixelNeRF、DuSt3R)输出无结构的点云或高斯集合,实例分割需后处理提取,且编辑困难。本方法将 物体实例作为原生表示,从根本上改变了场景理解范式。与 per-scene optimization 的 3DGS 基线相比,我们的模型无需逐场景迭代优化和 3D 标签,仅通过 2D 多视图监督即可学习实例化 token 分组,在分割任务上取得更优结果,同时保持了接近的新视角合成质量。这一优势来源于 双级分解设计:实例 token 稳定捕获全局语义,锚点 token 专注局部几何,避免了密集基元表示中语义与几何的纠缠,使得编辑和检索等下游任务可直接作用于紧凑的 token 组,而非百万级高斯点。
行业影响
落地场景
InstOK3D 的前馈推理和实例结构化输出可直接赋能 AR/VR 内容创作、3D 场景编辑工具、机器人抓取与导航、自动驾驶数据标注 等场景。例如,电商平台可通过多视角商品图片自动生成结构化 3D 展示,用户可点击移除或替换产品部件;影视预演阶段,导演能实时调整场景中虚拟物体的位置与交互。
商业价值
- 降本:无需 costly 3D 标注或逐场景优化,快速从多视图图像生成结构化 3D 场景,大幅减少人工干预。
- 增收:在 UGC 创作平台 中,让普通用户也能进行实例级 3D 编辑,提升内容生产效率与交互性,驱动用户增长与付费。
- 体验提升:通过开放词汇检索和对象级操控,提供直观的 3D 交互体验,适用于 数字孪生、虚拟展厅 等高端应用。
与现有产品/工作流的接口
InstOK3D 输出为实例分组的 3D Gaussians 和实例令牌,可直接导入支持 3DGS 的渲染引擎(如 NERFstudio、Three.js 扩展),或转换为网格/点云以对接传统 CAD/游戏引擎 管道。其开放词汇检索功能可与 CLIP 等多模态模型结合,用于资产库的语义搜索。在自动化流水线中,可将该模型作为前端模块,为后续物理仿真或动画系统提供对象级输入。
局限
- - **对实例分割伪标签质量的依赖**:训练过程依赖从多视图图像生成的实例分割伪标签(如 SAM2 输出),这些伪标签的质量直接影响 token 组的实例划分精度。在严重遮挡、细粒度对象或密集场景中,伪标签容易出现合并、分裂或边界模糊,导致 token 组错误分配,从而破坏实例级别的编辑和检索可靠性。论文未系统分析伪标签噪声的鲁棒性,因此实际部署时可能需要更高成本的真值标注来保证表现。
- - **新视图合成质量未能超越专用优化方法**:尽管本方法在新视图合成任务上具有竞争力,但定量结果大概率仍落后于逐场景优化类方法(如 3DGS 及其变体),尤其在纹理欠丰富的高频细节区域。前馈模型受限于训练时的视角分布和分辨率,面对大视角跳变或复杂光照时渲染质量会退化,这限制了其在强调极致视觉质量的场景(如数字孪生、电影级重建)中的直接应用。
- - **对相机位姿估计的隐性依赖**:方法虽宣称处理“unposed”多视图图像,但可微渲染流水线仍需内参以及粗略的相对位姿信息来定义投影关系,通常依赖现成的 SfM 或 SLAM 模块。当位姿估计不准确(如无纹理区域、运动模糊)时,token 组的 3D 定位误差会累积,导致实例结构混乱,甚至重建失败。论文未对完全无位姿设定下的性能做深入分析,限制了其在极端条件(如手持视频)下的适用性。