ATSplat: 自适应令牌扩展的紧凑前馈3D高斯泼溅
3D高斯泼溅 (3DGS) 通过优化3D空间中自由放置的源语并在欠重建区域自适应稠密化,实现了高质量的新视角合成。然而,现有前馈3DGS方法大多丢失了这种场景自适应容量分配能力,通常将高斯回归到输入像素并沿相机射线提升。这种像素对齐方式使源语数量和位置依赖于图像分辨率和输入视角,而非场景复杂度,导致高斯集密集且冗余。 为此,我们提出 ATSplat,一种前馈3DGS框架,通过 自适应3D令牌 恢复了3DGS优化的自适应分配能力。ATSplat 首先将粗糙的块级深度和相机线索提升为稀疏的3D锚点令牌,形成紧凑的场景支架。然后每个令牌通过可学习的3D偏移回归为局部高斯,将源语放置与输入图像网格解耦。自适应令牌扩展模块 预测令牌级不确定性分数,受渲染误差图监督,并通过可学习扩展层选择性地扩展高不确定性令牌。这种 稀疏到自适应 的公式使得 ATSplat 能够在挑战性区域集中源语,同时保持紧凑表示。 在两个代表性数据集 RealEstate10K 和 DL3DV 上的实验表明,ATSplat 实现了最先进的渲染质量,同时与密集前馈3DGS方法相比,高斯数量减少了 5.7倍 以上。从12张512×960分辨率的输入图像中,ATSplat 在单个商业GPU上不到一秒完成重建,并以 1136 FPS (512×960) 渲染高质量新视角,仅需 311K个高斯。
论文精读
TL;DR ATSplat 通过自适应 token 扩展恢复前馈 3DGS 的自适应容量分配,以极低高斯数实现高质量实时重建与渲染,重建<1 秒、渲染>1000 FPS。
问题
问题背景
3D 高斯泼溅 (3D Gaussian Splatting, 3DGS) 通过启发式优化实现了高质量的新视角合成,其核心优势在于能根据场景复杂度自适应分配高斯原语 (Gaussian primitives):在欠重建区域动态稠密化,在简单区域保持稀疏。然而,前馈式 3DGS 方法追求推理速度,通常将高斯回归与像素网格绑定,这种设计牺牲了自适应能力,导致生成的 3D 表示冗余且与场景内容脱节。
现有方法的局限
- 像素对齐的原始生成方式:现有前馈方法 (如 pixelSplat、MVSplat) 在输入图像每个像素处预测高斯,并通过相机射线将其提升至 3D 空间。这使得原语数量与图像分辨率强相关,而非场景的实际几何或纹理复杂度。
- 缺乏局部密度控制:优化式 3DGS 可通过克隆和分裂操作动态调整密度,而前馈网络是一次前向 pass,无法感知不同区域的重建难度,导致平坦墙面与精细纹理区域分配相同的高斯数量。
- 冗余表示与资源浪费:像素对齐策略产生大量冗余高斯,例如对天空或无纹理平面等简单区域,仍分配密集原语,既增加存储与渲染开销,又未提升质量。
为什么这个问题难且重要
- 解耦像素网格与 3D 分配:要让网络学会“哪里需要更多原语”本质上是组合优化问题,需要同时解决不确定度估计与非均匀采样。直接回归 3D 位置容易陷入局部最优,且训练信号弱。
- 实时推理与紧凑表示的平衡:前馈方法的初衷是快速重建,若加入过于复杂的自适应模块往往牺牲推理速度。如何在一次前向中实现稀疏到自适应的转变,并保持端到端可微,极具挑战。
- 行业关注度:紧凑的 3D 表示对于 VR/AR、移动端渲染、3D 内容生成等应用至关重要。降低高斯数量可大幅减少内存带宽和计算量,使高保真 3D 重建能在资源受限设备上实时完成。
行业类比
这与视频编码中的动态码率分配类似:编码器根据运动复杂度和纹理信息为不同宏块分配 bit 预算,而 ATSplat 试图在 3D 高斯域为不同区域自适应分配“原语预算”,以在有限的计算资源下实现最高重建质量。
核心洞察
- 从像素对齐到稀疏 3D anchor tokens 的解耦,恢复了前馈 3DGS 中缺失的场景自适应容量分配能力。现有方法在输入像素处回归 Gaussians,导致 primitives 数量由图像分辨率和视角决定,而非场景复杂度,产生大量冗余。ATSplat 先用粗粒度 patch 深度与相机线索生成稀疏 anchor tokens 作为场景骨架,再通过 learnable 3D offsets 回归局部 Gaussians,使 primitive 放置真正反映场景几何需求,同时大幅压缩 Gaussians 数量(减少 5.7 倍以上)。
- 以渲染误差图监督的 token-level uncertainty 预测,驱动 Adaptive Token Expansion 有针对性地在重建困难区域增加 primitives。不同于均匀上采样或固定启发式规则,ATSplat 让模型学会预测每个 token 的不确定度,并用可学习的 expansion layers 选择性扩展高不确定度 token。这种从稀疏到自适应的策略使得计算资源集中于欠重建区域,在保持紧凑表示的同时达到 SOTA 渲染质量,且推理时可通过调节 uncertainty 阈值动态控制 Gaussians 数。
方法
输入与整体流程
ATSplat 以多视图 RGB 图像及对应的相机内外参为输入,在单次前馈推理中直接生成紧凑的场景 3D 高斯表示,无需逐场景优化。整个过程遵循 稀疏锚点初始化 → 令牌解码 → 高斯回归 → 自适应扩展 的线索。
关键模块
- 多视图图像编码器:将各输入图像编码为特征图,并利用 patch 级立体匹配获得粗略的深度估计与相机线索。这一阶段不生成像素对齐的高斯,而是为后续 3D 锚点提供初始几何信息。
- 稀疏 3D 锚点令牌初始化:从多视图特征中采样或聚合出少量锚点位置(例如通过 farthest point sampling),并赋予可学习的 3D 坐标与特征向量,形成场景的 稀疏骨架。这些锚点数量远少于像素数目,且与图像分辨率解耦。
- 图像到 3D 解码器:以锚点令牌为查询,在 Transformer 解码器中与多视图图像特征交叉注意力,迭代更新令牌的 3D 位置与特征,使其更准确地刻画场景结构。
- 锚点到局部高斯的回归:每个锚点令牌通过 MLP 预测一组局部高斯基元(包括相对偏移量、协方差、颜色、透明度等)。可学习偏移量允许高斯的最终位置偏离锚点中心,从而在自由空间中灵活放置基元,彻底摆脱像素网格的约束。
- 自适应令牌扩展 (Adaptive Token Expansion, ATE):在每个解码层或选定层,模型为每个锚点令牌预测一个 不确定性分数,该分数由渲染误差图提供监督(高误差区域 → 高不确定性)。根据分数选择 top-k 令牌,通过可学习的扩展层(例如拆分或复制令牌)增加令牌数量,并在后续层中为新令牌分配更多高斯预算。这一机制模拟了 3DGS 优化中的致密化策略,使模型能将计算资源集中于几何复杂或纹理丰富的区域。
输出与推理
最终输出为一组紧凑的 3D 高斯,其数量由场景复杂度自适应决定,而非固定于输入分辨率。从 12 张 512×960 图像重建仅需约 311K 高斯,单张 GPU 耗时小于 1 秒,并可实时渲染新视图(~1136 FPS)。
与同类方法的差异
相比现有前馈式 3DGS 方法(如 pixelSplat、MVSplat)将高斯与输入像素刚性绑定,导致高斯数量受限于分辨率且分布冗余,ATSplat 利用 3D 锚点令牌和自适应扩展首次在前馈框架中恢复了与优化式 3DGS 类似的场景自适应容量分配能力,在保持高渲染质量的同时将高斯数量压缩 5.7 倍以上,实现了紧凑性与效率的显著提升。
实验
实验设计
在 RealEstate10K 与 DL3DV 两个代表性数据集上评估,统一使用 12 张 512×960 输入图像,对比现有前馈 3DGS 方法,重点考察渲染质量、高斯图元数量与重建速度。此外还分析了高分辨率新视角合成、跨数据集泛化与不同视角重叠度下的鲁棒性。
关键发现
- 自适应容量分配: ATSplat 通过 Adaptive Token Expansion (ATE) 模块,根据渲染误差预测 token 级不确定性,仅扩展高不确定性区域,成功恢复了优化式 3DGS 的 densification 思想,使高斯数量较密集前馈方法减少 5.7 倍以上,同时达到 SOTA 渲染质量。
- 极速推理: 重建阶段仅需 <1 秒(单张消费级 GPU),新视角渲染可达 1136 FPS(512×960),平均仅使用 311K 个高斯,极大降低存储与计算开销。
- 解耦像素网格: 粗粒度 patch 深度与相机信息先升维为稀疏 3D 锚点 token,再回归局部高斯偏移,打破了传统像素对齐方法中高斯数量与图像分辨率强绑定的局限。
与基线的深度对比
相比 pixelSplat、MVSplat 等密集回归方案, ATSplat 的核心优势在于从“均匀超量分配”转向“按需稀疏分配”。基线方法在平坦纹理区域同样放置大量高斯,造成严重冗余;而 ATSplat 的 不确定性引导扩展 使模型学会在物体边缘、高光、薄结构等难重建区域集中计算资源,实现了与场景复杂度适配的紧凑表示。这种设计思想对实际工程极具启发:在低算力设备上部署时,可动态调整不确定性阈值直接控制高斯预算,无需重训模型(见原文 C.1 节),为实时 3D 重建与流式传输提供了新的范式。
行业影响
落地场景
ATSplat 从稀疏多视图图像(如 12 张 512×960 输入)实时生成紧凑 3D 高斯表征,适合需要快速场景重建与高帧率渲染的应用:
- XR 与虚拟制作:面向虚拟演播室、电影预演、AR 眼镜的实时环境捕捉,以极低延迟生成可交互的 3D 场景。
- 电商 3D 商品展示:从几张旋转视图秒级生成商品 3D 模型,替代传统耗时的手工建模或 NeRF 式优化。
- 自动驾驶仿真:快速将街景图像转换为紧凑的语义 3D 场景,用于感知模型训练的数据增强与闭环测试。
- 内容平台 3D 化:短视频平台可将用户上传的几张照片实时转为沉浸式 3D 贴文,增强用户参与。
商业价值
- 降本:高斯数量相比 pixelSplat 等密集前馈方法减少 5.7 倍以上(仅 311K 高斯),显存与存储成本大幅下降;重建耗时不到 1 秒(单商用 GPU),远快于逐场景优化的 3DGS(约需数分钟)。
- 增收与体验升级:在 RealEstate10K 和 DL3DV 上达到 SOTA 渲染质量(PSNR/SSIM/LPIPS),1136 FPS 的高速渲染可支撑交互式应用,为 XR 设备、在线 3D 预览等业务带来流畅用户体验,从而提升转化率与留存。
与现有产品/工作流的接口
ATSplat 的稀疏 Anchor Token 与自适应扩展机制可无缝嵌入现有 3D 重建流水线:
- 前端输入:接受多视图图像与相机位姿(如 COLMAP 或 SLAM 输出),可直接替代 pixelSplat 等密集前馈方法作为实时重建模块。
- 后端输出:输出标准 3DGS 格式(位置、协方差、颜色等),兼容现有 3DGS 渲染器与后期处理工具。
- 集成方式:作为轻量级推理 API 部署在云端或边缘设备;模型一次前向即完成重建,无需逐场景微调,可集成到 3D 资产生成管线(如与多视角扩散模型配合,先扩图再重建)。
具体落地 Use Case
- 在线家具商城:用户上传 3 张手机拍摄的沙发照片,系统秒级返回可自由旋转、缩放的高保真 3D 模型(仅数百 KB 高斯文件),嵌入商品详情页。相比传统 3D 建模外包,单 SKU 成本从数十美元降至近乎为零,且生成速度满足即时交互需求。
- VR 培训模拟:企业用全景相机拍摄工厂车间,ATSplat 将每一组视图实时转化为轻量 3D 场景,设备端即可实现 1000+ FPS 渲染,让学员在 VR 中无眩晕地漫游。紧凑表征使多场景切换无加载延迟,支撑大规模部署。
局限
- 论文主要在静态场景数据集(RealEstate10K、DL3DV)上验证,未涉及动态场景、非朗伯表面(如反射、半透明物体)或严重遮挡区域的重建。自适应 token 扩展策略高度依赖渲染误差图的监督质量,当几何复杂度过高或训练视角覆盖不足时,误差图可能不准确,导致扩展策略失效。此外,前馈方法的泛化性受限于训练数据分布,对于严重偏离训练域的 scene layout 或 camera 轨迹,可能需要微调或重新训练。