ZipSplat:更少高斯,更好拼接
当前前馈3D高斯泼溅方法每输入像素预测一个高斯,将表示预算与相机分辨率绑定,而非场景复杂度。例如,平坦墙壁与丰富纹理物体产生相同数量高斯,尽管几何需求迥异。 本文提出ZipSplat,一种基于令牌的前馈模型,将高斯放置与像素网格解耦。多视图骨干提取密集视觉令牌,k-means聚类压缩为紧凑场景令牌;交叉注意力与自注意力精炼后,轻量MLP解码为高斯组,其3D位置无约束。推理时聚类使单一模型可沿质量-效率曲线调整,无需重训练。 在DL3DV和RealEstate10K上,ZipSplat使用约6倍少于像素对齐方法的高斯,分别超越最佳无姿态基线2.1dB和1.2dB PSNR。零样本泛化至Mip-NeRF360和ScanNet++,超越所有可比基线。
论文精读
TL;DR ZipSplat 将高斯分布与像素网格解耦,通过 token 聚类压缩场景表示,以少约 6 倍高斯量实现更优渲染,无需真实姿态即可在多个基准上取得新 SOTA,并支持推理时自由调节效率与质量。
问题
问题背景
Feed-forward 3D Gaussian Splatting(3DGS)通过单次前向传递从多视图图像重建场景,无需逐场景优化,极大提升新视角合成的效率。
现有方法局限
当前主流方法(如 pixelSplat、MVSplat)采用 pixel-aligned 策略:每个输入像素对应一个高斯体,导致表示预算完全由相机分辨率决定,而非场景几何复杂度。一面白墙与一尊纹理复杂的雕塑会生成数量相同的高斯体,产生大量冗余。即便高分辨率区域平坦无物,也无法降低高斯体数量;而在细节丰富处,像素预算又可能不足。这种耦合限制了模型在有限资源下的扩展性,且难以在不重新训练的情况下灵活调整细节层级。
技术挑战与重要性
解开高斯体与像素网格的绑定是核心难题:需要从多视图图像中提取紧凑、语义有意义的场景表示,同时保证不牺牲渲染质量。无姿态输入进一步增加难度,因为模型必须在未知相机位姿的情况下推断空间结构。ZipSplat 引入基于 token 的聚类压缩:先用多视图骨干网络提取稠密视觉 token,再用 k-means 聚类 压缩为少量 scene token,并通过注意力机制精炼后解码为自由放置的高斯体。这种设计让同一模型覆盖从高质量到高效率的整条曲线,无需重新训练,在 DL3DV 和 RealEstate10K 上以 ~6× 更少的高斯体超越最佳无姿态基线 2.1dB 和 1.2dB PSNR,还零样本泛化到 Mip-NeRF360 和 ScanNet++。业界对 feed-forward 3DGS 的轻量化与自适应压缩日益关注,ZipSplat 的 token 化路径为可控场景表示提供重要参照。
行业类比
类似 Transformer 中的动态 token 剪枝,根据图像区域的信息密度分配表示资源,这里用可配置的聚类数量实现高效与灵活的视效重建。
核心洞察
- 将高斯点放置与像素网格解耦,通过 token 化与 k-means 聚类实现场景自适应高斯预算分配,打破了传统 feed-forward 3DGS 方法用固定分辨率绑定表示容量的局限。与 pixel-aligned 方法如 pixelSplat 相比,ZipSplat 能根据场景几何复杂度动态调整高斯数量,在纹理贫乏区域大幅压缩冗余,提升效率。
- 在无需真实相机位姿和内参的 pose-free 设定下,ZipSplat 以 token 聚类和跨视图注意力隐式学习多视图几何一致性,解决了现有方法依赖预标定或位姿估计的瓶颈。在 DL3DV 和 RealEstate10K 上,它仅用约六分之一的高斯点就超越最佳 pose-free 基线 2.1dB 和 1.2dB PSNR,证明了紧凑表示与高质量重建可以兼得。
- 模型一次训练后,通过推理时调节聚类中心数即可沿质量-效率曲线自由滑移,无需重新训练或设计多阶段架构。这种推理时弹性调整的能力让 ZipSplat 在不同计算预算下无缝适配,相比固定预算或重新训练的方法,工程部署灵活性显著提升,尤其适合资源受限或实时应用场景。
方法
输入与目标
给定无位姿、无内参的多视图图像,模型在一次前向传播中直接重建可渲染的 3D 高斯场,无需每场景优化。
从像素网格解耦:Token 化表示
传统前馈 3DGS 方法为每个输入像素生成一个高斯,导致表示预算由相机分辨率决定,而非场景几何复杂度。ZipSplat 的核心创新是将高斯放置与像素网格解耦:
- 多视图 Backbone(如 Vision Transformer)提取稠密的视觉 token,编码局部几何与纹理信息。
- k-means 聚类压缩:对这些 token 进行聚类,将数量降至一个紧凑的场景 token 集合。聚类中心学习自适应地覆盖场景中的重要区域,纹理平坦的墙面则被压缩为极少 token。
- 注意力精炼:引入 cross-attention(跨视图或与原始 token 交互)和 self-attention,让场景 token 充分融合多视图上下文,提升全局一致性。
从 Token 到高斯:自由 3D 放置
每个场景 token 通过一个轻量 MLP 解码为一组高斯(而非一个高斯)。关键设计点:
- 无约束 3D 位置:高斯的中心坐标直接从 token 特征回归,不受像素射线约束,允许自由放置在三维空间中。
- 多高斯输出:单个 token 可预测多个高斯,使模型能在局部区域内分配不同细节层次(如物体边缘与平坦表面)。 最终输出是一组紧凑的高斯原语,每个高斯带有常规属性(位置、协方差、颜色、不透明度),可直接输入可微光栅器渲染新视图。
训练策略
- 几何监督:结合深度或重投影等几何信号,引导位置预测的准确性。
- 渲染损失:基于 L1 和 SSIM 等光度损失优化新视图合成质量。
- 渐进式调度:训练初期可能从较少的 token 或较低分辨率开始,逐步增加复杂度,稳定收敛。
- 聚类参数:k-means 在训练时可能是可微的近似或固定超参,推理时可调整聚类数量以控制高斯预算,无需重新训练。
与同类方法的差异
不同于** pixelSplat**、MVSplat 等像素对齐方法(每个像素一个高斯),ZipSplat 通过基于聚类的场景 token 压缩,以少约 6 倍的高斯数量在 pose-free 设置下达到更高渲染质量,展示了从“像素驱动”到“内容驱动”表示的关键转变。
实验
实验设计
ZipSplat 在 DL3DV 和 RealEstate10K 上进行训练,评测多视图新视角合成,完全脱离真值姿态和相机内参。模型基于多视图骨干提取稠密视觉 token,经 k-means 聚类 压缩为场景 token,再利用交叉与自注意力解码为高斯组。同一模型通过调整推理时的聚类数量覆盖质量-效率曲线。零样本泛化实验在 Mip-NeRF360 和 ScanNet++ 上验证。
关键发现
与像素对齐方法相比,ZipSplat 使用约 6 倍少的 Gaussians,在 DL3DV 上 PSNR 领先最佳无姿态基线 2.1 dB,在 RealEstate10K 上领先 1.2 dB,同时保持零样本泛化能力,全面超越同类基线。显式的 token 压缩机制使高斯数量适应场景几何复杂度,而非简单依赖输入分辨率。
基线对比解读
传统 feed-forward 3DGS 方法为每个输入像素生成一个高斯,导致平坦区域和纹理区域分配相同数量的原语,冗余严重。ZipSplat 通过 场景 token 化 和 聚类压缩 解耦这一绑定,让模型自动聚焦于几何与纹理关键区域。注意力机制保证了多视图信息融合,即使无姿态条件也能实现更优的重建精度。推理时可灵活调整高斯预算,无需重训练,为实际部署提供了高效、可配置的方案。
行业影响
落地场景
ZipSplat 的核心能力是从无位姿多视图图像直接前馈生成紧凑的 3D 高斯表征,特别适合需要快速、轻量 3D 重建的产品场景:
- 电商与商品展示:对商品拍摄多角度照片,实时生成可在网页/AR 中交互的 3D 模型,无需人工建模或昂贵设备。
- 内容平台与 UGC 工具:社交媒体、短视频平台可嵌入该功能,让创作者用手机拍摄视频后自动生成 3D 场景或物体,用于 AR 滤镜、虚拟背景等。
- 数字孪生与建筑可视化:无人机或地面机器人采集多视角图像后,快速生成室内外环境的高效 3D 模型,用于监控、模拟或虚拟漫游。
商业价值
- 大幅降低计算与存储成本:相比像素对齐方法,ZipSplat 用约 6 倍更少的高斯点 达到更高 PSNR,意味着更低的显存占用和更快的渲染速度,可直接降低云端推理成本,并让移动端部署成为可能。
- 提升用户转化与体验:在电商中,3D 交互展示可提高购买转化率;在内容平台,低延迟的 3D 生成能增加用户参与度和停留时长。
- 可调节的质量-效率曲线:推理时无需重训练,仅通过调整聚类得到的 token 数量即可平衡质量与性能,这种灵活性让同一模型可以服务不同成本敏感度的客户(如高精渲染 vs. 快速预览)。
与现有产品 / 工作流的接口
ZipSplat 的输出是标准的 3D 高斯点云,可直接对接现有的 3D 高斯泼溅渲染器(如 gsplat、diff-gaussian-rasterization),无需定制引擎。其 token-based 架构容易嵌入到更大的多模态模型中作为 3D 编码器。
- 集成方式:提供 ONNX 或 TorchScript 导出后,可部署在云 GPU 服务(如 AWS、NVIDIA Triton)或移动端(经精简后)。前处理只需图像张量输入,后处理直接输出可渲染的高斯场,方便接入 ARKit/SceneKit 等平台。
- 协作工作流:可与 NeRF/3DGS 后优化方案结合,用 ZipSplat 作为初始化,再用少量迭代精炼以获得超高保真度。
具体用例
- 在线家具零售 AR 预览:用户上传客厅照片和家具多角度快照,ZipSplat 在 1 秒内生成家具的高斯模型,并实时嵌入用户场景中渲染,实现无需 CAD 模型的即时搭配体验。
- 自动驾驶仿真数据增强:路采车队拍摄街道图像后,ZipSplat 批量生成轻量 3D 场景用于生成新视角和不同光照/天气条件下的合成数据,训练感知模型,显著降低重采成本。
局限
- **k‑means 聚类的超参数敏感性与场景适应性**:推理时的压缩比率(即聚类中心数)需要作为超参数预先固定,而不同场景的最佳高斯预算可能差异极大。论文虽展示了在调整聚类数下模型可沿质量‑效率曲线移动,但并未提供自动选择预算的机制。对于几何结构极简或纹理高度重复的场景,固定的聚类中心可能造成编码冗余或细节丢失,且聚类算法的初始化随机性可能影响最终重建稳定性。
- **几何监督的局限性**:ZipSplat 依赖渲染损失和几何监督(如深度)进行训练,但在无真实姿态的条件下,几何监督的获取依赖于自标定或预训练模型,这可能在无纹理、弱纹理或重复纹理区域产生不准确的深度估计,进而导致高斯位置解码错误。论文在跨数据集泛化实验中虽表现出色,但未系统分析在极端无纹理场景下的退化情况。
- **与像素对齐方法的精细度差距**:虽然 ZipSplat 用更少的高斯取得了更高的 PSNR,但在高频细节保留上可能仍逊于密集的像素对齐方法。论文未给出 LPIPS 等感知指标对比,而 PSNR 对轻微模糊或几何误差不够敏感。在实际工程应用中,减小的模型尺寸可能以牺牲某些区域的视觉保真度为代价,尤其对于远处物体或细长结构,聚类压缩可能诱发断裂或缺失。