论文

TideGS: 通过外存优化可扩展训练超过十亿个 3D Gaussian Splatting 基元

TideGS: 通过外存优化可扩展训练超过十亿个 3D Gaussian Splatting 基元

训练十亿基元级别的 3D Gaussian Splatting (3DGS) 本质上是内存受限的:每个高斯基元携带一个较大的属性向量,聚合的参数表很快超出 GPU 容量,导致先前的系统在消费级单 GPU 硬件上只能支持数千万个高斯基元。 我们观察到,3DGS 训练是稀疏且轨迹依赖的:每次迭代仅激活当前相机批次可见的高斯基元,因此 GPU 内存可作为工作集缓存而非持久参数存储。基于此洞察,我们提出 TideGS,一个外存训练框架,通过三种协同技术管理 SSD-CPU-GPU 层次结构中的参数: - 块虚拟化几何,实现 SSD 对齐的空间局部性; - 层次化异步流水线,将 I/O 与计算重叠; - 轨迹自适应差异流,仅传输迭代间增量工作集变化。 实验表明,TideGS 可在单块 24 GB GPU 上训练超过十亿个高斯基元,在大规模场景中,其重建质量在评估的单 GPU 基线中达到最优,超越了之前的外存基线(约 1 亿高斯基元)和标准内存训练(约 1100 万高斯基元)。

论文精读

TL;DR TideGS 通过块虚拟化、分层异步流水线与轨迹自适应差分流,将 3DGS 训练规模推至十亿级高斯原语,在单张 24GB GPU 上实现高质大场景重建,突破内存墙限制。

问题

3D Gaussian Splatting (3DGS) 已在实时新视角合成上取得显著成果,但当场景规模扩展至 城市级重建高精细物体 时,所需高斯原语数量往往达到 十亿级别。标准 3DGS 训练将全部参数常驻 GPU 显存,单个 24 GB 显卡仅能容纳约 1100 万 个高斯,远不能满足需求。

现有 out-of-core 方案(如基于块的部分加载)未能有效利用训练过程的两个关键特性:

  • 稀疏激活:每轮迭代仅有当前相机批次可见的高斯参与计算;
  • 轨迹条件:可见集随相机移动逐步演化,而非随机跳变。 这使得现有方法扩展上限通常不超过 1 亿 高斯,且因随机小粒度 I/O 造成严重的 SSD 带宽浪费,训练效率急剧下降。

该问题的核心难点在于 参数规模与硬件带宽的矛盾:十亿高斯的总参数量超过 200 GB,而 GPU 显存通常仅几十 GB,SSD 顺序读带宽也远低于片内带宽。若不能将 I/O 与计算深度融合,训练过程将 受限于存储端延迟。此外,必须精准预测工作集的时间变化,实现 增量式数据补给,才能避免无用传输。业界对此高度关注,因为自动驾驶仿真、AR/VR 城市场景、数字孪生等应用均依赖十亿级原语的高保真重建。

类比 大语言模型训练 中的参数卸载(如 ZeRO-Infinity),TideGS 所面对的是 视角驱动 的动态稀疏模式,更像 视频流边缘缓存系统:仅推送当前帧与下一帧的增量差异,从而大幅降低带宽需求。

核心洞察

  • 3D Gaussian Splatting 训练过程具有天然的稀疏性和轨迹条件性——每次迭代仅需当前相机视角可见的高斯原语,这使 GPU 内存可被定义为工作集缓存而非持久参数存储。该视角将大规模训练从“如何装入更多参数”转化为“如何高效管理缓存缺失与预取”,从根本上突破单 GPU 数十亿原语训练的阻塞点,与以往完全依赖内存驻留或简单分块的方法截然不同。
  • TideGS 通过块虚拟化几何、层次异步流水线和轨迹自适应差分流式三种技术协同,在 SSD-CPU-GPU 层次上实现了近乎透明的外存训练。块虚拟化确保了 SSD 对齐的空间局部性,异步流水线隐藏了 I/O 延迟,差分流式则仅传输相邻迭代间工作集的增量。三者共同解决了 naive 外存方案中随机访问和冗余传输问题,使得单张 24 GB GPU 可训练超过 10 亿高斯原语,重建质量超越以往所有单 GPU 基线。

方法

方法概览:SSD–CPU–GPU 层次化的十亿级 3DGS 训练

输入:多视角 RGB 图像与对应的相机位姿,目标是从中优化出超过十亿个 3D 高斯球(primitives)。传统 3DGS 将所有高斯参数常驻 GPU 显存,显存容量构成瓶颈(单卡 24 GB 下最多约 1100 万高斯)。

核心思想:TideGS 将 GPU 显存视为工作集缓存,参数主存位于 SSD,通过 CPU 内存进行中转。训练仅需加载当前相机批次可见的高斯子集,而非全体参数。

关键模块

  1. 块虚拟化几何(Block-Virtualized Geometry)
    将场景空间划分为与 SSD 块对齐的几何块(block),每个块封装一批高斯属性。这种布局最大化顺序 I/O 带宽,减少随机访问开销。

  2. 层次化异步流水线(Hierarchical Asynchronous Pipeline)
    GPU 在执行当前工作集的前向/反向传播时,CPU 已开始从 SSD 预取下一迭代所需的数据块(通过专用 I/O 线程),并将梯度更新异步写回 SSD,实现计算与 I/O 的完全重叠

  3. 轨迹自适应差分流(Trajectory-Adaptive Differential Streaming)
    根据训练相机路径预测可见性变化,仅在迭代间传输工作集增量——新增可见的块与离开视锥的块,避免重传整个工作集,大幅减少 CPU→GPU 通信量。

训练循环:每个迭代中,根据相机批次确定需要加载的几何块,执行光度损失反向传播,梯度本地累积并更新缓存中的参数,随后依赖差分流更新缓存内容。

输出:训练完成的十亿级高斯场,可实时渲染高保真新视角。

与同类方法的本质差异:先前外存方案(如约 1 亿高斯上限)缺少对细粒度块对齐、I/O–计算解耦与工作集增量流的三维协同,TideGS 首次证明在单卡 24 GB GPU 上训练超十亿 3DGS 的可行性,而无需牺牲重建质量。

实验

实验设置

TideGS 在 大规模场景数据集 上进行评估,对比基线包括:

  • 标准内存训练:Vanilla 3DGS,受限于 GPU 显存,约可容纳 11M 高斯。
  • 外存基线:现有 out-of-core 方法,可扩展至约 100M 高斯。 训练使用 单张 24GB 显存 GPU,并通过 SSD-CPU-GPU 层次管理参数。

关键发现

  • 规模突破:TideGS 成功训练超过 10 亿个 3D 高斯原语,远超此前外存方法的约 1 亿上限。
  • 质量优势:在所有评估的单 GPU 基线中取得 最佳重建质量,表明外存策略未损害精度。
  • 效率来源:块虚拟化几何保证 SSD 访问的空间局部性,分层异步流水线 有效隐藏 I/O 延迟,轨迹自适应差分流 仅传输迭代间的工作集增量,大幅减少数据传输量。

与基线对比解读

标准内存训练因显存放不下超大规模场景参数而受限;现有外存方案虽然缓解了容量问题,但其 I/O 管理粗糙,难以高效利用带宽,且未能充分利用视图依赖的稀疏性。TideGS 的核心洞察是将 GPU 显存视为 工作集缓存 而非全量参数存储,每次迭代只加载当前相机批次可见的高斯。这种设计使 I/O 量随可见集大小而非场景总容量变化,因而可线性扩展至十亿级。同时,差分流 避免了全量更新的开销,进一步降低 SSD 压力。这一思路对其他 GPU 内存受限的大规模训练任务(如 NeRF 类模型)同样具有启发意义。

行业影响

落地场景

TideGS 将 3D Gaussian Splatting (3DGS) 的训练规模推至十亿量级,且只需单张 24 GB 消费级 GPU。这使得超大规模场景的高保真重建不再是高端集群的专属,可直接落地的场景包括:

  • 数字孪生与城市级测绘:完整城市街区、大型工业园区的实时可视化,支持自动驾驶仿真、智慧城市管理。
  • 影视与游戏资产生成:从海量无人机或扫描数据中一键生成电影级 3D 场景,大幅减少手工建模工作量。
  • 电商与沉浸式展示:为大型商场、博物馆、房产平台生成全场景自由漫游,提升用户交互体验。

商业价值

核心价值在于成本结构与可扩展性的双重突破

  • 降本:传统方法处理超过一亿个高斯原语需要多卡甚至集群,硬件成本高昂。TideGS 在消费级硬件上即可完成训练,将硬件投入降低一个数量级。
  • 增效:十亿级高斯原语意味着可以覆盖更大场景、保留更精细细节,重建质量(PSNR/SSIM)显著优于现有单卡方案,直接减少人工修复成本,加快项目交付。
  • 体验升级:在 AR/VR、Web 端实时渲染中,更高密度的原语提供更逼真的视觉沉浸感,可转化为更高的用户留存与转化率。

与现有工作流的集成

TideGS 的设计本身考虑了工程易用性:

  • 接口层面:接受标准的 COLMAP 稀疏点云和相机位姿作为输入,与现有 3DGS 训练流程无缝衔接。只需替换训练脚本,即可将现有 3DGS 管线升级为支持超大规模场景的版本。
  • 存储与 I/O:通过 SSD-CPU-GPU 层次化参数管理,参数持久化在 SSD 上,单次 GPU 内存仅保留工作集。这直接适配现有的云存储和本地 SSD 缓存方案,无需定制存储系统。
  • 增量更新:其 轨迹自适应差分流式传输 机制天然支持场景的增量更新或局部精细化,可集成到持续重建或众源建图的后端流程中。

具体落地案例

  1. 大型电商平台的 3D 店铺漫游:为占地面积数千平米的线下门店生成全店 3D 模型,支持顾客在 app 内自由走动查看商品。TideGS 能在单台工作站上一次性处理整个楼层的数据,无需将场景分割、拼接,避免了拼接缝和光照不一致问题,最终输出连贯、高精度的漫游体验。
  2. 自动驾驶仿真中的城市级场景重建:使用路采数据重建数十平方公里的城市区域,包含建筑、路牌、植被等精细结构。以往这类任务需要分布式训练,现在可在移动采集车的车载工控机上完成,降低数据回传和计算中心依赖,加速仿真场景迭代。

局限

  • **依赖训练视图的空间连续性**:TideGS 的核心假设是每次迭代仅激活当前相机批次可见的高斯原语,并通过轨迹自适应差分流传输增量。当训练视角变化剧烈(如随机采样、跳跃式路径或不连续区域重建)时,工作集缓存命中率可能显著下降,导致大量 SSD 随机读取,异步管线难以完全隐藏 I/O 延迟,训练吞吐量退化。对于非轨迹驱动的自由视角重建或一次性全局优化场景,这一设计可能不适用。
  • **对 SSD 性能依赖强且缺乏细粒度分析**:层次化 SSD-CPU-GPU 存储架构将参数持久化在 SSD 上,尽管异步管线旨在重叠 I/O 与计算,但参数规模达十亿量级时,SSD 带宽与延迟仍是潜在瓶颈。论文未深入探讨不同 SSD 设备(如 SATA、NVMe、PCIe 4.0+ 及 RAID 阵列)对训练速度的影响,也未提供 I/O 吞吐量的 profiling 数据。实际部署中,存储硬件的选择会显著制约可扩展性,而该方法的硬件普适性未得到充分验证。
  • **与分布式多 GPU 训练的对比缺失**:TideGS 聚焦于单 GPU out-of-core 扩展,仅与同机 in-memory 方法和之前的 out-of-core baseline(如可支持约 1 亿高斯)比较。缺乏与多 GPU 分布式 3DGS 训练(如参数分片到多个 GPU 内存)的直接对比。虽单卡成本更低,但多卡方案可能通过聚合带宽实现更高训练吞吐,TideGS 在性价比上的优势缺少量化证据,难以指导工程选型。
论文Chonghao Zhong2026-05-19原文

相关内容