论文

Monte Carlo Energy Aggregation for Mobile 3D Gaussian Splatting

Monte Carlo Energy Aggregation for Mobile 3D Gaussian Splatting

近年来,3D Gaussian Splatting 在新视角合成中取得了前所未有的成功。然而,高阶 Spherical Harmonics (SH) 带来的巨大推理和存储开销成为移动平台的主要瓶颈。为此,本文提出 Flux-GS,一种面向资源受限移动平台的实时高斯泼溅方法,能在大幅降低开销的同时实现高保真渲染。 我们首先提出 Monte Carlo Specular Energy Aggregator,通过采样三阶辐射残差并将镜面能量聚合到紧凑的 latent space 中。该方法无需昂贵的蒸馏或预训练,即可有效保留低阶频带中的视觉显著光照特征。为补偿压缩过程中丢失的高频细节,我们引入 Attribute-Conditioned SH Enhancement 模块:基于高斯固有属性预测偏移量,在推理前增强一阶 SH 表示,且不增加额外推理成本。此外,原始单视图梯度驱动密集化易产生过多高斯并过拟合特定视图。我们提出 Multi-view Alpha-based Densification and Pruning 策略,利用多视图指导确保结构一致性并精确移除冗余图元。 大量实验表明,Flux-GS 在显著减少参数量的同时保持具有竞争力的视觉质量,为实时移动渲染提供了鲁棒且可扩展的解决方案。代码已开源。

论文精读

TL;DR Flux-GS 利用蒙特卡洛能量聚合将高光信息压缩至低阶球谐函数,配合属性条件增强补偿细节,在移动端实现大幅降参与高保真实时 3DGS 渲染。

问题

问题背景

3D Gaussian Splatting (3DGS) 在新视角合成任务上达到了前所未有的保真度,但其高计算与存储需求严重依赖高端 GPU,实时推理在移动平台几乎不可行。业界亟待将 3DGS 压缩至移动端可运行的规模,同时不损耗视觉质量。

现有方法局限

3DGS 使用球谐函数(SH)编码视角相关的辐射,为保留高频光照细节通常需要三阶 SH,每个高斯原语因此携带 48 个系数,占总参数量的绝大部分。直接降低 SH 阶数会导致镜面高光、反射等视觉显著特征丢失。现有压缩方案如 Mobile-GS 尝试在低阶 SH 基础上恢复细节,但依赖昂贵教师模型蒸馏或大规模预训练,部署流程复杂且移动端不友好。此外,原始 3DGS 采用单视图梯度驱动致密化,缺乏多视图一致性监督,容易对训练视角过拟合,产生大量冗余高斯体,进一步加剧移动端内存和计算开销。

难点与重要性

移动平台资源极度受限(显存、带宽、算力),同时要求实时渲染(>30 FPS)与高保真输出。在低阶 SH 约束下保留高光等高频特征,本质上是一个信息瓶颈问题,需在极低参数预算下重建镜面能量分布。同时,致密化与剪枝必须兼顾多视图覆盖与去冗余,避免欠拟合或过拟合,这对优化策略设计提出极高挑战。该问题直接关系到 AR/VR、移动端 3D 数字孪生、实时体积视频等应用能否实现商业化落地,是整个神经渲染社区关注的热点。

行业类比

这类似于在手机端部署大语言模型时,通过量化或蒸馏将模型缩小数十倍,同时必须保留核心推理能力,避免关键语义在压缩中丢失。

核心洞察

  • 通过蒙特卡洛采样高次球谐残差并将镜面反射能量聚合到低阶潜在空间,Flux-GS 无需蒸馏或预训练即可在紧凑表示中保留视觉显著的高光细节。这与 Mobile-GS 等依靠显式 SH 系数截断或低秩近似的方案根本不同:后者简单丢弃高阶分量,导致高光信息丢失;而 Flux-GS 的能量聚合策略直接从原始三阶渲染残差中提取并压缩高频光照,使得一阶 SH 仍能输出接近三阶的反射效果,在移动端实现了参数效率与渲染质量的更好权衡。
  • 属性条件 SH 增强模块利用高斯内在属性(如位置、颜色、透明度)预测逐高斯的偏移量,在推理前动态修正一阶 SH 系数,从而恢复因压缩损失的高频细节。与常见的固定增强或后处理上采样不同,该模块无需额外推理成本,且偏移量预测与具体的 3D 高斯特征紧密绑定,使增强更具场景自适应性。这突破了先前工作中‘低阶 SH + 静态补偿’的固定范式,为轻量级散射场表示提供了一种新的动态质量提升路径。
  • 多视图 Alpha 引导的稠密化与修剪策略以多视角一致性指导高斯生长和剔除,相比原始 3DGS 纯梯度的单视图稠密化,显著减少了过度密化和视图过拟合。该方法利用多视图观测下的高斯贡献一致性筛选冗余基元,使场景几何结构在多视角下更加稳定,同时降低高斯总数和内存占用,对实时移动渲染的稳定性和资源效率有直接工程价值。

方法

输入与初始化

Flux-GS 以多视角图像及相机位姿为输入,通过运动恢复结构 (SfM) 获得稀疏点云,并将其转化为初始 3D 高斯表征。与传统 3DGS 相同,每个高斯体携带位置、协方差、透明度及球谐 (SH) 系数等属性。

核心模块一:Monte Carlo Specular Energy Aggregator

为降低移动端推理与存储开销,该模块直接压缩高阶 SH 系数。

  • 采样与聚合:从三阶 SH 辐射残差中随机采样,采用蒙特卡洛方法将镜面反射能量聚合成紧凑的潜向量,替代完整的三阶 SH 系数。
  • 效果:在低阶 SH(例如一阶)中有效保留视觉上突出的光照特征,避免传统蒸馏或预训练带来的额外开销。

核心模块二:Attribute-Conditioned SH Enhancement

压缩操作会丢失部分高频细节,该模块在不增加推理成本的前提下进行补偿。

  • 机制:根据高斯体的内在属性(如位置、不透明度、尺度等)预测高斯感知的偏移量,用于增强一阶 SH 表示。
  • 执行时机:增强过程发生在推理之前,且与渲染管线解耦,因此不引入额外推理开销。

核心模块三:Multi-view Alpha-based Densification and Pruning

原生的单视图梯度稠密化容易导致高斯体数量膨胀,并过拟合至特定视角。本模块引入多视图引导的稠密化与剪枝:

  • 稠密化:依据多视图下高斯体的 alpha 值分布,在需要细节的区域生成新高斯体,确保结构在多视图间一致。
  • 剪枝:同样基于多视图 alpha 信息,精准移除冗余或不可见的高斯体,抑制过拟合。

输出与效果

经过上述模块联合优化,最终得到紧凑的高斯场文件,可直接在移动设备上实时渲染。相比原 3DGS,参数量显著减少,同时保持有竞争力的视觉质量。

与同类方法的差异

不同于 Mobile-GS 等直接删减高阶 SH 或依赖知识蒸馏的方式,Flux-GS 通过蒙特卡洛能量聚合在低阶 SH 中隐式保留镜面信息,配合属性条件增强和多视图 alpha 引导的稠密化,实现了参数效率与渲染质量更优的平衡。

实验

实验设计

实验基于标准新视角合成基准,涵盖室内外复杂场景。为验证Flux-GS的移动端实时渲染能力,核心对比方法包括原始3D Gaussian Splatting (3DGS)Mobile-GS等轻量化方案。评估维度涵盖渲染质量 (PSNR / SSIM / LPIPS)、高斯点数量及移动设备上的帧率。消融实验逐项考察蒙特卡洛镜面能量聚合器属性条件SH增强以及多视图α驱动稠密化与剪枝三个模块的独立贡献。

关键发现

通过将三阶球谐函数残差的镜面能量压缩至紧凑潜在空间,Flux-GS在仅使用一阶SH系数的情况下即保留了视觉上显著的光泽细节。属性条件SH增强进一步补偿了高频损失,且不增加推理开销。多视图α驱动稠密化与剪枝有效抑制了单视图梯度判据导致的过拟合与冗余高斯,使场景结构在多视角间更为一致。整体参数规模相比3DGS大幅缩减,同时保持有竞争力的视觉质量,在移动平台达成实时帧率。

与基线深度对比

相比3DGS为每个高斯存储高达三阶的SH系数,Flux-GS以低阶SH和轻量增强模块实现了近似的渲染效果,存储与计算开销显著降低。与Mobile-GS等专门移动端方法相比,Flux-GS没有通过蒸馏或预训练来压缩表示,而是从能量聚合的角度重新分配镜面细节,简化了训练管线,且在纹理丰富区域避免了过度平滑。多视图α剪枝比传统基于梯度的单视图剪枝更准确地剔除非必要高斯,提升了移动端渲染的紧凑性与效率。

行业影响

落地场景

Flux-GS 将高保真 3D 高斯泼溅实时渲染压缩至移动端,直接赋能 AR/VR 应用移动端数字孪生3D 内容社交平台。典型场景包括:电商 App 内的 虚拟试穿 / 虚拟家具摆放,用户通过手机摄像头实时交互高精模型;在线教育或医疗培训 App 中的 可交互 3D 解剖 / 机械模型;以及短视频平台中的 沉浸式 3D 特效与虚拟背景。所有依赖移动端本地推理、且对画质与延迟敏感的视觉应用均可受益。

商业价值

核心降本路径是 存储与推理开销的骤降:高阶球谐函数被压缩至低阶隐空间,参数体积大幅减小,使模型可直接分发到设备端,无需云端流式传输,节省带宽与服务器成本。同时,毫秒级渲染 保障流畅交互,显著提升用户体验与留存率。对于电商而言,更逼真的 AR 试穿能提高转化率;对于内容平台,低门槛的 3D 特效创作可拉动 UGC 生态,形成新的流量变现模式。

与现有产品 / 工作流的接口

Flux-GS 可作为 移动端 3D 渲染引擎的插件 或无服务器部署的优化模块,兼容现有图形栈:

  • 离线优化管线:将 NeRF / 3DGS 重建场景输入 Flux-GS 压缩,输出轻量 .ply 及纹理包,可直接由 Metal / Vulkan 驱动的渲染器加载。
  • 集成方式:通过 Unity / Unreal 引擎插件、ARKit / ARCore 扩展,或嵌入 Web3D 框架 (如 Three.js 基于 WebGPU) 的 loader。
  • 工作流示例:3D 资产平台在资产上传后自动触发 Flux-GS 压缩,生成适配低端设备的 LOD 版本,开发者通过 API 拉取并直接渲染。

具体落地 use case

  1. 电商 AR 试穿:用户在一时尚 App 上浏览鞋子,点击“试穿”后,手机摄像头对准脚部,Flux-GS 渲染的高保真 3D 鞋模实时贴合,光影与脚部一致,无云传输延迟,体验与本地模型无异。
  2. 沉浸式 3D 直播:某内容平台主播使用虚拟背景,背景为动态 3D 场景 (如深海、太空),由 Flux-GS 在观众手机端实时渲染,保证帧率的同时,节省主播侧推流端的高算力开销。

局限

  • **蒙特卡洛能量聚合的保真度上限**:MCSEA 通过采样第三阶球谐残差并聚合到紧凑潜在空间,本质上是对镜面高频信息的低秩近似,在强各向异性反射或复杂材质场景中可能无法完整复现高光细节。论文虽引入增强模块补救,但增强依赖一阶 SH 与高斯属性,对超越一阶能力的高频成分补偿有限,在极端光照下存在渲染偏差。
  • **多视图稠密化对覆盖密度敏感**:Multi-view Alpha-based Densification and Pruning 依赖多视角监督来避免过拟合、保证结构一致,这要求训练时具备足够密集的输入视角,且视角分布需均匀。如果输入视角稀疏或存在大角度缺失区域,基于多视图 alpha 的剪枝可能错误地移除有效高斯原语,反而损害重建质量,限制了在少量输入图像场景下的适用性。
  • **移动端部署的通用性与实时性权衡**:虽然 Flux-GS 大幅降低了参数数量和推理开销,但论文实验主要基于特定硬件平台(如文中所述移动设备),其运行帧率与功耗数据未充分体现与不同移动芯片架构的适配性。此外,增强模块虽然推理零成本,但其预测仍需在训练中引入额外网络,训练复杂度略增,对需要在设备上在线优化的场景不够友好。
论文Xiaobiao Du2026-06-29原文

相关内容