论文

AsySplat: 高效非对称三维高斯溅射用于长序列场景建模

AsySplat: 高效非对称三维高斯溅射用于长序列场景建模

最近的可泛化三维高斯溅射模型在长序列新视角合成(NVS)上取得了进展,但代价是大量冗余计算。我们基于两个观察发现可以缓解冗余:(i) 高质量NVS并不严格需要高精度几何;(ii) 外观学习通常比几何恢复更容易。受此启发,我们提出一种非对称架构,将几何与外观建模解耦。 几何分支处理粗粒度令牌,使用大部分参数进行多视图重建;外观分支则在细粒度令牌上操作,用显著更少的参数捕捉细节。两个分支通过双向连接交互,实现各自任务的相互指导。这种任务感知的非对称性减少了计算冗余,更明智地分配计算,从而提高了参数效率,使更小的模型也能实现强劲性能。 在32视图960P输入上,我们的模型匹配基于优化的方法,同时实现近800倍加速,并以显著更少的参数和更低的训练/推理开销超越最先进可泛化模型的零样本性能,实现了整体效率提升。

论文精读

TL;DR AsySplat 通过非对称解耦几何(粗粒度大参数)和外观(细粒度小参数)分支,大幅降低长序列 3DGS 的冗余计算,以更小模型实现与优化方法媲美的性能与近 800 倍加速。

问题

问题背景 通用 3D Gaussian Splatting (3DGS) 在长序列新视角合成 (NVS) 中取得显著进展,但面向高分辨率、长序列输入时计算效率成为主要瓶颈。

现有方法局限 目前的可泛化模型(如 LongLRM )多采用对称架构,堆叠 Transformer 层同时估计几何与外观,导致大量冗余计算。具体而言,几何分支消耗了与外观分支相当的参数,然而实验观察表明:(i) 高质量 NVS 并不严格依赖高精度几何;(ii) 外观学习通常比几何恢复更容易。对称设计未利用此差异,造成参数效率低下,推理开销大。

技术挑战与重要性 长序列多视图输入带来高昂的 GPU 内存与计算成本,限制模型在实际部署中的实时性。解耦几何与外观并实施不对称计算分配,是提升效率的合理方向,但需确保两分支解耦后仍能有效协同以保持渲染质量。此问题直接影响 AR/VR、自由视点视频等应用的落地,业界迫切追求更高效的场景重建方案。

类比启示 正如大规模语言模型为不同子任务引入混合专家(MoE)实现计算的不对称分配,3D 场景建模中也可通过差异化对待几何与外观任务,大幅提升端到端效率。

核心洞察

  • NVS 中几何与外观学习的难度和需求存在本质差异:几何恢复虽计算密集但并非高质量渲染的必要条件,而外观细节直接决定视觉质量且更易学习。AsySplat 据此将几何建模赋予粗粒度 token 和大量参数,外观分支则以细粒度 token 和极少参数运行。这颠覆了以往模型(如 LongLRM)对几何和外观任务平均分配计算资源的做法,从任务特性出发实现参数效率的质变。 该非对称设计使得模型能用更少参数达到甚至超越现有方法的零样本性能,且训练和推理开销大幅降低,为实际部署提供新的架构范式。
  • 通过将输入 token 分为粗粒度(用于几何)和细粒度(用于外观)两组,并引入双边连接模块让两个分支相互指导,AsySplat 打破了现有可泛化 3DGS 模型对所有 token 等精度处理的计算瓶颈。几何分支依赖粗 token 完成多视图重建,外观分支则利用细 token 捕获高频纹理,两侧通过注意力交互共享结构信息和纹理上下文。 这种设计比直接降低整体分辨率或使用 token 压缩技术更精细地保留了场景细节,同时避免了大量冗余注意力计算,在长序列高分辨率场景下实现近 800 倍加速而不牺牲画质。

方法

输入与整体流程

AsySplat 接收长序列多视图输入(如 32 张 960P 图像),通过可泛化的前馈网络直接预测 3D 高斯场,实现零样本新视图合成。模型遵循 3D Gaussian Splatting (3DGS) 范式,但摒弃逐场景优化,改为数据驱动的一次推理。

不对称双分支架构

核心创新在于任务感知的非对称设计,将几何与外观建模解耦为两个独立分支:

  • 几何分支:占据大部分参数量,但工作在粗粒度 token(空间分辨率较低的特征)上,负责多视图几何重建,预测高斯的位置、协方差、不透明度等。其高容量保证了深度估计和空间结构的准确性。
  • 外观分支:仅用极少的参数,直接操作细粒度 token(高分辨率特征),专注于捕捉颜色、球谐系数等纹理细节。因为外观学习通常比几何恢复更容易,轻量设计足以满足需求。

双边连接与模块细节

两个分支并非孤立运行,而是通过双向交叉连接相互引导:几何分支提供全局场景结构作为外观分支的上下文,外观分支反馈细节信息以精炼几何特征。此外,模型引入稀疏注意力模块(Sparse Attention Module)处理长序列中的远距离依赖,只在关键 token 间计算注意力,显著降低复杂度。训练时采用端到端监督,损失函数结合渲染图像与真值的 L1 损失及 LPIPS 感知损失。

输出与推理

网络最终输出一组 3D 高斯原语,随后可通过标准 splatting 光栅化器渲染任意新视角。整个推理过程无需场景优化,在 32 视角 960P 条件下达到与优化方法相当的质量,同时获得近 800 倍加速

与同类方法的差异点:传统可泛化 GS 模型常采用统一架构同时处理几何与外观,导致计算冗余;AsySplat 通过任务难度决定 token 粒度和参数分配,将算力精准投向困难环节,实现了显著的参数效率和推理开销降低。

实验

实验设计

  • 输入:32 视角 960P 长序列图像,模拟真实高分辨率拍摄场景
  • 对比方法:覆盖两大类基线——需要逐场景优化的传统 3DGS 方法,以及当前最先进的可泛化高斯重建模型(如 LongLRM 等)
  • 评估维度:渲染质量(PSNRSSIMLPIPS)与效率(单帧推理速度、总参数量、训练计算开销)

关键发现

  • 非对称解耦 大幅减少冗余计算:几何分支处理粗粒度 token 并承载大部分参数,外观分支利用细粒度 token 但仅保留极少参数,二者通过双边连接协同工作
  • 质量-效率的帕累托提升:在 960P 长序列输入下,AsySplat 的零样本渲染质量匹配优化类方法,同时实现近 800 倍 加速;与同等零样本泛化方法相比,以明显更少的参数获得超越性能
  • 任务感知非对称设计的有效性:印证了“几何恢复难而外观学习易”的直觉,将计算重点投入几何、外观轻量化,非但无损最终画质,反而提升整体参数效率

与基线对比的深度解读

LongLRM 等堆叠式深度模型不同,AsySplat 不再对几何和外观施加同等的建模力度,而是根据任务难度差异化分配计算资源。这带来了以下关键差异:

  • 几何分支 采用稀疏注意力高效捕获多视角对应,避免为外观细节支付额外计算代价
  • 外观分支 以极轻量的结构在精细 token 上补足纹理,通过来自几何分支的指导信号保证一致性
  • 从工程角度看,该设计直接降低了推理延迟与部署成本,使得高分辨率长序列场景的实时新视角合成成为可能,同时无需牺牲合成质量

AsySplat 的成功表明,对通用 3D 重建 pipeline 进行任务级非对称切割 是提升效率的有效路径,为后续面向真实应用的快速 3D 内容生成提供了新思路。

行业影响

落地场景

该方法适用于从长序列、高分辨率图像中实时生成新视角的工业应用:

  • 电商3D商品展示:利用商品多视角拍摄视频,快速生成可交互3D模型,提升用户决策体验。
  • 内容平台自由视角视频:从多机位长视频中实时插值生成任意视角,增强沉浸式观看。
  • 自动驾驶场景重建:基于车载多摄像头的长序列数据,高效构建大规模场景的3D高斯表示,用于仿真和数据增强。

商业价值

  • 大幅降低计算成本:通过非对称解耦几何与外观建模,推理时显著减少冗余计算,仅需更少参数即可达到优化方法的质量,800倍加速使得在消费级GPU上即可部署,降低云服务开支。
  • 提升用户体验与转化:实时生成的3D内容可无缝嵌入网页或移动端,零加载等待,有望提升商品页停留时长和转化率。
  • 工作流加速:与传统的逐场景优化方法(如原始3DGS)相比,免去耗时优化步骤,使产品迭代周期从小时级缩短至秒级。

与现有产品/工作流的接口

  • 即插即用的推理模块:模型以多视图图像为输入,直接输出3D高斯集合,可通过标准的.ply文件格式与主流渲染器(如Nerfstudiogsplat)或游戏引擎(Unity, Unreal Engine)集成,无需修改下游管线。
  • 轻量化部署:参数量远小于同类泛化模型(如LongLRM),适合嵌入到边缘设备或移动应用中,扩展性极强。

典型用例

  1. 电商平台:用户仅需上传一段环绕拍摄的视频,后台调用AsySplat在数秒内生成商品3D模型,前端通过WebGL实时渲染,客户可自由旋转缩放查看细节。
  2. 自动驾驶仿真:利用车队采集的路口长序列图像,快速重建带精确几何的道路场景,用于感知算法的闭环仿真测试,比传统基于NeRF的重建快数百倍。

局限

  • **任务解耦假设的边界**:AsySplat 基于“高精度几何并非严格必需”和“外观学习比几何恢复更容易”的观察,将几何分支设计为粗粒度 Token、重参数,外观分支为细粒度 Token、轻参数。但在需要精确几何的下游任务(如 AR/VR 空间锚定、物理仿真)中,几何分支输出的精度可能成为瓶颈,即便有双边连接,外观细节也可能因几何误差而失真。这种设计在几何要求高的场景中尚未验证,可能限制应用范围。
  • **长序列与稀疏视图的泛化折衷**:模型专为长序列(如 32 视图)高分辨率输入优化,当视图数急剧减少(如 3–5 视图)时,几何分支接收的粗粒度 Token 可能因信息不足而重建质量下降,而现有稀疏视图通用方法(如 pixelSplat、MVSplat)通过更精细的特征交互来解决该问题。这种不对称结构对输入视图数量的敏感性可能导致在更通用的 NVS 设置下性能不达预期。
  • **动态场景与跨域迁移未探索**:实验主要在静态室内/室外数据集(如 RealEstate10K、ACID)上进行,未涉及动态元素或剧烈光照变化。解耦几何和外观的策略依赖静态假设,当场景包含运动物体或非朗伯表面时,外观和几何的耦合关系被破坏,可能需要重新设计交互机制或增加时序建模,当前方法对这些复杂场景的适应性尚不明确。
论文Yingji Zhong2026-07-13原文

相关内容