论文

FLAT: 前馈潜在三角泼溅用于几何精确的场景生成

FLAT: 前馈潜在三角泼溅用于几何精确的场景生成

从单张图像生成可探索的3D场景需要强大的生成先验和准确的几何表示。当前视频扩散模型在潜在空间中隐式编码多视图几何结构,但现有的前馈潜在场景解码器通常输出体积3D高斯,其缺乏明确表面,限制了在仿真或标准图形管线中的应用。为此,本文提出FLAT,首次将三角泼溅直接从视频扩散潜在变量解码。 相比解码3D高斯,预测平面原语对原语方向高度敏感,易导致梯度流不畅。FLAT通过两个关键组件解决:一种射线中心旋转参数化用于三角回归,以及一种新颖的乘积窗口函数改善可微三角渲染中的梯度流。在标准基准上,FLAT在保持竞争视觉质量的同时,实现了显著更好的几何精度。 进一步,轻量级测试时精化步骤可将预测的三角网格转换为完全不透明、支持实时渲染的游戏引擎就绪表示。通过对3DGS、2DGS和三角泼溅变体在相同训练设置下的评估,本文提供了前馈场景生成中表示权衡的首次系统分析。

论文精读

TL;DR FLAT 首次从视频扩散模型潜变量直接解码为表面三角面片,通过光线中心旋转参数化与乘积窗函数解决梯度难题,显著提升几何精度并支持实时渲染。

问题

问题背景

单图像到可探索 3D 场景的生成,核心难题在于如何同时获得强生成先验精确的几何表示。当前前沿方案多采用视频扩散模型,其隐空间编码了丰富的多视角一致性信息,但如何高效地将这些隐变量解码为下游可直接使用的几何资产,仍是开放挑战。

现有方法局限

主流的前馈隐式场景解码器(如基于 3D Gaussian Splatting 的解码器)输出的是体积化高斯原语——这些原语本质为半透明椭球,缺乏明确定义的表面边界,无法直接转换为标准网格(mesh),难以用于物理仿真或游戏引擎等标准图形管线。即便采用 2D Gaussian Splatting 试图增强表面特性,扁平原语的梯度优化仍高度不稳定。其根本原因在于:扁平原语对方向极度敏感,常规旋转参数化(如四元数)在可微渲染中极易产生梯度流断裂,导致训练无法收敛或几何质量严重退化。

技术挑战与重要性

直接从视频扩散隐空间预测三角形表面原语(triangle splats)面临双重挑战:

  • 几何敏感度:三角形需精确的顶点位置与法线方向,微小的旋转误差即会引发大面积的自遮挡或渲染空洞。
  • 梯度平滑性:可微三角形渲染的梯度在边界处不连续,传统参数化方式使优化过程极易陷入局部极小。 FLAT 通过两项关键创新——射线中心旋转参数化(ray-centered rotation parameterization)与乘积窗口函数(product window function)——首次成功实现了从前馈隐空间直接解码三角形原语,并使得训练稳定、几何精度大幅提升。这一突破意义重大:生成的三角形“汤”经过轻量后处理即可转换为全不透明、游戏引擎就绪的网格,省略了传统重建中的繁重优化步骤,显著缩短从生成到实时渲染的管线。

行业类比

类似于从扩散模型直接生成矢量图形(SVG)而非位图,FLAT 让隐空间直接输出具备显式拓扑信息的几何原语,使生成结果天然具有可编辑、可伸缩的 3D 资产属性,而非一堆仅供绘制的渲染粒子。

核心洞察

  • 视频扩散模型的可解释性不仅体现在生成质量,其隐式编码的多视图几何结构能通过单次前馈直接解码为显式表面元素,这打破了之前“扩散模型→体积表示→后处理重建表面”的惯常流程。 FLAT首次从压缩视频扩散latent中直接预测三角形splats,避免了体积高斯模糊表面带来下游仿真和标准图形管线集成困难的问题,证明扩散模型能够直接产生游戏引擎即用的资产,大幅缩短了从生成到可用的路径。
  • 对扁平图元(如三角形splats)的前馈回归极具挑战性,因为其方向预测的微小误差就会导致严重渲染失真和梯度消失。 FLAT通过两个针对性设计克服了这一瓶颈:**光线中心旋转参数化** (ray-centered rotation parameterization) 将方向回归与相机观测自洽对齐,而**乘积窗口函数** (product window function) 在可微渲染中提供了平稳健的梯度流。这一组合不是通用技巧,而是针对三角形图元特性的专门化求解,揭示了前馈场景生成中几何表示与优化策略需要协同设计,为后续探索更复杂表面表示提供了方法论参考。

方法

从潜空间到显式表面原语的前馈解码流程

输入:单张 RGB 图像,经由预训练的视频扩散模型压缩为多视图共享的潜表示(latent code)。

核心解码模块:FLAT 设计了一个前馈场景解码器(feedforward scene decoder),直接预测一组显式的三角形 splat(triangle soup)。与解码为体积化的 3D Gaussians 不同,三角形原语需要更精确的朝向估计,否则梯度流极易崩溃。为此引入两个关键创新:

  • 射线中心旋转参数化(ray-centered rotation parameterization):以视线方向为参考系回归三角形的局部旋转,避免直接预测全局旋转变量的不稳定,缓解朝向敏感导致的梯度异常。
  • 乘积窗口函数(product window function):用于可微三角形渲染,将传统三角形渲染中的二值覆盖函数替换为平滑可导的窗口形式,改善梯度传播,使三角形顶点的优化更可靠。

解码器架构采用 Transformer 或卷积‑注意力混合设计,并注入相机参数(内参、外参)作为条件,使同一潜码可支撑不同视角的几何预测。训练时使用多视图渲染损失(如 L1/LPIPS)与深度、法向等几何监督,结合可微渲染器在端到端框架下优化。

输出与后处理:前馈预测的三角形集合本身已具备可渲染的表面,但可能仍含少量半透明或不连续区域。一个轻量的测试时优化(test-time refinement)步骤将其转换为完全不透明的、游戏引擎就绪的 mesh,支持实时渲染与碰撞检测等下游任务。

与同类方法的差异点:不同于先前前馈方案仅能输出模糊体积高斯,FLAT 首次从视频扩散潜空间直接解码出显式三角形原语,在保持视觉质量的同时显著提升几何精度,并给出了三种表示(3DGS、2DGS、triangle splatting)在相同训练配置下的系统对比。

实验

实验设计

论文在统一训练框架下,对比了 3DGS2DGSTriangle Splatting 变体在单图前馈场景生成中的表现。评估维度覆盖渲染质量(PSNR, SSIM, LPIPS)与几何精度(Chamfer Distance, F-score),并检验了轻量级测试时细化将三角形面片转化为不透明网格的能力。消融实验专门分析了射线中心旋转参数化与乘积窗口函数对梯度传递的作用。所有模型均基于相同的视频扩散潜在表征与解码器架构,以保证公平性。

关键发现

FLAT 首次实现从视频扩散潜在空间中直接解码出显式表面原语——Triangle Splats。与传统 3D Gaussian Splatting 产生体积云、缺乏良好表面的缺陷相比,FLAT 输出的三角形面片具有明确定义的表面,几何精度显著提升。乘积窗口函数缓解了平面原语渲染时因朝向敏感导致的梯度断裂问题,使得训练稳定,在保持 PSNR 等视觉指标具有竞争力的同时,Chamfer Distance 等几何指标明显优于前馈基线。测试时,简单的 α 遮罩膨胀即可将三角形 soup 快速转换为游戏引擎可用的渲染资源,且不影响实时性。

基线对比解读

现有前馈潜解码器(如基于 3DGS 的方法)虽生成质量高,但几何本质是模糊的体积表示,无法直接用于物理仿真或标准图形管线。FLAT 证明显式表面表示同样可以从压缩视频潜在空间中一步推断,这颠覆了“复杂几何隐式编码难以前馈解出”的直觉。通过引入射线中心参数化规避了欧拉角/四元数的奇异性,配合乘积窗口函数锐化梯度轮廓,Triangle Splatting 的优化难度被降低至与 Gaussian Splatting 可比的水平。这一分析首次系统阐述了前馈生成场景中表示选择的权衡:体积表示更鲁棒但几何差,表面表示更高精度但需新的参数化策略。为后续工作指明“走向显式几何”的可行路径。

行业影响

落地场景

FLAT 单图直接生成可探索 3D 场景的能力,可快速嵌入多个产品线:

  • 游戏与影视内容生产:将 2D 概念图一键转为带显式几何的游戏引擎资产,加速原型迭代。
  • 电商 3D 商品展示:为 SKU 生成可旋转的 3D 模型,用户从任意角度查看,提升转化率。
  • 自动驾驶仿真:从路采图片批量生成语义准确的 3D 街景,用于感知模型训练与闭环测试。
  • VR/AR 内容生成:为空间计算应用提供即时、几何可信的场景,降低手动建模门槛。

商业价值

显式几何 + 实时渲染带来三重效益:

  1. 降本:省去昂贵的人工建模成本,传统 3D 资产制作从数天缩短至秒级。
  2. 提效:输出的 triangle soup 可直接转换为开放标准(如 glTF/USD),无缝接入现有图形管线,无需后处理。
  3. 增收:在电商、社交媒体、游戏平台引入沉浸式 3D 体验,可显著提升用户停留与购买意愿。

与现有工作流的接口

  • 视频扩散模型 输出潜在表示 → FLAT 解码器 直接预测三角形 splat → 轻量 refine 模块 生成全不透明网格。
  • 兼容标准 可微渲染器(如 nvdiffrast),便于在现有训练框架中集成。
  • 生成的网格可直接导入 Unity/Unreal 等引擎,或通过 gaussian-splatting 生态工具做进一步编辑。

具体 use case

  • 电商平台:用户上传一张产品照片,后台调用 FLAT 生成 3D 模型,前端以 WebGL 实时展示,无需下载 APP。类似 Shopify 的商品 3D 预览功能升级。
  • 自动驾驶数据闭环:在标注平台上,从环视图片生成街景几何,直接用于场景重建与仿真,替代部分激光雷达建图环节,降低数据采集成本。

FLAT 首次证明了从扩散潜在空间直接解码三角面片的可行性,其 ray‑centered 旋转参数化product window 函数 解决了梯度不稳定问题,为前馈式场景生成树立了新范式。

局限

  • **依赖预训练视频扩散模型的质量**:FLAT 的解码器完全建立在视频扩散模型的潜在空间之上,生成场景的真实性和多视图一致性受限于基础模型的能力。对于透明/反射材质、细粒几何或复杂拓扑结构,三角形 splats 可能难精确拟合,导致法线噪声或孔洞。此外,单目前馈生成无法覆盖被遮挡区域,未观测面的几何通常是猜测,影响完整场景的鲁棒性。
  • **三角形基元的方向敏感性依然存在**:虽然射线中心旋转参数化和乘积窗口函数改善了梯度流动,但三角形回归对初始化和对抗性方向扰动的高度敏感性仍是训练瓶颈。早期训练阶段错误的法线容易造成梯度消失,需要额外的损失权重调节和课程学习策略,超参数搜索成本高,部署到全新数据域时可能需要重新调试。
  • **网格转换的后处理与泛化局限**:测试时优化步骤将三角形“汤”转为不透明网格虽然轻量,但引入了非微分的清理流程,可能无法完美解决重叠、悬浮碎片或拓扑错误。该过程对稀疏视角或复杂场景的鲁棒性未充分验证,且生成的网格缺少材质属性,限制了在物理仿真或光照推理等下游任务中的直接应用。
论文Orest Kupyn2026-06-23原文

相关内容