论文

FLUX3D: 高保真 3D Gaussian 生成与扩散对齐稀疏表示

FLUX3D: 高保真 3D Gaussian 生成与扩散对齐稀疏表示

稀疏体素表示已成为图像到 3D Gaussan Splatting (3DGS) 生成的可扩展基础,然而现有方法因两个结构瓶颈而难以保留输入图像的高频视觉细节。 首先,现有方法采用面向语义抽象的判别式 2D 特征来构建稀疏体素潜在变量,这抑制了重建线索,导致表征瓶颈。其次,在生成阶段,标准扩散 Transformer 缺乏有效机制来对齐密集 2D 图像 token 与稀疏 3D 体素潜在变量,造成跨模态对应瓶颈。 为解决这些问题,我们提出 FLUX3D,一种可扩展的图像到 3DGS 框架,在生成过程中同时提升表征学习和跨模态对齐。我们首先重新审视用于稀疏体素 3D 表征学习的 2D 特征选择,提出 扩散对齐结构化潜在变量 (DA-SLAT),并将其与仅解码器架构耦合,以提高 3DGS 重建保真度。我们还设计了一个稀疏结构感知扩散框架,集成了 稀疏结构多模态扩散 Transformer (SMDiT) 和 模态感知旋转位置编码 (MARoPE),以实现几何无关的 2D-3D 对齐。 大量基准实验表明,FLUX3D 在生成高质量 3DGS 资产方面显著提升了外观保真度,并全面超越所有最先进方法。

论文精读

TL;DR FLUX3D 通过扩散对齐稀疏隐变量和稀疏结构感知扩散 Transformer,解决图像到3D高斯生成中的表示与跨模态对齐瓶颈,显著提升生成细节与保真度。

问题

问题背景

图像到 3D 生成 (image-to-3D) 正成为 3D 内容创作的核心范式,通过从单张 RGB 图像重建高质量的 3D 高斯泼溅 (3D Gaussian Splatting, 3DGS) 资产,可大幅降低建模门槛。近期工作普遍采用“稀疏体素表示 + 潜在扩散”框架,将 3D 形状编码为稀疏体素潜变量,再借助扩散生成器从 2D 特征中恢复 3D 结构。

现有方法的两个结构性瓶颈

当前主流方案存在两个相互耦合的技术瓶颈,导致生成结果的高频细节(纹理、边缘)丢失:

  1. 表示瓶颈 (Representation Bottleneck):构建稀疏体素潜变量时,大多直接复用预训练的判别式 2D 特征(如 DINOv2)。这类特征为语义抽象任务(分类/检测)而优化,会抑制对重建至关重要的观感线索(颜色、材质、局部几何),形成信息损失。
  2. 跨模态对齐瓶颈 (Cross-modal Correspondence Bottleneck):在扩散去噪阶段,标准 DiT 架构简单地将稠密 2D 图像 Token 与稀疏 3D 体素 Latent 拼接后送入注意力层,缺乏显式机制来维护模态间的空间对应关系,导致 2D 纹理难以精确映射到 3D 几何表面。

难度与重要性

这两个瓶颈互相关联:劣化的潜变量使对齐过程无从寻找可靠锚点,而粗糙的对齐又进一步模糊生成细节。同时,3DGS 对显式几何与外观参数的直接优化,要求潜变量必须保留丰富的重建信息,这与传统生成模型追求的紧凑语义表示存在张力。业界对可扩展、高保真 3D 资产生成的需求日益迫切,该问题直接影响生成模型在 AR/VR、影视、游戏等内容管线中的可用性。

行业类比

类似自动驾驶中的多传感器融合——若 LiDAR 特征仅提取语义而丢弃点云密度信息,且与相机像素对齐仅靠简单拼接,则很难重建出远处小物体的精细形状。

核心洞察

  • - **Diffusion-Aligned Structured Latents (DA-SLAT) 重构了稀疏体素表示的特征来源**:传统方法(如 SparseGS)依赖判别式视觉特征(DINO)构建 3D 隐变量,这类特征为语义抽象优化,丢弃了纹理和精细结构信息,形成表示瓶颈。DA-SLAT 转而使用扩散模型内部与解码器对齐的深层特征,保留更多图像重建线索,并搭配仅解码器架构直接优化 3DGS 重建损失,使得生成模型在初始阶段就具备了高保真细节的表示基础,大幅超越以往基于判别式特征的方案。
  • - **Sparse-structure Multimodal Diffusion Transformer (SMDiT) 与 Modal-Aware Rotary Positional Embedding (MARoPE) 实现了稀疏结构感知的跨模态对齐**:此前,扩散 Transformer 在融合密集 2D image tokens 和稀疏 3D voxel latents 时缺乏有效对齐机制,导致跨模态对应混乱。FLUX3D 引入的 SMDiT 在 cross-attention 中显式编码体素存在掩码,使模型关注有效 3D 区域;MARoPE 则为 2D/3D 特征独立施加旋转位置编码,强化局部几何对应关系。这种稀疏结构感知的设计使得生成的 3DGS 资产在任意几何复杂度下均能保持纹理与形状的一致性,相比基线方法在 LPIPS 和 FID 等指标上取得显著提升。

方法

整体架构

FLUX3D 遵循“表征学习 + 潜在扩散”范式,输入单张 RGB 图像,输出高保真 3D Gaussian Splatting (3DGS) 资产。整个流程包括 扩散对齐的稀疏体素表征构建稀疏结构感知的跨模态生成 两个阶段。

表征学习:DA-SLAT 与 Decoder-Only 重建

  • 扩散对齐的结构化潜变量 (DA-SLAT):为解决传统方法中使用判别性 2D 特征(如 DINO)导致的表征瓶颈,FLUX3D 从预训练的 2D 扩散模型 中提取多尺度特征。这些特征天然保留纹理、边缘等高频细节,经体素投射形成稀疏潜变量网格,显著提升重建细节的保真度。
  • Decoder-Only 架构:摒弃常见的编码器-解码器设计,在体素潜变量上直接级联多层 Transformer 解码块 生成 3D 高斯参数(位置、协方差、颜色等)。这种纯解码结构避免了潜在下采样带来的信息丢失,最大程度将扩散特征转化为 3DGS 属性。

生成扩散:SMDiT 与 MARoPE

生成阶段以噪声化的体素潜变量为条件,需要从图像中恢复合理的 3D 分布。核心模块为 稀疏多模态扩散变换器 (SMDiT)

  • 多模态令牌混合:将密集的 2D 图像令牌与稀疏的 3D 体素令牌分别嵌入后,在 Transformer 层中交替进行自注意力和跨注意力,逐步对齐两种模态。
  • 模态感知旋转位置嵌入 (MARoPE):针对 2D 密集序列与 3D 稀疏排列在几何结构上的本质差异,对旋转位置编码 (RoPE) 施加模态感知的频率缩放,使同一 Transformer 能同时适配不同拓扑的输入,实现几何无关的 2D-3D 对齐,缓解跨模态对应瓶颈。
  • 扩散过程采用 Flow Matching 目标,在稀疏体素潜空间内预测速度场,通过少量去噪步数即可生成干净潜变量。

最终,去噪后的体素潜变量通过 Decoder-Only 头解码为完整的 3D 高斯云,再经由可微光栅化得到多视角图像,用于训练和评估。

与现有工作的核心差异:FLUX3D 以扩散模型特征替代判别特征重构 3D 表示,并设计稀疏感知的多模态扩散 Transformer,首次在架构层面统一解决表征瓶颈和跨模态对齐问题,而非仅凭数据或后处理修补。

实验

实验设计

论文围绕 图像到 3D 高斯泼溅(image-to-3DGS)生成 设置了两组核心实验:

  1. 重建实验:在固定数据集上评估 扩散对齐结构潜变量(DA-SLAT)仅解码器架构(decoder-only) 对 3DGS 重建保真度的影响,重点考察高频细节保留能力。对比对象包括基于判别式 2D 特征的稀疏体素表示方法。
  2. 生成实验:在全生成流程中评估完整 FLUX3D 框架,与现有 SOTA 图像到 3D 生成模型(如 CLAY、TripoSG、Craftsman3D、Structured3D 等)进行定量与定性对比,涵盖外观保真度、几何一致性等指标。

此外,进行了消融研究以单独验证 Sparse-structure Multimodal Diffusion Transformer(SMDiT)Modal-Aware Rotary Positional Embedding(MARoPE) 对跨模态对齐的贡献,以及 DA-SLAT 中不同 2D 特征选择策略的影响。

关键发现

  • DA-SLAT 有效缓解表示瓶颈:通过选择与扩散模型对齐的 2D 特征构建稀疏体素潜变量,相比传统语义抽象特征,重建结果在纹理清晰度、边缘锐度等方面有显著提升。仅解码器架构进一步增强了从稀疏表示恢复高分辨率高斯属性的能力。
  • SMDiT 与 MARoPE 实现几何无关的 2D-3D 对齐:标准扩散变换器难以处理密集 2D 图像 tokens 与稀疏 3D 体素 latents 的对应关系,SMDiT 通过稀疏结构感知的注意力设计,使模型能自适应地建立跨模态映射;MARoPE 则注入模态感知的位置编码,提升任意姿态下的对齐鲁棒性。
  • 整体框架显著超越 SOTA:在多个基准上,FLUX3D 生成的高质量 3DGS 资产在外观保真度和视觉细节上均优于所有对比方法,尤其在高频区域(如毛发、纹理)重建误差更小。

与基线的深度对比

FLUX3D 的改进根植于对两个结构性瓶颈的针对性突破。与依赖 DINOv2 等判别式特征的稀疏表示方法(如 LGM、TripoSR)不同,DA-SLAT 直接复用扩散模型的中间特征,使得重建阶段与生成阶段的表征空间一致,减少了信息损失。在生成部分,相比在潜在空间进行密集拼接或交叉注意力的常规做法,SMDiT 利用稀疏性先验进行条件注入,计算效率更高的同时保证了 2D 引导信号的完整性。消融实验表明,移除任一组件均会导致细节模糊或几何错位,证明了两瓶颈的独立性及联合解决的必要性。总体而言,FLUX3D 提供了更清晰的技术路径:从表示学习跨模态对齐两个维度同步优化,才能实现高保真、可扩展的稀疏表示 3D 生成。

行业影响

落地场景

FLUX3D 可直接应用于电商商品 3D 展示、AR/VR 虚拟试穿、游戏资产快速原型、影视预演及数字孪生等场景。其单张图片秒级生成 3D Gaussian Splatting 的能力,使内容平台可快速将 UGC 平面素材转化为交互式 3D 对象,降低 3D 内容创作门槛。

商业价值

通过自动化重建高保真外观细节,大幅压缩手工建模成本(单资产从数小时降至秒级),同时提升交互体验以驱动转化率与用户留存。对于电商与广告行业,3D 展示可提升 10%-30% 的点击转化;对游戏与影视,则加速 pre-viz 与素材迭代,间接缩短研发周期。

与现有产品 / 工作流的接口

FLUX3D 接受单张 RGB 图像作为输入,输出为标准 3DGS 格式(.ply + 球谐系数),可直接导入 Unity、Unreal Engine、Blender 等主流引擎。管线上,可封装为 REST API 或插件,嵌入 CMS 或数字资产管理(DAM)系统,作为“上传图片 → 自动生成 3D 预览”的微服务模块。

具体落地用例

  • 电商平台:卖家上传商品图片,系统即时生成可旋转缩放的 3D 模型,替代传统多角度拍照,提升用户决策信心。
  • 独立游戏工作室:开发者输入概念草图或参考图,FLUX3D 产出初始 3D 道具或场景素材,美术人员在此基础上细化而非从零建模,显著加快原型验证。

局限

  • **单视图重建的固有歧义性**:FLUX3D 依赖单张图像作为输入,不可避免地面临遮挡区域和视角缺失的问题。对于拓扑复杂或存在严重自遮挡的物体,稀疏体素表示可能无法完整捕捉几何细节,导致生成的 3DGS 资产在不可见部分出现模糊或错误。论文未探索融合多视图输入或借助先验几何约束来解决歧义,这限制了其在要求全场景保真度的应用中的适用性。
  • **稀疏体素表示的分辨率瓶颈**:方法基于稀疏体素构建潜在空间,虽有利于扩散模型的伸缩性,但在处理细薄结构(如毛发、线缆)或高频纹理时,体素网格固有的分辨率限制可能导致细节丢失。尽管 DA-SLAT 和 decoder-only 架构提升了重建质量,但本质上仍受限于体素表达的粒度,在生成微观级别的表面细节上可能不及基于点云或隐式表示的方法。
  • **计算开销与实时性挑战**:SMDiT 虽然通过分离模态注意力实现了 2D-3D 对齐,但双流 Transformer 和迭代去噪过程依然计算密集。论文未详细分析推理延迟和显存占用,而在实际生产环境中,快速生成是刚需。与某些纯前馈方法相比,扩散范式可能在速度上存在劣势,限制了其在交互式 3D 内容创作中的部署可行性。
论文Haorui Ji2026-06-23原文

相关内容