Luce: 用于3D资产生成的可再照明高斯表示
高保真图像到3D生成需要一种能够同时捕捉几何和外观的3D表示。为支持再照明并集成到标准渲染管线,表示应包含基于物理的渲染(PBR)材质模式,如反照率(albedo)、金属-粗糙度(metallic-roughness)和表面法线(surface normals)。我们提出了 Luce,一种在体素化多模态高斯云中统一几何与PBR材质的3D表示,为每种模态使用专用高斯原语。 变分自编码器将该表示压缩到统一材质感知的潜在空间中。一个 rectified-flow transformer 从单张图像生成此潜在表示,并以预训练图像编码器的多层特征为条件,从而保留语义上下文和精细空间细节。随后,潜在表示解码为可再照明的PBR高斯以及可选的带切空间法线贴图的纹理网格。 在 Toys4K 数据集上,Luce 实现了最先进的单图像到3D生成,相较于最强基线,FID 改进了28%。我们进一步引入了一个AI生成图像的基准,在此基准上,Luce 将 CLIP 图像对齐分数优于最佳基线(0.8519 vs. 0.8299)。Luce 生成可再照明、几何精确且材质忠实的资产,保留了诸如文本、徽标和铭文等细节。
论文精读
TL;DR Luce 将几何与 PBR 材质统一为体素化多模态高斯云,用 VAE 和 rectified-flow transformer 从单图生成可重光照 3D 资产,在 Toys4K 上 FID 提升 28%,细节还原能力强。
问题
问题背景
当前图像到 3D 生成领域正从单一外观重建转向可重光照 (relightable) 的资产生成,要求输出能直接用于标准 PBR (Physically Based Rendering) 管线,包含 albedo、metallic-roughness、normal 等材质通道。
现有方法局限
早期方法多采用 NeRF 或隐式表示,虽然几何还原较好,但缺乏显式材质分解,难以在外部渲染器中重光照。3D Gaussian Splatting 类方法渲染效率高,但通常只优化颜色外观,未对材质属性解耦,导致在任意光照下无法正确响应。部分可重光照方法依赖多视图或受控光照条件,难以推广到单图像生成。此外,生成的模型常丢失细粒度纹理细节(文字、logo),因为压缩或编码过程破坏了空间高频信息。
为什么这个问题难/重要
单张图像中光照、材质、几何高度耦合,属于严重不适定问题。模型需要强大的数据先验来解耦这些因素,同时保持几何准确性和材质保真度。业界对可重光照 3D 资产需求旺盛:游戏、影视、AR/VR 及产品可视化都要求资产能在不同光照环境下无缝切换,并可直接导入 Blender、Unreal 或 Unity 等引擎的 PBR 工作流。若生成的资产不可重光照或材质参数不正确,则无法落地生产环境。
行业类比
文本到图像 模型需要输出可编辑的分层 PSD 而非仅合成图片,类似地,3D 生成也需要输出可交互的材质通道,才能真正进入专业创作流程。
核心洞察
- 统一几何与 PBR 材质于 voxelized multimodal Gaussian cloud 是 Luce 的核心表示创新。与常见方法将材质作为后处理纹理或独立网络生成不同,Luce 让每种模态(albedo、metallic-roughness、法线)拥有独立的 Gaussian 原语并共享体素结构,这确保了生成过程中几何与材质的一致性,并可直接用于 PBR 渲染。
- VAE 将多模态 Gaussian 参数压缩为统一 material-aware latent,是生成质量提升的关键。直接在高维 Gaussian 参数上回归存在优化困难,而 latent 空间学习能够捕获模态间的相关性,并允许 rectified-flow transformer 在低维、平滑的空间中生成,显著提高稳定性和泛化性。对比独立编码各模态再拼接的方法,统一 latent 避免了不一致。
- 利用预训练视觉编码器的多层特征作为条件,是保留细粒度细节(如文字、logo)的关键。仅用全局特征或单层特征会丢失空间细节或语义信息,Luce 采用 multi-layer features 组合,同时注入高层语义与低层纹理线索,使生成模型能够在 latent 生成时对齐输入图像的局部结构,从而在输出中再现细微文字和图案。
方法
方法流程
Luce 从单张图像生成可重光照的 3D 资产,流程分为表示构建、压缩编码与生成解码三个阶段。
1. 多模态 PBR Gaussian 表示
Luce 使用 voxelized multimodal Gaussian cloud 作为统一表示,为几何和 PBR 材质(albedo、metallic-roughness、surface normals)各分配专用 Gaussian 基元。渲染时通过标准 PBR 着色实现重光照。该表示同时支持后续烘焙为带切线空间法线贴图的纹理网格。
2. 变分自编码器 (VAE)
VAE 将上述多模态 Gaussian 表示压缩到统一的材质感知潜在空间,编码器提取结构特征,解码器重建 Gaussian 参数。训练目标包含重建损失与 KL 正则,保证潜在空间连续且可采样。
3. 基于流匹配的生成
生成采用 rectified-flow transformer,从单张图像条件生成潜在表示。图像条件来自预训练图像编码器(如 DINOv2)的多层级特征,同时保留语义上下文和空间细节。生成过程分为稀疏结构生成和潜在生成两步,之后通过双解码器分别输出 PBR Gaussians 和可选纹理网格。
4. 工程化细节
- 使用归一化流训练,推理时通过 ODE 求解器采样。
- 多层级特征通过跨注意力注入 transformer。
- 纹理烘焙时从 Gaussian 体积提取 PBR 材质属性。
与同类单图 3D 生成方法不同,Luce 不是简单回归 RGB 外观,而是显式建模物理材质模态,使其输出可直接用于标准渲染管线中的重光照。
实验
实验设计
- 评估在 Toys4K 数据集与新引入的 AI 生成图像基准上进行。
- 指标包括 FID 与 CLIP image-alignment,并补充重建测试与消融实验。
- 基线为现有先进方法,具体名称见论文原文。
关键发现
- Toys4K 上,Luce 的单图到 3D 生成 FID 较最强基线提升 28%。
- AI 生成图像基准上,CLIP image-alignment 达到 0.8519,超过基线 0.8299。
- 生成资产可重光照(relightable),能保留文字、logo 和铭文等细粒度细节。
- 统一几何与 PBR 材质的 voxelized multimodal Gaussian cloud 是关键。
基线对比解读
- 相比最强基线,Luce 在几何、材质与图像对齐上均有实证优势。
- 与仅输出几何或外观的同类工作不同,Luce 同时产出 albedo、metallic-roughness 与 surface normal 等 PBR 模态,可直接接入标准渲染管线。
- 工程上,该方法有望减少手工材质创建与重光照测试的迭代成本。
行业影响
落地场景
Luce 适用于需要从单张图像快速生成可重光照 3D 资产的业务场景:
- 电商平台:从商品照片生成可旋转、可变光照的 3D 模型,增强用户对材质细节(金属、织物、反射)的感知,提升转化率。
- 内容创作平台 / 游戏开发:上传一张概念图即可生成带 PBR 材质 的道具或角色,直接用于引擎渲染与迭代。
- 虚拟制作 / AR 滤镜:为现实物体快速生成数字孪生,保留文字、logo 等精细特征,用于虚拟拍摄或增强现实展示。
商业价值
传统 3D 建模耗时数小时至数天,Luce 将单图生成时间压缩至秒级,大幅降低人力成本。其输出为 PBR Gaussians 和可选 纹理网格,可直接进入标准渲染管线,省去手动重建材质的步骤。基准测试中 FID 改善 28%、CLIP 对齐分数领先,意味着生成质量接近真实资产,可减少后期修正。对于需要海量 3D 内容的平台,按需生成可降低库存成本并提升内容多样性,同时支持快速 A/B 测试不同材质或光照方案。
与现有产品/工作流的接口
Luce 输出两种格式,便于集成:
- PBR Gaussian 点云:适合实时渲染,可接入支持 Gaussian splatting 的引擎或 Web 查看器。
- 带切线空间法线贴图的纹理网格:可导出为
glTF/USD,导入 Blender、Unreal Engine、Unity 等 DCC 工具或引擎,支持标准 PBR shading。
集成方案:在现有资产流水线中增加“单图生成 3D”步骤,生成结果作为初始草稿,设计师可在此基础上微调几何或材质参数。与同类工作相比,Luce 的多模态 Gaussian 表示统一了几何与材质,避免先几何后纹理的分离误差,更适合生产环境中的迭代与协作。
局限
- 单图输入天然缺乏多视图信息,对于输入图像中不可见的部分(如背面、遮挡区域),生成的几何与纹理存在不确定性。尽管使用了预训练图像编码器的多层特征作为条件,但此类先验难以完全补偿视角缺失,在复杂拓扑或强遮挡场景下仍可能出现纹理拉伸、几何简化或语义歧义。这一局限在单图生成 3D 的整体任务中普遍存在,Luce 并未引入显式的多视图一致约束或跨视角生成机制,因此对于需要高精度完整几何的应用场景可能不足。
- 体素化多模态高斯云表示在统一几何与 PBR 材质的同时,可能受限于体素分辨率,影响高频几何细节的捕捉。VAE 的压缩过程也可能进一步平滑细节,即便后续通过 tangent-space normal map 转移部分表面细节,基础几何的精度仍然受限于体素网格的尺度。对于精细结构(如薄片、细线、镂空)或小尺寸文字 logo,重建质量可能退化,实际工程中需要在分辨率、内存占用与训练效率之间做出权衡。
- Luce 采用多阶段流程(VAE 预训练 + rectified-flow transformer 生成 + 可选纹理烘焙),相比端到端直接生成隐式场或 3DGS 的方法,训练与推理成本更高,部署复杂度更大。评估指标(FID、CLIP score)主要衡量图像层面的外观一致性,缺乏对重光照准确性的直接定量验证(如在不同 HDR 环境下的渲染误差、BRDF 参数误差),因此对 PBR 材质的物理正确性评估不充分。此外,Toys4K 数据集偏向玩具物体,域差距可能限制模型在通用物体上的泛化性能。