原生 3D 纹理生成是否必须依赖 3D 资产进行训练?
原生 3D 纹理生成(Native 3D Texture Generation)是指在给定几何体的情况下,以多视角参考图像为条件,直接在 3D 空间中合成颜色。通常认为,训练这类模型需要大规模、高质量的真实 3D 资产数据,而这类数据的获取一直是长期且棘手的难题。 本文提出 Tex-Zero,证明无需任何 3D 资产即可训练出高保真的原生 3D 纹理生成框架。核心观察是:3D 纹理训练真正必需的只是高质量、细粒度的颜色信息,而所需的几何信息并不关键,完全可以人工构造,而非取自真实 3D 资产。这一发现使得将大量高质量 2D 图像转化为 3D 纹理生成训练样本成为可能。 具体做法上,我们将每张高质量 2D 图像表示为 3D 空间中的一个平面,并通过 patch 级随机旋转与聚合构造复杂几何结构,从而把 2D 图像转换为 3D 训练样本。基于这些构造数据训练出的 Tex-Zero VAE 在从未见过真实 3D 资产的情况下,仍能高质量重建真实资产;在此之上训练的 Tex-Zero DiT 同样仅使用构造图像数据,其中作为条件的 2D 多视角图像被转换成 3D 空间中的平面并交由 Tex-Zero VAE 编码,从而缩小表示差距、提升生成质量。 大量实验表明,Tex-Zero 仅以图像作为训练数据即可生成细节丰富的高保真 3D 纹理,为 3D 纹理生成的规模化数据范式提供了有前景的新视角。
论文精读
TL;DR Tex-Zero 证明训练原生 3D 纹理生成无需 3D 资产,仅用高质量 2D 图像构造 3D 训练样本即可获得高保真结果,为 3D 纹理生成的数据扩展提供了新思路。
问题
问题背景
原生 3D 纹理生成 (native 3D texture generation) 旨在给定几何体与多视角参考图,直接在 3D 空间合成颜色信息,是 3D 内容生成的重要环节。
现有方法局限
当前主流方法普遍假设需要 大规模高质量 3D 资产 作为训练监督。但 3D 资产采集与标注成本极高,且在几何与纹理质量、多样性上难以规模化。具体局限:
- 3D 扫描 / 建模流程耗时,难以覆盖广泛物体类别
- 现有 3D 数据集规模远小于 2D 图像数据集,导致模型泛化受限
- 即使使用 3D 资产,不同来源的几何拓扑与 UV 映射差异大,预处理复杂
这一数据瓶颈长期阻碍了 3D 纹理生成模型向规模化演进。
为什么这个问题难/重要
技术挑战在于:能否仅用丰富的 2D 图像数据来训练 3D 纹理生成?难点在于 2D 图像缺少显式 3D 几何对应关系,直接作为监督信号会引入几何与纹理的歧义。同时,模型需要学习从 2D 参考图到 3D 空间的映射,二者之间的表示差距 (representation gap) 显著。若能突破,将大幅降低数据获取门槛,使 3D 纹理生成模型可受益于海量互联网图像,具备与 2D 生成模型相近的扩展潜力。业界高度关注从 2D 监督构建 3D 能力的数据范式创新。
行业类比
类似 文本到图像扩散模型 早期利用互联网图文对替代昂贵的人工标注数据,Tex-Zero 尝试用 2D 图像替代难以获取的 3D 资产,为 3D 生成提供可扩展的数据路径。
核心洞察
- 核心观察是 3D 纹理训练中几何信息可手工构造,颜色信息才是关键,因此仅用 2D 图像即可训练原生 3D 纹理生成模型。与依赖大规模真实 3D 资产的传统方法不同,Tex-Zero 将高分辨率 2D 图像表示为 3D 平面,并通过 patch-wise 随机旋转与聚合构建复杂几何结构,使模型学会将颜色映射到任意表面而无需真实几何先验。这从根本上降低了数据获取门槛,使得可以利用现有海量 2D 图像数据扩展 3D 纹理生成能力,对实际工程中减少昂贵的 3D 扫描和人工建模依赖具有直接价值。
- Tex-Zero 让条件多视角图像与目标 3D 纹理共享同一 VAE 表示空间,有效缩小了生成模型的条件与输出分布差异。常规方法将 2D 条件图像与 3D 体素或点云等表示分别编码,容易造成跨模态鸿沟;Tex-Zero 把参考视图也转换并编码为 3D 平面潜在表示,使 DiT 的输入条件与输出在同一潜在空间操作,从而提升生成一致性和细节保真。这种数据构建与模型设计协同的策略,为其他跨维度生成任务提供了一种可行的统一表示思路,工程上能简化架构并提高训练稳定性。
方法
方法概述
Tex-Zero 采用两阶段流水线:先用2D 图像构造伪 3D 训练数据,再训练Tex-Zero VAE 与 Tex-Zero DiT 生成模型。
输入与数据构造:训练时仅需高质量 2D 图像。将每张图像视为 3D 空间中的平面,对图像块(patch)施加随机旋转并聚合,生成具有复杂几何结构的伪 3D 样本;几何信息由人工构造,颜色信息保留自 2D 图像。推理时输入为给定几何体与多视角参考图像。
Tex-Zero VAE:在构造数据上训练 3D VAE,将 3D 纹理颜色场编码为紧凑潜在表示并解码重建。训练目标是重建损失与图像空间感知损失。该 VAE 虽未见过真实 3D 资产,但能高质量重建真实资产,证明颜色信息才是关键。
Tex-Zero DiT:基于 VAE 的潜在空间训练 DiT 生成模型(Flow Matching 目标)。条件多视角图像同样被转换为 3D 平面并输入 VAE 编码,与生成潜空间对齐,降低条件与生成的表示差距,提升细节保真度。
输出:DiT 生成潜在编码,VAE 解码得到与输入几何对应的 3D 纹理颜色场。
与依赖大规模 3D 资产训练的同类方法不同,Tex-Zero 完全用 2D 图像构造训练样本,证明几何可通过人工构造,为 3D 纹理生成的数据规模化提供了新范式。
实验
实验设计
- 训练数据: 从高质量 2D 图像构造,不依赖真实 3D 资产。
- 构造方式: 将每张图像表示为 3D 平面,应用 patch-wise 随机旋转与聚合 生成复杂几何结构。
- 训练流程: 先训练 Tex-Zero VAE,再训练 Tex-Zero DiT;条件多视角图像同样转为平面并被 VAE 编码,以减少表示差距。
- 评估: 在训练中未见过的真实 3D 资产上测试重建与生成质量。
关键发现
- Tex-Zero 仅用图像数据即可生成 高保真 3D 纹理,细节精细。
- 验证核心假设:高质量、细粒度颜色信息是训练关键,几何信息可人工构造。
- Tex-Zero VAE 成功重建真实 3D 资产,证明构造图像数据能有效监督 3D 纹理学习。
对比解读
- 现有方法通常依赖大规模真实 3D 资产,采集成本高且难以扩展。Tex-Zero 将 2D 图像转化为有效训练样本,提供了一种 数据范式转变。
- 工程启示:降低数据门槛,可利用海量 2D 图像快速扩展训练规模;同时通过共享 VAE 编码条件与目标,减少表示差距,提升生成一致性。
行业影响
落地场景
Tex-Zero 使原生 3D 纹理生成 摆脱对 3D 资产的依赖,可直接用于:
- 电商平台商品 3D 展示:从多张商品照片生成可旋转、缩放的带纹理 3D 模型
- 游戏与影视资产管线:从概念设定图快速生成角色、道具表面纹理
- AR/VR 与虚拟试穿:为重建的人体/衣物网格提供高保真颜色信息
商业价值
- 降本:训练数据由高质量 2D 图像构造,无需昂贵 3D 扫描或人工建模,数据获取成本大幅降低
- 增效:纹理生成流程从数小时手工绘制缩短至秒级推理,提升内容生产吞吐
- 可扩展:任何 2D 图像集合都能转化为训练样本,模型容量与数据规模可随互联网图像增长
与现有工作流接口
Tex-Zero 输出体素或网格纹理,可对接常见 3D 表示(Mesh、NeRF、3DGS)。其 VAE 可将多视角参考图像编码为紧凑 3D 潜在,DiT 做条件生成,适合嵌入:
- DCC 工具(Blender/Unity/Unreal)插件,作为“纹理烘焙”替代
- 多视图扩散模型后处理,补充高频纹理细节
- 3D 重建 pipeline 的最终上色阶段
典型用例
- 电商 AR 试戴:顾客上传手表或鞋类多视角照片,系统自动生成可交互 3D 预览,减少退货率。
- 独立游戏开发:小团队输入概念艺术多视图,直接产出引擎可用的角色/场景纹理,避免外包成本。
局限
- **数据依赖与覆盖偏差**:该方法将高质量 2D 图像作为唯一训练源,通过平面映射与 patch 旋转构造 3D 样本。若 2D 图像数据本身存在类别偏差、光照单一或视角局限,则构造出的训练分布难以覆盖真实世界纹理的多样性,尤其对高光反射、半透明或各向异性材质,生成质量可能明显下降。论文未深入讨论数据规模与多样性对泛化上界的影响。
- **几何复杂度受限**:patch-wise 随机旋转与聚合虽然引入了多变几何结构,但本质上仍是平面 patch 的组合,缺少真实资产中的连续曲面、细粒度拓扑变化(如褶皱、孔洞、尖锐边缘)。该构造方式可能使模型对复杂几何的纹理生成产生偏差,表现为细节模糊或纹理拉伸,尤其在非平面区域的重建与生成任务中。
- **与真实资产监督的差距**:尽管 Tex-Zero 展示了零 3D asset 训练的可能性,但由于完全摒弃真实几何信息,模型在生成时缺乏对几何先验的直接约束。在度量指标(如 FID、LPIPS)上可能仍略逊于使用大规模真实 3D asset 训练的 SOTA 方法,尤其是高频细节的保真度。此外,论文主要评估了重建与无条件生成,对条件生成中多视角一致性与几何适配性的联合定量分析尚不充分。