UltraTex:释放 2K 多视角扩散用于 3D 纹理生成
高质量纹理生成 是创建逼真、可直接用于生产的 3D 资产的关键。近期多视角扩散方法在图像引导的 3D 纹理生成上表现不俗,但通常受限于 512 或 768 的低分辨率,难以保留高分辨率参考图中的高频细节。将这一范式扩展到 2048 分辨率在计算上难以承受:统一的多视角序列超过 212K tokens,带来过高的显存占用与延迟。 本文提出 UltraTex,一个面向高分辨率多视角扩散 3D 纹理生成的高效端到端框架。作者观察到以物体为中心的多视角渲染存在两类主要冗余: - 背景冗余:背景引入的序列冗余; - 稀疏交互:前景内部 token 之间交互稀疏。 为此,论文引入 Background Token Dropping,在 DiT backbone 之前移除背景 token;以及 Block-Sparse Attention,降低保留前景序列上的注意力计算量。为实现仅前景的高效推理并避免重建伪影,还设计了 Foreground-Aware VAE Decoding。为满足 2K 多视角扩散训练的数据需求,作者构建了 G-buffer TexVerse,一个覆盖超过 268,000 个 3D 资产的大规模超高分辨率多视角渲染数据集。 实验表明,UltraTex 能生成细节丰富、视觉逼真的纹理,同时显著提升效率:相比 baseline,训练加速 20.6×–91.1×,端到端推理加速 22.3×–74.6×。
论文精读
TL;DR UltraTex 通过背景 token 丢弃、块稀疏注意力与前景感知 VAE 解码,将多视图扩散 3D 纹理生成扩展到 2K,并构建 G-buffer TexVerse 数据集,实现 20.6–91.1× 训练和 22.3–74.6× 推理加速。
问题
问题背景
3D 资产生成领域当前聚焦于如何高效生成高质量、生产级纹理。基于多视图扩散模型的图像引导纹理生成展现出潜力,但受限于计算资源,模型通常工作在低分辨率下,难以满足高保真需求。
现有方法局限
现有 多视图扩散 方法将操作分辨率限制在 512 或 768,这导致高分辨率参考图像中的高频细节(如织物纹理、文字标记、微小凹凸)在纹理生成过程中被平滑或丢失。若直接扩展到 2048 分辨率,统一多视图序列的 token 数超过 212K,训练和推理的内存占用与延迟急剧上升,使得该方案在工程上不可行。此外,现有方法未针对多视图渲染中的两类冗余进行优化:背景 token 占据大量序列但信息密度低,前景 token 之间的注意力交互存在稀疏性,导致计算浪费。
为什么这个问题难/重要
技术挑战在于需要在保持 2K 分辨率细节的同时大幅降低计算复杂度,这涉及序列压缩、稀疏注意力设计以及 VAE 解码的保真度控制。业界对高精度 3D 资产的需求持续增长,高质量纹理是决定资产是否达到生产级标准的关键瓶颈。将纹理分辨率提升到 2K 意味着更丰富的细节和更少的人工后期修正,直接影响 3D 内容创作的效率与质量,因此该问题成为多视图生成领域的研究热点。
行业类比
这一挑战可类比于高分辨率图像生成或长视频生成中处理长 token 序列的优化:将 块稀疏注意力 和 token 剪枝 等机制引入多视图扩散,类似于大语言模型中的长上下文加速策略,对各类长序列生成任务具有参考价值。
核心洞察
- 对象中心多视角渲染中背景 token 占据大量序列但贡献很小,UltraTex 直接丢弃背景 token,将 2K 分辨率下的 212K token 序列大幅压缩,是高分辨率多视角扩散可行的核心。与现有方法对全序列做 token 压缩或降采样不同,UltraTex 利用 3D 渲染中前景/背景天然分离的结构先验,以硬删除方式消除冗余,并通过位置编码保持空间一致性。该角度将 2D 扩散 token 优化与 3D 场景结构结合,带来了 20.6–91.1 倍训练加速和 22.3–74.6 倍推理加速。
- Foreground-Aware VAE Decoding 解决只解码前景区域时背景缺失导致的伪影,通过 canonical background latent 和前景受限解码器微调,保证高分辨率视图质量。这不同于常规 VAE 全图解码或简单 mask 重建,它从 latent 分布层面协调前景与背景,使前景 token 稀疏化后仍能输出连贯纹理,是端到端 2K 纹理生成中容易被忽视但关键的环节。
方法
方法概述
UltraTex 以 In-Context Multi-View Diffusion 为基础架构。输入包含参考图像与 3D 资产的多视角渲染(G-buffer,如法线、深度等),统一拼接为多视图序列送入扩散模型。模型输出对应多视图纹理图,再反投影至网格生成 2K 纹理。
针对该序列在 2048 分辨率下超过 212K tokens 的冗余问题,提出三个核心模块:
Background Token Dropping (BTD):利用前景掩码,在 DiT 骨干前丢弃背景 token,只保留前景 token,大幅缩短序列。训练时采用 foreground-restricted training,并在丢弃后重新注入位置嵌入以保持空间一致性,避免物体位置错乱。
Block-Sparse Attention (BSA):对保留的前景 token 实施块稀疏注意力,只计算块内及关键跨视图块之间的注意力,降低注意力冗余。通过调整保留比例在效率与质量间权衡。
Foreground-Aware VAE Decoding:测试时仅解码前景 token,背景用规范背景潜在变量填充,并对 VAE 解码器进行 foreground-restricted fine-tuning,避免重建伪影,确保最终 2K 视图质量。
G-buffer TexVerse 数据集提供超过 268,000 个资产的超高分辨率多视图渲染,支撑 2K 训练。
与同类多视图纹理方法相比,UltraTex 通过联合消除背景序列冗余与前景注意力冗余,首次将扩散纹理生成扩展到 2K 分辨率,同时实现 20.6–91.1 倍训练加速与 22.3–74.6 倍推理加速。
实验
实验设计
UltraTex 在 G-buffer TexVerse 数据集上训练与评测,该数据集包含超 268,000 个 3D 资产的多视角渲染,原生支持 2K 分辨率。基线采用直接扩展到 2048 的统一多视图扩散范式,其序列长度超过 212K tokens,作为效率与质量的对比参照。
关键发现
- 通过 Background Token Dropping 去除背景 token,Block-Sparse Attention 对保留前景序列做稀疏注意力,以及 Foreground-Aware VAE Decoding 保证高分辨率视图质量,UltraTex 在常见样本上实现 20.6×–91.1× 训练加速 与 22.3×–74.6× 端到端推理加速。
- 生成纹理具备丰富细粒度细节,视觉保真度与基线相当或更优,证明效率提升并非以牺牲质量换取。
与基线对比
基线因 212K tokens 的全序列注意力导致显存与延迟不可承受,而 UltraTex 利用对象中心多视角渲染的结构先验,消除背景序列冗余并限制前景 token 间的稀疏交互。这一设计使得 2K 分辨率多视图扩散训练与推理首次具备工程可行性,对面向生产的 3D 资产生成管线具有实际参考价值。
行业影响
落地场景
UltraTex 可直接应用于电商商品 3D 展示、游戏资产生产、影视预演和 AR/VR 内容生成。例如,电商平台对单品商品拍照后,自动生成 2K 分辨率多视角纹理,减少人工贴图工作;游戏工作室可对低模快速赋予高精度材质,加速原型迭代。
商业价值
核心价值在降本与提效:传统高精细纹理需美术手工绘制数小时至数天,UltraTex 将推理速度提升 22.3×–74.6×,单资产纹理生成从分钟级降至秒级,直接降低人力成本。同时 2K 分辨率保留高频细节,提升视觉真实感,有助于提高商品转化率或游戏美术品质。训练侧 20.6×–91.1× 的加速也降低了模型迭代成本,适合自建垂直领域纹理模型。
与现有工作流接口
UltraTex 可作为独立纹理生成模块嵌入现有 3D 生产管线:
- 输入多视图渲染图或参考图,输出 UV 空间纹理贴图,可直接对接 Blender、Unreal Engine、Unity 等 DCC 或引擎。
- 提供 项目主页 和 代码仓库,便于以 API 或插件形式集成。
- 对于已有资产库,可利用 G-buffer TexVerse 数据集微调,适配自有风格或材质类型。
具体 use case:
- 电商 3D 商品展示:对鞋服、家具等商品拍摄少量参考图,自动生成 2K PBR 纹理,用于 Web 端 360° 互动展示。
- 内容平台 UGC 创作:允许用户上传白模或扫描模型,自动生成写实纹理,丰富虚拟内容生态。
局限
- **场景泛化性受限**。UltraTex 的核心假设是“object-centric multi-view renderings”,即背景 token 可被安全丢弃。然而对于包含复杂背景、场景级资产(如室内/室外环境)或需要环境光照交互的物体,背景 token 可能携带重要上下文信息(如反射、阴影、遮挡关系)。直接丢弃这些 token 可能导致纹理与背景不协调,或在重建视图中出现边缘伪影。论文仅在对象级资产上验证,未充分评估开放场景或背景依赖场景下的表现,实际部署时需谨慎判断输入类型。
- **Block-Sparse Attention 的长距离依赖损失**。稀疏注意力虽然大幅降低计算量,但通过限制注意力范围,可能削弱前景 token 之间的远距离交互。对于细节高度相关或跨区域纹理一致性要求高的资产(如复杂图案、连续材质),局部注意力可能无法正确传播全局信息,导致纹理断裂或重复模式失真。论文通过 retention ratio 调节稀疏度,但最优值可能因资产而异,缺少自适应机制,实际使用中可能需要多次调参才能平衡质量与效率。
- **数据分布与美学偏差**。G-buffer TexVerse 数据集规模可观,但其渲染协议、光照设置、材质类型等可能偏向特定风格,导致模型对未见分布(如非朗伯表面、半透明材质、极端光照条件)的泛化能力不足。此外,Foreground-Aware VAE Decoder 的微调基于该数据集,可能进一步固化分布偏好,在真实拍摄参考图像或风格化输入上产生纹理退化。论文未讨论对低分辨率参考图像或严重遮挡输入的鲁棒性,这限制了其在生产管线中的直接适用性。