Block3D: 基于块状扩散的高效文本到三维生成
文本到三维生成虽发展迅速,但在低推理成本下实现高几何保真度仍具挑战。现有方法要么自回归解码离散形状 token,要么用扩散或流模型迭代细化全局三维表示。然而,自回归解码是顺序的,无法修正错误;扩散和流匹配模型则反复处理完整表示,使高质量生成成本日益增加。 为此,我们提出 Block3D,一种块状扩散框架:将离散形状 token 序列划分为连续块,自回归生成各块,并对当前块内所有 token 进行联合去噪。为缓解误差累积,我们引入置信度引导的块内校正,在每块最终确定前修正低置信度 token。在 TRELLIS-500K 的留出集上,Block3D 将平均端到端生成时间从 25.71 秒降至 4.99 秒,较微调的自回归基线实现 5.15 倍加速,且不牺牲几何保真度。
论文精读
TL;DR Block3D 将 3D 形状 token 序列分块,块内并行去噪并自回归推进,结合置信度引导修正,在几何保真度不下降的前提下,将平均生成时间从25.7秒降至5秒,加速5.15倍。
问题
问题背景: text-to-3D 生成目前聚焦于离散 shape token 的高保真解码,同时降低推理延迟。
现有方法局限:
- 自回归 (AR) 解码按顺序生成,无法回溯修正早期错误,错误逐级累积。
- 扩散 / flow-matching 模型每次迭代都处理完整 3D 表示,计算量随质量提升显著增加,推理成本高。
- 微调后的自回归基线在 TRELLIS-500K held-out set 上平均端到端耗时 25.71 秒,难以满足实时交互。
为什么难 / 重要: 离散 token 序列存在长程依赖,块间自回归、块内联合去噪的设计需要平衡并行度与错误纠正能力;置信度引导的块内修正需要可靠的 token 置信度估计。3D 资产生成在游戏、仿真、数字人等场景需求旺盛,低延迟高质量是落地关键。
行业类比: 类似 LLM 推理中的投机解码 / 块并行解码:用局部并行 + 验证/修正替代严格顺序生成,在保持输出质量的同时大幅降低端到端延迟。
核心洞察
- 块级扩散生成:将离散 shape token 序列划分为连续块,块间自回归、块内联合去噪,在推理效率与几何保真度之间取得平衡。 与纯自回归解码(顺序生成且无法修订错误)和全局扩散/流匹配(每次迭代处理完整表示,成本随质量升高而激增)相比,该范式把迭代计算限制在当前块内,避免全序列重复前向,同时通过块间自回归保持空间一致性。论文在 TRELLIS-500K 留出集上实测端到端生成时间从 25.71 秒降至 4.99 秒,实现 5.15 倍加速,且几何指标无显著下降,证明块级粒度是更优的计算单元划分。
- 置信度引导的块内纠错:在每个块最终确定之前,根据 token 置信度对低置信 token 进行针对性重采样,缓解块级自回归的误差累积。 传统自回归解码一旦生成即固定,错误会单向传播到后续所有块;而 Block3D 利用块内扩散模型的联合去噪能力,只对低置信 token 激活修订,而不是重新生成整块或全序列。该机制打破了自回归不可修订的限制,同时避免全局重算,是块级扩散在质量上不亚于全局扩散的关键。这种“生成-评估-局部修正”的流程为混合解码框架提供了可复用的纠错范式。
方法
输入与表示
Block3D 的输入是文本 prompt,通过文本编码器得到条件向量;输出是离散 shape-token 序列,经过冻结的 shape representation 与 generator 映射为最终 3D 几何。整个序列被划分为多个连续块。
关键模块
Block-Causal Shape-Code Denoising:块间采用自回归顺序生成,每个块内部对块内所有 token 做联合扩散去噪。训练时通过 block-causal attention 只允许当前块及之前的块可见,同时用逻辑位置 ID 区分块内 token 与跨块关系,保证训练与推理一致性。
Edit-Aware Corruption and Training:训练中引入 token 级编辑损坏(随机替换部分 token),并使用 one-step model rollout 和 residual objective 迫使模型在部分 token 错误时仍能恢复正确几何,增强对累积误差的鲁棒性。
Bounded Confidence-Guided Decoding:推理时,模型对当前块内每个 token 输出置信度。设置 reveal quota 和更新集合,在块最终确定前只对低置信度 token 进行局部修正,修正预算有界,避免无限迭代。同时支持前缀缓存(prefix cache)降低跨块冗余计算。
输出与差异
最终输出完整 shape-token 序列并解码为 3D 形状。相比纯自回归逐 token 无法纠错、全局扩散反复处理全序列的高开销,Block3D 通过块内并行联合去噪保留几何一致性,块间顺序生成控制成本,并用有界置信度修正减少误差传播,实现 5.15 倍加速且不牺牲几何保真度。
实验
实验设计
在 TRELLIS-500K 的 held-out set 上评估 Block3D,对比 fine-tuned autoregressive baseline,测量几何保真度和端到端生成时间。
关键发现
- 平均端到端生成时间 从 25.71 秒降至 4.99 秒,加速比 5.15x。
- 几何保真度未下降,具体指标未在摘要中披露。
与基线对比解读
AR 解码顺序执行且无法修正错误;扩散/流匹配反复处理全表征,成本随质量提高而增长。Block3D 通过块级扩散和置信度引导的块内校正,在维持质量的同时显著减少冗余计算。对工程部署的启示:可将长序列分块处理,结合置信度筛选,平衡生成质量与延迟。
行业影响
落地场景
Block3D 的加速效果直接适用于需要快速生成 3D 资产的场景:
- 电商商品 3D 展示:商家上传文本描述,秒级生成可交互的商品模型,替代传统人工建模。
- 游戏开发原型:开发者输入自然语言快速产出道具、场景白模,加速前期概念验证。
- AR/VR 内容创作:让非专业用户通过文本生成可用 3D 物体,降低创作门槛。
商业价值
核心价值在降本与体验提升:
- 推理时间从 25.71 秒 降至 4.99 秒,同等硬件下吞吐量提升约 5 倍,大幅降低 GPU 消耗与等待成本。
- 近实时的生成体验能改善用户留存,尤其适合交互式产品(如在线 3D 编辑器、AI 设计助手)。
- 置信度引导的块内修正保证几何质量不下降,避免为速度牺牲可用性,降低返工率。
与现有工作流的接口
Block3D 采用块级扩散解码,天然兼容现有 transformer 推理栈:
- 论文提供前缀缓存 机制,可在自回归块间复用 attention 状态,适合集成到
vLLM或TensorRT-LLM等推理框架。 - 可作为现有 text-to-3D 系统(如
TRELLIS)的解码器插件,替换原 AR 解码部分,无需重训上游文本编码器。 - 支持单步模型 rollout 与 残差目标 训练,便于与蒸馏、量化等模型压缩技术协同。
具体应用案例
- 电商平台 3D 商品生成:用户搜索“简约木质椅子”,系统在 5 秒内返回可旋转预览的 3D 模型,用于商品详情页,减少拍摄与建模成本。
- 游戏 UGC 平台:玩家输入“未来风格悬浮摩托”,实时生成低模资产并导入游戏编辑器,丰富玩家创作生态。
局限
- **评估范围偏重几何**:论文主要验证几何保真度(geometry fidelity),对纹理、材质等外观属性未做深入评估。text-to-3D 应用中外观质量同样关键,块级扩散在形状 token 上的性能不一定迁移到颜色/纹理 token,限制了整体生成效果的全面性。
- **依赖离散 tokenizer**:方法建立在 TRELLIS 的离散形状表示之上,tokenizer 的重建误差会直接传递给生成器。实验仅在 TRELLIS-500K 的留出集上测试,跨数据集、跨类别的泛化能力尚未验证,可能对分布外文本或复杂形状表现不佳。
- **自回归块间依赖与超参数敏感性**:虽然置信度校正缓解了误差累积,但块与块之间仍按顺序生成,后续块无法修正前面块的全局不一致。此外,块大小与去噪步数需要手动调节,不同配置对速度-质量权衡影响较大,增加了部署时的调参成本。