MegaParts: 通过 token 高效自回归建模将部件感知的 3D 物体生成扩展到 300 个部件
部件感知的 3D 物体生成对可控建模、编辑和关节动画等图形应用至关重要,其中物体被表示为语义部件的连贯装配。然而,现有部件感知生成方法难以扩展到高度复杂的物体:随着部件数量增加,生成精细几何所需的 token 长度和内存开销变得难以承受。 我们提出 MegaParts,一种可扩展的自回归 3D 生成框架,通过结合结构化序列建模与 token 高效的矢量量化形状 tokenizer 来解决这一挑战。该 tokenizer 学习部件级几何的离散潜在表示,在保证高保真重建的前提下最小化 token 使用量,从而实现基于几何复杂度的自适应长度 tokenization。在此紧凑表示之上,我们训练一个大语言模型,在统一的结构化序列中生成物体边界框、部件边界框和部件形状 token。结合高效的长上下文训练策略,我们的 token 高效公式可扩展至多达 300 个部件、序列长度达 256k token 的物体,大幅拓展了部件感知 3D 生成的范围,同时保留组合结构并支持细粒度部件级控制。 实验表明,MegaParts 在网格质量上优于基线自回归和扩散模型,证明压缩的离散部件 token 不仅提升了可扩展性,也提升了生成几何的保真度。这些结果提示,对于大规模部件感知 3D 生成,LLM 原生的 token 高效自回归建模是扩散模型的强有力替代方案。
论文精读
TL;DR MegaParts 用 token 高效的 VQ-VAE 形状 tokenizer 配合结构化自回归建模,将部件感知 3D 生成扩展到 300 部件、256k 长序列,并保持可编辑结构与高保真细节,质量超过扩散基线。
问题
问题背景
Part-aware 3D 生成在可控建模、编辑与关节绑定等图形学应用中愈发关键,业界对结构化、可细粒度操控的资产生成需求持续上升。
现有方法局限
现有 part-aware 生成方法主要受限于 token 长度与显存:当部件数增加时,逐部件几何编码会产生冗长序列,导致训练和推理成本不可控。基于扩散的方法在组件级常需独立去噪或后拼装,难以保持全局一致性;基于自回归的方法虽然天然适合序列生成,但缺乏紧凑部件离散表示,通常采用高分辨率 UV 或点云 token,数百部件时序列长度可达数百万 token,无法实际训练。此外,固定长度 tokenization 对简单部件过度编码、对复杂部件欠编码,造成重建质量与效率失衡。
为什么这个问题难/重要
难点在于需要同时满足三点:
- 组合结构保留:部件语义与空间关系必须可解析、可编辑;
- 高保真几何重建:压缩率提高不能牺牲 SDF/网格质量;
- 长序列可训练性:300 部件、256k token 序列需高效 attention 与显存管理。 业界对复杂 CAD、可动资产、程序化场景的需求增加,而 LLM 原生序列建模能否替代扩散成为大规模 3D 生成范式,是当前技术热点。
行业类比
类似 LLM 代码生成:若每个 AST 节点用冗长文本表示,长函数或大模块生成会因 token 爆炸和结构漂移而失效;通过紧凑结构化 token 与语法约束,才能扩展到大型代码库生成。
核心洞察
- MegaParts 的核心在于通过 rate–distortion 优化的自适应长度 tokenization,将 part-level 几何压缩为与复杂度成比例的离散 token,而非对所有部件分配固定长度。这一策略直接打破了现有 VQ-VAE 或扩散模型在复杂物体生成中 token 长度与内存随部件数线性爆炸的瓶颈,使得 300 个部件的序列长度仍可保持在 256k 以内,同时保持高保真重建。相比于逐点或固定网格 token 化,该方案将有限的 token 预算优先分配给几何复杂的部件,从源头上提升了长序列自回归建模的可行性。
- MegaParts 采用统一的结构化自回归序列,依次生成 object bbox、part bbox、part shape tokens,将粗粒度布局与细粒度形状统一到同一个 LLM 生成范式下。与扩散模型在连续空间进行全局去噪、或以往自回归方法仅生成整体形状不同,这种显式的层级序列保留了组合结构,使模型能够实现精确的 part-level 控制和编辑。同时,长上下文训练策略让 LLM 能直接处理 256k token 的序列,无需多阶段级联或外部优化,证明 token-efficient AR 可作为大规模 part-aware 生成的替代扩散方案。
方法
输入与表示
MegaParts 将部件感知 3D 生成建模为结构化自回归序列。输入为形状级条件(如文本提示或对象包围盒),序列按层级展开:对象包围盒 → 各部件包围盒 → 各部件形状 token。每个部件的几何由 Token-Efficient VQ-VAE 压缩为极少量离散 token。
关键模块
- 因果自编码器 用于有符号距离场(SDF)建模,将部件级几何表示为离散潜在向量,并通过率失真优化自适应决定 token 长度:几何复杂的部件分配更多 token,简单部件则更少,在重建保真度与序列紧凑性之间取得平衡。
- VQ-VAE 分阶段优化 稳定训练过程,避免码本坍塌。
- LLM 骨干 在统一的结构化序列上训练,依次预测包围盒与离散形状 token;配合高效长上下文训练策略,可处理最多 300 个部件、序列长度达 256k token 的样本。
输出与重建
LLM 生成完整结构化序列后,VQ 解码器重建各部件 SDF 并融合为带语义部件边界的网格,支持部件级编辑与关节资产创建。
相比扩散模型和直接 token 化全局形状的方法,MegaParts 通过部件级 token 压缩与自适应长度表示,在序列长度和内存受限时仍能扩展到高部件数量,同时提升可生成的几何保真度。
实验
实验设计
MegaParts 将部件感知 3D 生成拆成两阶段:先训练 token-efficient VQ-VAE 学习部件级几何的离散隐表示,通过 rate–distortion optimization 实现自适应长度 tokenization;再基于结构化序列训练 LLM,统一生成物体包围盒、部件包围盒与部件形状 token。训练使用长上下文策略,序列长度最高可达 256k tokens,支持对象包含 300 个部件。评估覆盖 VQ-VAE 重建质量与生成模型的网格保真度,并与自回归基线、扩散模型对比。
关键发现
- 压缩后的部件 token 不但提升了可扩展性,还带来更高网格质量,说明 token-efficient 表示本身有助于保真度。
- 在相同高部件数场景下,自回归基线与扩散模型面临 token 长度和内存瓶颈,而 MegaParts 能保持组合结构并支持细粒度部件级控制。
- 自适应 tokenization 按几何复杂度分配 token,类似 rate–distortion tradeoff,工程上可去除冗余 token,降低长序列训练成本。
与基线对比的深度解读
扩散模型在高部件 3D 生成中常因 token 序列过长导致显存与推理效率受限,MegaParts 用 LLM 原生 token-efficient 自回归建模 给出了一条替代路径:通过控制离散隐空间的信息密度,在序列长度暴涨前压缩每个部件所需 token,从而让 LLM 能够处理更多部件。这一思路对工程落地有直接启示——当部件数量成为扩展瓶颈时,优化 tokenizer 的 rate–distortion 比继续堆训练算力更有效。
行业影响
落地场景
- 数字内容与游戏开发:MegaParts 可生成高达 300 个部件的复杂组件化物体,适合游戏内可交互资产(如车辆、机械装置、武器),支持后续部件级编辑与 articulation 设定。
- 电商 3D 商品展示:家具、电子产品等商品通常由多个可动部件构成(如抽屉、铰链、接口)。生成式 part-aware 模型能根据文本描述直接产出可拆分、可动画的商品模型,提升用户在线查看与配置体验。
- 机器人仿真与数字孪生:作为结构化 3D 资产的自动生成工具,可快速构建带语义部件划分的物体库,用于任务规划与仿真环境搭建。
商业价值
- 降本:替代手工建模与部件标注,大幅缩短复杂 3D 资产制作周期,减少美术外包与人工成本。
- 增收与体验提升:提供部件级可控生成能力,使内容平台能推出“可定制 3D 物体”服务,提高用户参与度与转化率;生成的资产可直接用于交互式广告、VR/AR 展示,提升商品表现力。
与现有产品/工作流的接口
- 集成方式:以 文本/边界框到 3D 部件序列 的形式输出,可通过 API 接入现有的 3D 建模软件(Blender、Maya)、游戏引擎(Unity、Unreal)或云端资产管线。
- 与现有 AR/扩散生成管线互补:MegaParts 采用 token-efficient autoregressive VQ-VAE,可直接替换现有 3D 生成模块中的扩散组件,同时保留部件序列的结构化输出,便于与 LLM 驱动的多模态系统(如文本理解、任务规划)协同。
- 数据格式建议:输出可转换为常用的
glTF/USD格式,方便下游动画与物理仿真。
具体落地 use case:电商平台上家具 3D 展示(如一张带多个抽屉和柜门的柜子),用户可实时调整部件位置与开合状态;游戏开发中生成模块化武器或载具,供玩家自定义配件,无需重新建模。
局限
- - **数据依赖与标注成本**。MegaParts 的训练依赖大量带有精确 part 级语义标注和 bounding box 的 3D 模型数据(见论文 A.2 Data Collection and Processing),这类数据获取成本高,且现有公开数据集覆盖的物体类别和复杂度有限。对于未见过的类别或开放式生成任务,模型可能需要额外收集和标注数据,否则泛化能力受限。与直接使用形状编码的生成方法相比,part 级标注进一步加重了数据准备负担,限制了方法的即时可扩展性。
- - **几何重建的有损压缩瓶颈**。虽然 token-efficient VQ-VAE 通过自适应长度 tokenization 减少 token 使用,但离散潜在表示本质上是有损压缩,尤其对于高曲率、薄壁或精细拓扑结构,可能丢失重要几何细节。论文评估侧重于整体网格质量(如 Chamfer Distance 等),但对局部细节的保真度未做深入分析。与隐式神经表示(如 SDF 直接回归)相比,这种离散化可能限制其在需要微米级精度的工业设计或医学建模等场景中的应用。
- - **长序列训练与推理的资源需求**。将对象分解为最多 300 个 parts 并生成长达 256k 的序列,虽然 token 数量减少,但序列长度仍远超常规 LLM 训练长度,需要定制化的长上下文训练策略(如 flash attention 变体或序列并行),这大幅增加了训练成本。同时,推理时自回归生成 256k token 序列的时间延迟可能难以满足交互式应用需求,且 batch 推理效率较低。论文未讨论在生产环境中的实际推理吞吐和延迟,这可能阻碍其部署。
- - **泛化到非结构化或高可变拓扑的局限性**。方法假设物体可表示为 parts 的层次结构,每个 part 有独立 bounding box 和几何 token。对于具有连续变形、非模块化结构或流体形态的物体(如布料、烟雾、有机体),这种结构化表示可能不适用,限制了方法的应用范围。论文主要评估了机械类、家具类等强 part 结构的物体,未验证在更广泛形状类别上的有效性。