KaiNinja: 将原生 3D 生成器扩展到部件级别
原生 3D 生成器 能把单张图像转成一个网格。TRELLIS.2 等模型可输出带材质的高保真非水密几何,但结果是单个融合物体,而编辑、绑定与仿真等下游任务都面向部件级资产。直接在其融合网格上跑 3D 分割网络虽然可行,却既慢又受限于分割精度。 真正的难点在于表示:O-Voxel 网格每个体素只存一张表面,因此无论分辨率多高,单一体积都无法表达两个部件相接触的界面。作者提出 双体积表示 来解决该问题,并给出 KaiNinja,即基于 O-Voxel 双体积形式的 TRELLIS.2 部件级扩展。它保留了 TRELLIS.2 的生成速度与质量,把能力延伸到部件级,且流程中不含任何 mask 或分割器。 其训练数据来源多样,包括 CAD 模型以及由 LLM 驱动 agent 创作的资产;据作者所知,这是首个在 agent 创作的部件数据上训练的 3D 生成模型。出乎意料的是,相较同一骨干在相同数据上微调,它的整体物体保真度还有提升。与其他范式的部件生成流程相比,它把整体 Chamfer distance 降低 40%,严格部件 F-score 提升 16%。
论文精读
TL;DR KaiNinja 将 TRELLIS.2 原生 3D 生成器扩展到部件级,通过双体积 O-Voxel 表示解决部件接触界面冲突,无需分割器即可输出可编辑的部件资产,并提升整体与部件质量。
问题
问题背景
Native image-to-3D 生成是当前 3D 内容创建的热点方向,旨在从单张图像直接恢复可用的三维网格。
现有方法局限
TRELLIS.2 等 native 3D generator 虽然能输出高保真、带材质的非水密网格,但产出是 单一融合对象,缺乏部件级结构,无法直接用于编辑、装配或仿真。常规补救方式是先在融合网格上运行 3D 分割网络,但这种管线存在两个瓶颈:一是额外推理耗时,二是分割精度直接决定最终部件质量,尤其在不同部件紧密接触区域,分割网络往往失效。更本质的问题是:TRELLIS.2 依赖的 O-Voxel 表示 每个 voxel 只能存储一层表面,因此单个 volume 无法表达两个部件共享同一 voxel 的接触界面,即使提高分辨率也无济于事。
为什么这个问题难/重要
要在保持生成速度和整体几何质量的前提下引入部件结构,需要从表示层面彻底改造,而非简单后处理。训练数据也构成瓶颈:带部件标注的高质量 3D 资产稀缺,而人工流水线昂贵。本文发现用 LLM 驱动 agent 创作的部件数据可以扩充训练集,这为后续研究提供了实用路线。Part-level 输出对下游工作流价值显著——rigging、simulation、程序化编辑都依赖清晰的部件边界,但多数现有生成器在该维度仍是空白。
行业类比
这与 text-to-image 中从生成整图到提供分层 PSD 的演进类似:生成器不仅要“画得像”,还要给出可独立操作的语义图层,才能进入实际生产管线。
核心洞察
- 双体积 O-Voxel 表示将部件接触界面的冲突转化为体积分配问题,使原生 3D 生成器无需任何分割网络即可直接输出部件级网格。O-Voxel 单体积每个体素只能存储一个表面片,无法表示两个部件在接触面上的共存表面;双体积将不同部件分配到两个独立体积,各自保留表面片,从而在任意分辨率下解析界面冲突。与“先融合生成、后分割”的管线相比,KaiNinja 避免了分割精度瓶颈与额外计算成本,同时保持 TRELLIS.2 的速度和生成质量,为部件级生成提供了一条更简洁、更鲁棒的路径。
- 利用 LLM 驱动代理创作的部件数据作为训练语料,使模型学习到结构化部件先验,并意外提升整体物体保真度。大多数部件级生成依赖人工标注或 CAD 模型,覆盖范围有限;KaiNinja 首次将代理创作的资产纳入训练,显著扩大部件多样性。实验显示,与同一 backbone 在同一数据集上微调相比,整体物体 Chamfer 距离降低 40%,严格部件 F-score 提高 16%,表明部件级监督信号反向强化了整体几何一致性——这为用部件粒度数据提升通用生成质量提供了新的训练范式。
方法
输入与核心表示
KaiNinja 接收单张 RGB 图像,无需 mask 或分割器,直接扩展原生 3D 生成器 TRELLIS.2 到部件级。关键创新是 dual-volume O-Voxel 表示:原始 O-Voxel 每个体素仅存一层表面 sheet,单个 volume 无法表示两个部件紧密接触的界面;KaiNinja 将部件分配到两个独立 volume,通过图着色解决分配冲突,使接触面两侧能分别编码,从而在任意分辨率下保留部件边界。
两阶段生成与训练
生成流程分为两个流:
- Stage 1 layout flow:生成粗粒度整体布局与部件分配,输出双 volume 的占有栅格。
- Stage 2 refinement flow:对布局进行几何与材质细化,恢复高频细节。
训练继承 TRELLIS.2 的 whole-object prior:先在整物体数据上 warm up,再在部件数据上 fine-tune;layout 流经过 fit、merge、warm up、fine-tune 阶段,refinement 流则 warm up + fine-tune。损失包含布局拟合、合并与 disjointness penalty,避免不同 volume 中同一部件重复出现。数据来自 CAD 模型与 LLM-driven agent authored assets,经质量过滤,使模型学到更广泛的部件结构。
推理输出
推理时后处理合并重复占用,从双 volume 提取各部件 mesh,输出带材质的 part-level 资产。
与分割后处理或独立部件生成方法不同,KaiNinja 在生成器内部用双体积原生编码部件,避免分割精度与速度瓶颈,并在保持 TRELLIS.2 质量的同时提升部件与整体一致性。
实验
实验设计
KaiNinja 以 TRELLIS.2 为骨干,在其 O-Voxel 表示上引入 dual-volume 形式,使每个 voxel 可表示两个部件表面,从而捕捉接触界面。训练分两个 stream/stage:layout flow 负责部件布局,refinement flow 提升细节;先继承 whole-object prior 再微调。数据来自 CAD 模型和 LLM 驱动 agent 生成的部件资产,经过质量过滤。推理时合并重复 occupancy 得到最终部件。
关键发现
- 对比不同范式的 part generation pipelines,KaiNinja 将 whole-object Chamfer distance 降低 40%,strict part F-score 提高 16%。
- 意外的是,在相同数据集上微调同一骨干,KaiNinja 的 whole-object fidelity 也优于仅做 whole-object 微调的版本。
- 消融验证 dual-volume 表示的必要性及 post-processing 的效果。
基线对比解读
传统方案先由 TRELLIS.2 生成融合网格,再用 3D 分割网络分离部件,速度慢且受分割精度限制。KaiNinja 直接生成 part-level 输出,无需 mask/segmenter,速度与质量保持 TRELLIS.2 水平。dual-volume 解决了单体积无法表示部件边界的根本缺陷,这是性能提升的关键。该工作首次将 agent-authored part data 用于训练 3D 生成模型,为数据稀缺场景提供新思路。
行业影响
落地场景
- 电商 3D 商品生成:输入单张商品图(如耳机、椅子),KaiNinja 可直接输出部件分离的 3D 模型(头梁、耳罩、支架),支持消费者交互查看部件细节与变体选择,无需人工建模或后期分割。
- 游戏 / 虚拟制作资产管线:从概念图生成可拆分的武器、载具、角色装备等,部件级模型可直接进入绑定、动画和物理仿真流程,减少手动拆分工作量。
- CAD 辅助设计:输入概念图生成带部件结构的原型,设计师可快速替换、调整单个部件进行迭代。
商业价值
- 降本:替代“生成整体网格 + 后处理分割”的慢速流程,推理速度与 TRELLIS.2 持平,免去训练专用分割网络或人工拆分,单位资产生产成本显著下降。
- 质量与体验提升:论文显示 whole-object Chamfer distance 降低 40%,strict part F-score 提升 16%,即整体与部件质量双升,减少返工;部件级模型支持交互展示和快速变体生成,提升用户体验与转化率。
- 增收机会:部件级资产可直接用于电商 3D 展示、游戏内可替换皮肤、AR 试装等增值服务,拓展商业模式。
与现有工作流接口
- 格式兼容:输出标准网格 + 材质,可直接导入 Blender / Unreal / Unity 等主流工具链。
- 模型集成:作为 TRELLIS.2 的扩展,可在现有图像到 3D 服务中无缝替换主干,无需额外 mask 或分割器;训练数据可混合 CAD 与 LLM agent 生成数据,利于快速构建 industrial 数据集。
- 部署建议:项目提供 GitHub 与 项目主页,便于封装为云 API 或本地推理服务。
具体落地 Use Case
- 电商 3D 商品生成:平台上传一张商品图,KaiNinja 生成部件分离的 3D 模型(如耳机分为头梁、耳罩、支架),支持消费者交互查看部件细节与变体选择,无需人工建模。
- 游戏 asset 管线:独立游戏团队从概念图快速生成可拆分的武器 / 载具模型,直接进入骨骼绑定与动画环节,缩短原型制作周期。
局限
- 论文承认与可推断的局限:KaiNinja 依赖 TRELLIS.2 的架构与预训练权重,其 part-level 能力受限于 backbone 对物体几何和材质的建模上限;dual-volume 表示通过图着色将 parts 分配到两个 volume,对于 parts 邻接图非 2-可着色的复杂拓扑(如多个 parts 相互接触形成奇数环)无法完美表示,可能需要拆分或合并 parts,导致部分结构化信息丢失。
- 可推断的局限:训练数据部分来自 LLM-driven agent 生成的资产,这类数据的质量与一致性可能低于人工标注或 CAD 数据,可能引入噪声或不符物理约束的 part 分解;文中未明确对任意数量 parts 的支持上限,实际生成时 parts 数量可能受限于训练分布,难以泛化到高 parts 数物体。
- 与同类工作对比:与显式使用 3D 分割网络的 pipeline 相比,KaiNinja 虽然避免了分割环节,但需要对 backbone 进行 fine-tune 并依赖 dual-volume 后处理,可能在某些类别上不如专门设计的 part-aware 生成器灵活;实验对比的 baselines 有限,且仅报告了 Chamfer distance 和 part F-score,缺少对 part 语义一致性、可编辑性等下游任务的评估。