LATO.2: 分解式3D网格生成,结合顶点流与拓扑流
近年来,在精心设计的潜在表示上进行流匹配已成为拓扑感知网格生成的一种强大范式。然而,现有方法将顶点与连通性联合建模在同一个潜在空间中,导致连续的顶点几何与离散的组合结构纠缠在一起,这不仅使流学习复杂化,还表现为顶点漂移和表面断裂。 我们提出LATO.2,一个分解式流匹配框架,它将网格生成分解为两个阶段:首先进行顶点流,然后在已生成的顶点条件下进行连通性流,两个阶段都锚定在一个共享的粗体素支架上。专门的VAEs分别支撑两个阶段,以亚体素精度恢复顶点,并将离散的连通性嵌入到连续的潜在空间中。 我们展示了这种分解独有的两个优势: 1. 分部件生成 — 将体素支架划分,每个部件以完整的潜在容量合成,从而产生比单一潜在表示更高分辨率的网格; 2. 拓扑自适应编辑 — 操控第一阶段的顶点会自动产生对应的连通性,无需重新优化。 实验表明,LATO.2在几何保真度和连通性质量上超越了当前最先进的拓扑感知网格生成方法。
论文精读
TL;DR LATO.2 将网格生成分解为顶点流与条件连接流,解耦几何与拓扑,实现部件级生成和拓扑自适应编辑,兼顾高保真度与规整结构。
问题
问题背景
3D 内容生成正从拓扑无关的粗粒度几何走向拓扑感知的 mesh 生成,追求顶点布局与面片连接均符合艺术创作标准的结构化网格,以支撑动画绑定、高品质渲染等生产管线需求。
现有方法局限
近期基于 Flow Matching 的拓扑感知方法(如 LATO)将顶点几何与离散连接编码到同一连续潜空间内联合建模。这种耦合带来两个关键局限:
- 漂移顶点与破损表面:连续顶点坐标与离散拓扑的组合特性差异大,单一流模型难以平衡二者的动力学,生成结果易出现顶点位置错乱、面片断裂。
- 容量瓶颈:整体潜变量受限于固定维度,无法在不重新训练的前提下生成更高分辨率的部件级细节,限制了单个模型的表达上限。
为什么这个问题难/重要
顶点的微调与拓扑的重组本质是不同模态的信号,前者是光滑的欧氏空间偏移,后者是离散的图结构采样。将它们解耦为条件生成虽天然合理,却面临两大技术挑战:
- 如何将离散拓扑嵌入连续空间并保持可逆性,以兼容 Flow Matching 的训练范式;
- 如何建立两个阶段的信息桥梁,使第一阶段生成的顶点能可靠地诱导出第二阶段的高质量拓扑,而非仅仅事后拼合。 业界对高质量、可编辑 mesh 的需求持续上升,尤其在数字人、影视资产、工业仿真等领域,拓扑可控已成为生成内容从预览走向资产级应用的门槛。
行业类比
这种“先锚定几何骨架、再生成连接关系”的分阶段策略,类似于 3D 人体重建中先拟合参数化模型(如 SMPL)再回归非刚性变形的思路——用易控的中间表征为下游高复杂度生成提供条件,降低直接端到端建模的难度。
核心洞察
- 因式分解流匹配框架将网格生成解耦为顶点生成和拓扑生成两个条件化阶段,有效规避了连续几何与离散拓扑纠缠导致的顶点漂移与破损曲面。与现有联合潜空间方法(如MeshGPT、PolyDiff)相比,LATO.2 通过专用 VAE 分别恢复亚体素精度顶点和嵌入连续拓扑潜变量,并以共享粗体素支架为锚点,使顶点流与拓扑流的学习难度显著降低,从而在几何保真度和连通性质量上同时超越先前最佳水平。
- 解耦设计不仅提升生成质量,更直接解锁部件级生成和顶点诱导的自适应编辑。部件级生成通过分割体素支架并分别以完整潜容量生成各局部,突破了整体潜空间分辨率瓶颈,可产出远高于单一潜表示的精细网格;拓扑自适应编辑则允许操纵首阶段顶点后,无需重优化即可自动生成相应连通性,为生产管线中快速拓扑调整提供了全新范式。
方法
整体管线
输入为预定义的粗体素骨架(voxel scaffold),它承载形状的宏观拓扑结构。方法将网格生成分解为顺序的两个阶段:
- 顶点流(vertex flow):从高斯噪声出发,在顶点 VAE 的连续潜空间上执行流匹配,生成顶点的潜编码,再通过解码器恢复出亚体素精度的顶点坐标。顶点流始终以体素骨架为条件,使顶点分布与全局形状对齐。
- 拓扑流(topology flow):在已生成的顶点集确定后,在拓扑 VAE 的潜空间中再次进行流匹配,生成面的连接关系潜码,解码得到离散的面索引。此阶段以体素骨架及已生成的顶点为条件,确保连接性与几何表面一致。
关键模块
- 顶点 VAE:将可变数量的顶点坐标编码到连续潜空间,解码时能重建亚体素精度的空间位置,为顶点流提供平滑的生成目标。
- 拓扑 VAE:将离散的三角形面连接关系(拓扑)嵌入连续潜空间,使流匹配能够处理组合结构。
- 流匹配(flow matching):在两个阶段分别学习从噪声到目标分布的连续时间概率路径,比扩散模型在采样效率和生成质量上更具优势。
输出与扩展
最终输出为由顶点和面构成的结构化网格。因子化设计自然支持两种高级功能:
- 分部生成(part-wise generation):将体素骨架按语义切分,每部分独立以全量潜容量生成,再缝合,可获得远超整体潜空间所能容纳的高分辨率网格。
- 拓扑自适应编辑(topology-adaptive editing):直接操控第一阶段生成的顶点,拓扑流模型会根据新顶点自动推理出适配的连接关系,无需重新优化。
差异点:与先前的联合潜空间方法(如 LION、Hy3DGen)不同,LATO.2 将顶点几何与拓扑连接性显式解耦,避免了连续/离散信息纠缠导致的优化困难与表面破损。
实验
实验设计概述
论文在标准 3D 形状数据集上评估 LATO.2 的网格生成能力,重点对比现有拓扑感知生成方法(如基于联合隐空间的流匹配模型)。实验从几何保真度与拓扑质量两个维度展开:几何指标包括倒角距离(Chamfer Distance)、法线一致性等;拓扑指标关注非流形边、自相交面等不规范结构的比例。定性分析通过可视化生成网格的顶点分布与面连通性,以及部分生成、编辑任务的效果。
关键发现
顶点-拓扑分离建模显著改善了网格的结构完整性。因子化的两阶段流匹配使顶点位置更贴合几何表面(减少漂移),同时根据顶点自适应生成的拓扑更整洁、规律,很少出现破面或缠绕。基于共享体素骨架的部分生成策略,通过分区合成再合并,突破了单一隐空间对分辨率的限制,生成了具有更高顶点数和更精细几何细节的网格。此外,拓扑自适应编辑在修改顶点后可直接得到相应的拓扑更新,无需重新优化,极大提升了交互式建模的效率。
与基线方法的深度对比
相较于联合建模顶点的MeshGPT、PolyGen 等方法,LATO.2 通过显式解耦连续几何与离散组合结构,降低了流模型的学习难度,因此在几何精确度(更低的 Chamfer 距离)和拓扑规范性(更少的非流形边)上均有明显优势。现有方法常因两个模态的纠缠导致生成网格出现漂浮顶点或连通性错误,而 LATO.2 借助条件化的第二阶段拓扑流,确保了拓扑对顶点几何的忠实跟随。在相同显存和推理开销下,因子化框架生成的网格面数可达基线的数倍,且质量无损,体现了工程上更好的伸缩性。
行业影响
落地场景
LATO.2 的 因子化网格生成 直接服务于对拓扑质量有严格要求的 3D 内容生产场景:
- 影视与游戏资产管线:角色、道具等需要干净四边形网格以支持蒙皮、变形动画和细分曲面。
- 电商与虚拟展示:商品 3D 模型生成后需快速编辑拓扑以适应不同材质、光照,LATO.2 的 零件级生成 可提升高精细度模型产出效率。
- AR/VR 与数字孪生:实时渲染要求网格拓扑规整、顶点数可控,框架的 顶点数可控性 允许根据 LOD 需求直接生成。
- 工业设计与仿真:CAD 模型往往需要结构化拓扑,拓扑自适应编辑 使修改几何后自动重连面片成为可能。
商业价值
- 降本增效:将传统手动拓扑重建(通常占建模 30%–50% 工时)替换为自动化流程,大幅缩短生产周期。生成结果可直接进入绑定与动画环节,减少返工。
- 质量与体验提升:相比现有拓扑感知方法,LATO.2 的几何保真度更高、表面破损更少,能产出更接近艺术家手工要求的干净网格,提升最终渲染品质。
- 灵活编辑能力:拓扑自适应编辑 允许设计师仅调整顶点位置即可自动衍生新的连接,无需重新训练或优化,降低修改成本。
与现有工作流的接口
- 集成方式:可作为 Blender/Maya 插件或独立服务,接收粗体素支架(来自体积生成模型如 Instant3D 或手工粗模)和条件(如文本、图像),输出生成网格。
- 向下兼容:输出的网格是标准
obj/fbx格式,可直接导入引擎(Unity/Unreal)、渲染器或后续细化工具(如 QuadriFlow)。 - 与现有 AI 管线结合:可嵌入已成熟的 3D 生成堆栈(如 Meshy 或 Rodin),替换拓扑不可控的后处理步骤,提升端到端交付物的工程可用性。
典型用例
- 电商 3D 商品生成:某家居平台需要批量生成高保真椅子模型。先通过多视图重建得到粗糙体素支架,LATO.2 生成顶点后,椅子扶手、腿等零件分别以全容量生成,自动拼接为精细网格,直接用于交互式 Web 渲染。
- 游戏角色快速迭代:原画师提供新角色概念,3D 组长用粗模快速搭建支架,LATO.2 生成网格后,拓扑自适应编辑 可拖动顶点调整体型,面部连接自动更新,无需重拓扑即完成一轮迭代。
局限
- **体素支架的形状约束**:方法依赖粗糙的体素支架作为两阶段生成的锚点,这在一定程度上限制了生成形状的自由度,难以产生具有尖锐特征或薄壁结构的模型。当目标形状与初始支架拓扑差异较大时,顶点流可能难以补偿这种结构性偏差,导致几何细节丢失或拓扑不一致。
- **分阶段生成的误差累积**:顶点生成阶段的小误差可能被后续条件化的拓扑流放大,例如顶点位置的微小偏移可能导致面片连接出现非流形或自交。两阶段串行设计缺乏全局纠错机制,尤其在部分生成场景中,各块之间的边界连续性难以保证,可能产生视觉接缝或拓扑缝隙。
- **拓扑自适应编辑的局限性**:论文展示的顶点诱导拓扑更新仅在一定范围的连续形变内有效,对于大幅度结构改变(如增加孔洞、改变连通性)仍需重新生成或额外的拓扑合理性约束。此外,编辑操作仅限于顶点级几何修改,未能支持更高层次的结构编辑(如添加零部件、改变部件间连接关系)。