论文

PolyFlow: 连续拓扑嵌入流匹配用于艺术家风格网格生成

PolyFlow: 连续拓扑嵌入流匹配用于艺术家风格网格生成

高质量网格生成长期被自回归Transformer主导,它们能生成媲美艺术家的拓扑结构,但顺序解码导致计算开销巨大,比并行生成模型慢数个数量级。另一方面,连续扩散和流匹配方法虽支持多种领域的高效并行合成,却无法直接应用于网格:网格连接关系本质上是离散的,与标准连续噪声注入和去噪操作不兼容。 为解决这一根本冲突,我们引入紧凑拓扑嵌入器,将离散的网格顶点位置和法线投影为连续的逐顶点嵌入,通过时空距离阈值可忠实恢复原始离散邻接信息。预训练并冻结该嵌入器后,任何原始网格都可完全转换为连续的逐顶点状态空间,统一了位置、法线和隐式拓扑属性。基于此新型连续网格表示,我们提出PolyFlow,一个基于Transformer的流匹配框架,在提取的点云特征条件下实现完全并行的顶点状态去噪。推理时,模型通过ODE求解器快速完成生成,并支持通过直接指定目标顶点数来精确控制输出网格分辨率。 在Toys4K基准上的广泛评估表明,PolyFlow在Chamfer距离和Hausdorff距离上均超越了最先进的自回归基线。

论文精读

TL;DR PolyFlow 将离散网格拓扑编码为连续嵌入,结合 flow-matching 实现并行网格生成,速度远超自回归方法,且支持精确顶点数控制,在 Toys4K 上取得 SOTA。

问题

问题背景

在游戏、影视和仿真工业中,艺术家风格的高质量网格拓扑 是制作可渲染 3D 资产的基石。当前该领域高度关注如何自动生成 既有紧凑拓扑,又能保留锐利特征和可控顶点数 的网格模型。

现有方法局限

自回归 Transformer(如 PolyGen、MeshGPT)通过顺序预测顶点和面序列生成网格,能产出艺术家认可的 拓扑品质,但其 逐 token 解码 导致推理速度比并行模型慢数个量级,难以满足交互式或大规模生成需求。
另一条技术路线是 连续生成模型(扩散、流匹配),已在图像、点云等连续域验证了高效并行的合成能力。然而,网格的 离散拓扑连接 无法直接融入标准的高斯噪声注入与去噪流程——在连续坐标空间中添加扰动会 彻底破坏边、面等离散结构,因此这类方法大多只能输出点云或隐式表面,而非可编辑的网格。

为什么问题难且重要

核心挑战在于 网格本质上是离散拓扑信息与连续几何信息的耦合体:既要并行建模以提升效率,又必须保证最终提取的边和面构成合法的流形网格。此前尚未出现一种 统一的连续表示,能在连续空间编码拓扑关系,并能在逆向过程中无损解码回离散连接。工业界对 高质量 3D 资产 的需求与日俱增(如程序化生成场景、用户自定义建模),使这一矛盾成为必须攻克的技术瓶颈。

行业类比

这类似于 非自回归文本生成 的困境:并行解码速度虽快,却难以直接保证语法合法性;而 PolyFlow 提出了一种“连续编码离散约束”的思路,可类比于用连续隐变量约束句法树生成的语言模型。

核心洞察

  • **连续拓扑嵌入解耦拓扑与几何,使流匹配并行生成可直接用于高质量网格。** 自回归 Transformer 虽能生成艺术家级的网格拓扑,但顺序解码慢;扩散和流匹配并行高效,却因网格连接性的离散性无法直接应用。PolyFlow 通过拓扑嵌入器将离散的顶点邻接关系压缩到连续隐空间,并借助时空距离阈值重建边缘,从而将网格完全转化为连续的每顶点状态。这使 Transformer 流匹配模型能够并行去噪所有顶点,同时以点云特征为条件,既保留了自回归方法的拓扑质量,又获得了并行生成的速度优势。
  • **显式顶点计数控制赋予并行网格生成灵活的分辨率调节能力。** 自回归方法生成网格时顶点数不可预测,难以满足不同细节层次(LOD)的需求。PolyFlow 由于并行生成所有顶点,在推理时可以直接指定目标顶点数,结合 ODE 求解器一步或几步完成生成,实现了精确的网格复杂度控制。相比其他连续生成 3D 形状的方法(如隐式场或点云扩散),该能力为实际内容生产提供了更直接的艺术创作接口,且不影响生成质量。

方法

核心思路

PolyFlow 的核心在于将离散的网格拓扑结构连续化,从而让原本只能处理连续数据的 Flow Matching 范式能够直接生成带拓扑的 artist-style 网格。该方法分为两个阶段:拓扑嵌入器预训练流匹配生成模型训练

拓扑嵌入器:离散 → 连续的桥梁

  • 输入:原始网格的顶点坐标 (x,y,z) 与顶点法线。
  • 关键模块:一个轻量网络(embedder),将每个顶点的坐标与法线映射到高维连续嵌入向量,使得嵌入间的时空距离(spacetime distance)能够编码拓扑邻接关系。
  • 训练目标边缘重建损失(edge reconstruction loss)——若两顶点在原始网格中有边,则迫使它们的嵌入距离小于某个阈值;否则大于该阈值。训练后该嵌入器被冻结。
  • 输出:任意原始网格被转化为统一的连续顶点状态,每个顶点包含显式的位置、法线以及隐含的拓扑嵌入,将离散的连通性信息融入了连续表征。

流匹配生成模型:并行去噪

  • 输入:从点云提取的特征(作为条件)以及带噪声的连续顶点状态(包含位置、法线、拓扑嵌入)。
  • 关键模块:基于 Transformer速度预测器,对全部顶点状态进行全并行去噪,预测从噪声到目标状态的流速度场。
  • 训练策略:在连续的“联合流状态”空间上训练 Flow Matching,损失为预测速度与真实速度的 MSE。
  • 推理效率:通过 ODE 求解器快速完成生成,且可直接指定目标顶点数来显式控制输出网格分辨率。

输出与后处理:从连续到离散

生成连续顶点状态后,通过以下步骤恢复网格:

  1. 边解码:根据时空距离阈值从嵌入中重建顶点间的连接关系。
  2. 面提取:从重建的边图中提取三角形面。
  3. 法线引导的缠绕修正:确保所有面的法线方向一致(normal-guided winding correction)。

方法差异化

与自回归 Transformer(如 MeshGPT)逐 token 解码、速度慢的本质不同,PolyFlow 通过连续拓扑嵌入将离散的网格生成转化为全并行连续状态生成,在保持高拓扑质量的同时,推理速度提升数个量级,并为扩散/流匹配家族在 3D 网格生成领域开辟了可行路径。

实验

实验设计

  • 数据集:采用 Toys4K 基准,包含艺术家创建的多样化多边形网格,涵盖不同拓扑与几何复杂度。
  • 评估指标Chamfer Distance (CD)Hausdorff Distance (HD) 衡量生成网格与真实网格的几何相似性;同时记录推理时间。
  • 基线方法:与当前最优的自回归 Transformer 网格生成模型(如 MeshGPT)对比。
  • 训练流程:第一阶段单独训练拓扑嵌入器 (Topology Embedder) 直至收敛并冻结;第二阶段基于冻结的嵌入器,以连续顶点状态训练流匹配模型 (Flow Model)。推理时通过 ODE 求解器并行生成。

关键发现

  • 几何质量领先:PolyFlow 在 CD 和 HD 上均超越自回归基线,证明连续流匹配能够生成高保真网格。
  • 推理速度数量级提升:并行解码机制消除了顺序依赖,推理速度显著快于自回归方法。
  • 分辨率精确可控:可直接指定目标顶点数,灵活平衡细节与效率,增强实用部署能力。
  • 拓扑嵌入有效性:通过时空距离阈值可恢复原始邻接关系,验证了连续状态空间对离散拓扑的忠实编码。

与基线对比的深度解读

  • 自回归模型受限于逐 token 生成,推理耗时且无法并行;PolyFlow 将网格生成转化为连续状态去噪,使并行扩散成为可能,从根本上提升了效率。
  • 传统扩散方法无法直接应用于网格是因为连通性不可微。引入拓扑嵌入器巧妙地将离散拓扑隐式编码到每个顶点的连续嵌入中,使得标准流匹配框架得以无缝接入,是该工作的核心贡献。
  • 与单纯生成点云再重建网格的后处理方案不同,PolyFlow 直接从连续状态恢复拓扑,保留了艺术家风格的多边形边面特征,在游戏、影视等对网格质量要求苛刻的领域更具价值。

行业影响

落地场景

PolyFlow 为高质量三维网格生成提供了并行生成分辨率可控的能力,特别适用于需要快速产出、拓扑良好、且支持后处理的标准网格(artist-style mesh)的场景:

  • 电商商品展示:批量生成商品三维模型,支持从稀疏点云(如手机扫描)到带拓扑的网格,用于 AR 试穿/试戴、WebGL 商品展示。
  • 影视/游戏资产辅助:概念设计阶段快速生成大量道具/角色网格,直接进入传统管线进行编辑或细节雕刻。
  • 三维内容平台:用户上传草图或点云,云端即时生成可直用的 mesh,降低 UGC 三维内容门槛。

商业价值

  • 降本:将原本需要数小时的人工拓扑构建压缩到秒级,显著减少艺术家的重复劳动;推理速度比自回归方法(如 MeshGPT)快几个数量级,降低云端推理成本。
  • 增收/体验提升:快速生成能力支持实时交互式设计,在电商等场景中提升用户转化率;直接输出可编辑的四边形/三角形网格,避免后处理损失,加速下游应用开发。
  • 技术护城河:连续拓扑嵌入+流匹配的框架为工业级 mesh 生成建立了新基座,具有良好的扩展性(如支持不同顶点数、可控生成)。

与现有产品/工作流的接口

PolyFlow 生成的网格可直接导入主流 DCC 工具(Blender, Maya, Unreal Engine),因其拓扑结构符合艺术家习惯,且支持法线引导的 winding 校正,减少了手动清理工作。

  • 推理服务:可作为微服务部署,输入为点云或隐式特征,输出为 .obj.glb,无缝接入现有 3D 内容生产管线。
  • 形态控制:通过直接指定目标顶点数,能与 LOD(细节层次)生成流程结合,按需输出不同精度的网格。
  • 特征条件:流模型基于提取的点云特征进行条件生成,可与其他感知模块(如 NeRF、深度估计)串联,形成从现实世界到网格的自动化流水线。

具体落地 Use Case

  1. 电商 AR 试穿:用户使用普通手机旋转拍摄鞋子/帽子,云端通过 PolyFlow 在 2-3 秒内生成带拓扑的网格,直接用于 AR 预览。相比传统流程(拍照→人工建模→上传),时效从天级降至分钟级,成本大幅降低。
  2. 游戏原型快速迭代:策划输入一张概念图或简单体素模型,系统提取点云后通过 PolyFlow 生成多种分辨率的网格原型,美术在此基础上精修,缩短从概念到可玩资产的时间,加速小团队内容创作。

局限

  • **拓扑嵌入器的泛化性**:拓扑嵌入器在特定数据集(如 Toys4K)上学习将顶点位置和法线投影到连续空间,并通过时空距离阈值恢复离散连接性。该阈值高度依赖训练数据的拓扑分布,对于与训练集风格差异较大的网格(如高曲率区域、非流形边或异形拓扑),嵌入器可能无法准确重建邻接关系,导致生成网格出现非流形面、法线翻转或孔洞。此外,嵌入器一旦冻结,无法在线适应新的拓扑模式,限制了框架在开放类别或复杂场景下的扩展性。
  • **两阶段训练与后处理的复杂性**:方法需要先训练并冻结拓扑嵌入器,再训练流匹配模型,显著增加了训练流程的工程复杂度和调参成本。若嵌入器未充分收敛,下游流模型难以弥补表示缺陷。推理时还需显式执行边解码、面提取和基于法线引导的绕组校正(winding correction),这些后处理步骤可能成为新的瓶颈,并引入超参数(如绕组校正阈值),削弱了并行生成带来的效率优势。
  • **评估指标与用户感知的局限性**:论文以 Chamfer Distance 和 Hausdorff Distance 作为主要定量指标,虽然这些指标能反映点云层面的几何相似度,但无法充分衡量网格拓扑的正确性、流形性以及艺术家风格的质量。缺乏用户调研或拓扑专项指标(如非流形边数量、面片规整度),可能掩盖生成网格在真实生产流程中的不足。此外,仅在 Toys4K 单一数据集上验证,对更复杂形状的网格(如人体、建筑)的适用性仍存疑。
论文Chunshi Wang2026-06-25原文

相关内容