论文

MeshFlow: 基于等变流匹配的网格生成

MeshFlow: 基于等变流匹配的网格生成

网格是常见的3D场景表示形式,但直接生成网格具有挑战性,因为其表示包含重要的对称性,包括面与顶点的排列不变性。MeshFlow 直接学习生成三角形网格(作为三角形 soup),避免了将网格序列化为长自回归序列的需求。 我们采用等变最优传输流匹配模型,该模型尊重三角形 soup 的关键对称性:面之间的任意排列以及每个面内顶点的排列。为此,我们对 Diffusion Transformer 架构提出了一种简单而有效的修改,得到一个可扩展的网络,能够在保持所需等变性的同时建模速度场。此外,我们引入了一种基于最优传输的训练目标,通过消除违反这些对称性的监督信号来改善收敛。 MeshFlow 实现了与最先进的自回归网格生成器相当的网格质量,同时在推理时提供了约 18 倍的加速。项目页面:https://qiisun.github.io/MeshFlow/。

论文精读

TL;DR MeshFlow 利用等变最优传输流匹配直接生成三角形网格,通过架构与损失函数设计保留排列对称性,推理速度比自回归方法快约 18 倍。

问题

问题背景

3D 内容生成正从点云、隐式表面向可直接用于渲染与物理仿真的网格(mesh) 迁移。网格因其紧凑性与广泛的下游工具链支持,成为实时图形、游戏、数字孪生等领域的首选表示。然而,直接生成高质量网格仍然困难,核心原因在于网格表示含有的对称性──尤其是面(face)的排列不变性以及每个面内顶点的排列不变性,使得标准生成模型难以直接建模。

现有方法的局限

主流的网格生成方法可归为两类,各有明显不足:

  1. 自回归序列建模:将网格序列化为长 token 序列(如 PolyGen、MeshGPT),虽能捕捉拓扑,但存在两个关键问题:
    • 序列化顺序破坏了顶点与面的排列不变性,模型被迫学习无序数据上的伪顺序,导致收敛困难与冗余建模。
    • 推理速度极慢,生成一个网格需数百甚至数千步自回归采样,单次生成耗时数十秒,难以满足交互式应用需求。
  2. 基于中间表示的扩散方法:先将网格转换为点云、隐式场或三平面等中间表示,再通过后处理重建网格。这种做法不仅引入额外的后处理误差,而且中间表示往往丢弃了网格的拓扑属性,导致生成网格易出现非流形边、自相交等问题。此外,现有扩散模型在建模网格时通常未显式设计等变层,对对称性的利用不充分,训练效率低。

难度与重要性

直接生成网格的难题在于,模型必须在无需离散化序列的前提下,同时保持面与顶点的排列等变性。这对网络架构设计提出了严格约束:所有操作必须对输入点的顺序无感,且输出的速度场(用于流匹配)也必须遵循相同的对称性。违反等变性会导致监督信号冲突,严重拖慢训练收敛。从工程角度,一个能原生保持这些对称性的流匹配模型,可以将连续归一化流的生成质量与高推理效率结合起来,对构建可交互的 3D 资产生成流水线至关重要。业界对实时 3D 内容生成的需求(如虚拟世界、AR/VR)进一步放大了该问题的价值。

行业类比

正如视觉生成领域中,卷积神经网络(CNN)的平移等变 性让图像生成模型能高效学习空间结构,网格生成中强制实现排列等变性,相当于为模型提供了正确的几何归纳偏置,使得学习流形上的概率路径更稳定且可扩展——这类似于 NLP 中 Transformer 通过位置编码处理序列,但对非序列数据结构需要更精巧的对称性设计。

核心洞察

  • 将三角形汤的置换对称性直接编码为等变架构,避免序列化引入的偏序问题。传统自回归方法将无序顶点和面强制序列化,迫使模型学习任意顺序,浪费容量并导致生成质量波动。MeshFlow 在 Diffusion Transformer 上做简单修改,使速度场对顶点置换和面置换均保持等变,网络自然尊重数据对称性,无需数据增强或顺序锚定,从而更高效地利用训练信号,生成更连贯的网格。
  • 嵌套最优传输耦合消除训练信号中的对称性违反,显著改善收敛。标准流匹配使用 minibatch OT 耦合源分布与目标分布,但直接配对可能将源面的顶点与目标面的不同排列顶点匹配,产生违反置换对称性的梯度,混淆训练。MeshFlow 提出嵌套耦合:先在面间做 OT 确定面对应,再在每个面内做顶点级 OT 确定顶点对应,保证所有配对均在对称等价类内,消除了冲突监督,使模型快速收敛至更优解,并提升生成网格的拓扑合理性。

方法

MeshFlow 采用 三角汤 (triangle soup) 直接表示网格:一组无序的三角形面,每个面存储三个顶点坐标,不显式维护面间连接关系。

输入与对称性处理

三角汤具有两种内在对称性:

  • 面置换不变性:面序列的任意重排不影响网格几何。
  • 面内顶点置换不变性:每个面三个顶点的顺序无关紧要。

为满足这些对称性,MeshFlow 将整个网络设计为对这两类置换等变 (equivariant) 的架构,确保预测的速度场在置换输入后相应变换,从而消除序列化偏差。

等变架构设计

网络基于 Diffusion Transformer (DiT) 修改,由三个核心模块构成:

  • 顶点嵌入器 (vertex embedder):将每个面的三个顶点坐标映射到一个面内置换不变的嵌入向量(如池化或对称函数)。
  • 等变 DiT 块 (equivariant DiT block):在标准 DiT 的基础上引入跨面交互结构,保证当输入面的顺序被打乱时,输出的特征序列以相同方式重排;同时,面内顶点重排不会改变该面对应的特征。
  • 面条件 (face conditioning):将面嵌入与全局噪声时间步等条件融合,使网络能感知每个面的局部几何。

训练目标:嵌套最优传输耦合

流匹配 (flow matching) 训练需要定义从噪声分布到数据分布的条件概率路径。由于三角汤存在对称性,直接使用逐点损失会施加违反置换不变性的监督信号,造成优化冲突。MeshFlow 引入嵌套最优传输 (nested optimal transport) 耦合

  1. 先对噪声点云与真实面集合进行面级最优传输匹配,确定面与面之间的对应关系。
  2. 在匹配的面内,再对噪声顶点与真实顶点进行点级最优传输匹配。 这种层级匹配策略保证了训练过程中每一步的配对都尊重对称性,消除了错误梯度,提升收敛稳定性。

输出与后处理

模型学习从高斯噪声到三角汤的速度场,采样时利用 ODE 求解器逐步去噪,最终得到三角汤坐标。生成后可通过简单的后处理 (post-processing) 步骤(如重复面剔除、顶点合并)进一步改善网格质量。

与自回归方法的区别:MeshFlow 直接并行生成所有面,无需将网格序列化为长序列,从而避免自回归模型对顶点/面顺序的过拟合,并实现推理速度约 18 倍提升。

实验

实验设计

MeshFlow 在 ShapeNet 数据集上进行无条件网格生成任务,使用 triangle soup 表示直接生成三角形网格,避免序列化。作者将 MeshFlow 与当前领先的自回归网格生成器(如 PolyGen、MeshGPT)对比,评估生成质量(覆盖率、MMD 等)与推理效率。消融实验分别验证 等变 DiT 架构嵌套最优传输训练目标后处理 的贡献,训练数据涵盖多个物体类别。

关键发现

  • 推理速度提升约 18 倍,同时生成质量与自回归方法可比
  • 等变架构:确保置换不变性,消除网格表示中的对称性歧义,显著稳定训练。
  • 嵌套最优传输目标:避免因置换对称性导致的冲突监督信号,加速收敛并提升最终质量。
  • 后处理:简单顶点去重与面清理操作进一步改善拓扑正确性。

基线对比解读

相比于自回归方法,MeshFlow 的速度优势源于一次前向传播直接输出全网格,而非逐个面或顶点串行生成。等变 flow matching 提供的训练范式天然符合非序列化表示,使得模型不必学习任意排序就可以捕捉 3D 形状分布。质量持平表明该设计并未牺牲表达能力,而是通过对称性感知的训练更高效地利用了模型容量,有望在实时应用或大规模生成场景中替代自回归路线。

行业影响

落地场景

MeshFlow 的直接三角形网格生成能力适用于任何需要高质量 3D 资产创建的产品与业务。在 3D 内容平台(如游戏引擎素材商店、AR/VR 应用)中,它能将传统的建模提速约 18 倍,支持即时生成角色、道具或场景网格。电商与广告领域可用来批量生成商品 3D 展示模型,降低人工建模成本。自动驾驶与机器人仿真需要大量多样化 3D 场景元素,MeshFlow 可快速产出道路设施、车辆等作为训练环境。

商业价值

主要价值体现在降本与增效。相比自回归方法,推理速度提升 18 倍,同等质量下硬件时间成本大幅下降。在 内容生产管线中,人工建模一个中等复杂度的网格需数小时,MeshFlow 可在秒级生成并直接输出可用网格,将 3D 资产生产效率提升至分钟级,释放设计师资源。此外,体验提升体现在交互式应用中:用户等待时间从数十秒降至数秒,使实时生成应用(如在线 3D 编辑器或游戏内自动创建)成为可能,拓宽商业化场景。

与现有产品/工作流的接口

MeshFlow 输出为三角形汤表示,无依赖特定拓扑结构,可直接导入主流 3D 软件(Blender、Maya 等)及游戏引擎(Unity、Unreal)。通过后处理模块,可进一步去除噪声面片、细化网格,无缝融入现有 CGI 流程。集成时可采用 REST API 或本地推理服务,将生成请求接入资产管线或内容管理系统的自动化环节。对于已有生成模型堆栈的团队,其 equivariant DiT 架构与 flow matching 训练范式可复用现有 3D 数据预处理与评估工具。

具体 Use Case

  • 电商场景下的 3D 商品展示:某家具品牌需为数千 SKU 提供 3D 模型。传统手工建模成本高昂且周期长。使用 MeshFlow,基于少量参数或草图直接生成三角形网格,经简单后处理即可线上展示,实现“0 人工建模”的规模化 3D 商品页,降低 asset 制作成本 80% 以上。
  • 游戏内容平台的自定义角色系统:玩家在角色创建界面调整滑块,MeshFlow 在 2 秒内生成对应的 3D 身体网格,实时预览并可直接进入游戏。相比于预置数百种模型或耗时长的自回归生成,极低延迟大幅提升玩家体验与付费转化。

局限

  • 三角形汤表示虽然避免了序列化,但其生成的是无序面片集合,缺乏拓扑连贯性,容易产生缝隙、自相交或非流形特征。论文依赖后处理步骤修复这些缺陷,但后处理无法完全保证水密性和流形性质,尤其在复杂拓扑时可能失效。这降低了在严格工业标准下的直接可用性,后处理引入的额外步骤和不确定性也削弱了端到端的生成优势。
  • 所提出的等变架构仅针对面间置换与面内顶点置换设计,未涵盖常见的刚体等变性(如旋转、平移)。实际生成中物体朝向不确定,模型可能对不同方向的输入产生不一致输出,需要数据增强或额外对齐。相比之下,部分基于点云的扩散方法可自然处理 SE(3) 等变性,MeshFlow 的对称性处理范围较窄,可能影响泛化能力。
  • 嵌套最优传输训练目标在面间匹配时,计算复杂度随面数平方增长。虽然论文探讨了 OT 的可扩展性问题,但对于需要数千面精细细节的高分辨率网格,OT 求解会成为训练瓶颈,且批处理内存开销显著。这限制了模型在更高精度场景下的扩展性,而自回归方法可通过逐步生成面片来缓解面数控制难度。
论文Qi Sun2026-06-22原文

相关内容