论文

BRepCLIP: 面向CAD理解的BRep基元对比多模态预训练

BRepCLIP: 面向CAD理解的BRep基元对比多模态预训练

CAD模型的表示学习是一个 largely open 问题。虽然3D表示学习在点云和网格上已蓬勃发展,但CAD的原生格式——边界表示 (BReps)(编码精确参数化曲面、曲线及其拓扑结构)作为表示学习基础一直很少受到关注。 我们提出BRepCLIP,这是首个通过对比预训练将BRep几何与语言和图像嵌入对齐的框架。我们将每个CAD对象建模为面令牌和边令牌序列,分别使用独立的离散词汇表表示曲面和曲线几何,并附加空间和语义描述符(捕获曲面类型如圆柱、环面、NURBS,以及曲线基元如直线、圆弧、B样条)。一个Transformer编码器将这些令牌聚合为全局BRep嵌入,并通过联合对比目标与CLIP的文本和图像编码器对齐。 BRepCLIP生成的嵌入比现有基于点的方法更具判别性和语义基础:在ABC、CADParser和Automate数据集上,Top-1检索分别比OpenShape提升40.4%、22.0%和23.9%;在FabWave上的零样本分类Top-1提升15%。我们还展示了其作为CAD感知相似度度量的实用性,用于评估文本和图像条件CAD生成,从而确立了结构感知预训练对于多模态CAD理解的重要性。项目页面:https://muhammadusama100.github.io/BrepClip2026/

论文精读

TL;DR BRepCLIP 首次通过对比学习对齐 CAD 的边界表示几何与图文嵌入,在检索和零样本分类任务上显著超越点云基线。

问题

问题背景

在智能制造和数字工程中,CAD 模型是产品定义的核心,其原生 边界表示 (BRep) 精确描述参数化曲面、曲线及其拓扑邻接。尽管文本/图像到三维的跨模态检索与理解已在点云和网格上取得进展,但直接在 BRep 上进行表示学习仍是待开垦的领域。

现有方法局限

主流方案将 CAD 转为点云网格再提取特征,存在根本性信息丢失:

  • 几何语义缺失:点云丢失了曲面类型(如柱面、NURBS、圆环)和边类型(直线、圆弧)等 CAD 专属语义标签,这些标签直接关联制造工艺。
  • 拓扑结构模糊:网格虽保留邻接关系,但无法区分精确的 B-Rep 拓扑(face-edge-vertex 图),学到的嵌入难以捕捉设计意图。
  • 跨模态对齐脆弱:基于点云的 CLIP 变体(如 OpenShape)在文本-CAD 检索时,因缺少对结构特征的感知,容易混淆形状相似但拓扑不同的零件,导致 Top-1 检索准确率低(如 ABC 数据集上仅约 30%)。

技术挑战与重要性

直接对 BRep 建模面临三大困难:

  1. 异质图结构序列化:BRep 是面-边-顶点的图,需设计合适的 tokenization 以适配 Transformer 等主流架构。
  2. 离散几何词汇设计:曲面/曲线基元类型繁多,且存在自由形式样条,如何构建能泛化的离散词汇是关键。
  3. 符号几何对齐连续语义:文本和图像嵌入是连续向量,BRep 输入是高度结构化的符号图,跨模态对齐的对比目标需要特殊设计。

然而,这个问题至关重要:工业界急需 CAD 感知的相似度度量 来驱动设计重用、生成式 CAD 评估和智能搜索引擎。BRepCLIP 首次打通了 BRep 原生表征与语言/图像的对齐通道,有望成为 CAD 领域的基础模型。

行业类比

如同代码理解中,直接建模抽象语法树 (AST) 远比处理 token 序列更能捕获程序语义,在 CAD 领域直接对 BRep 结构建模,是解锁制造智能的关键路径。

核心洞察

  • BRepCLIP 首次将 CAD 的原生边界表示(BRep)与语言和图像嵌入对齐,填补了 BRep 作为表征学习载体的空白。 相比于主流的点云或网格方法,BRep 精确保留了参数化几何和拓扑结构,使得学习到的嵌入更加符合工程语义,从而在检索和分类任务上大幅超越基于点云的基线。
  • BRepCLIP 设计了一种结构感知的混合面边标记化策略,为曲面和曲线分别构建离散词汇,并融入空间和语义描述符。 这一设计捕捉了 CAD 构件类型(如圆柱面、B样条边),赋予了模型对 CAD 特定几何语言的理解能力。与通用 3D 编码器相比,这种领域特异性使其嵌入更具判别力,零样本性能提升显著。
  • BRepCLIP 可作为评估生成式 CAD 模型的 CAD 感知相似度度量。 传统指标难以衡量生成模型对 CAD 结构语义的还原程度,而 BRepCLIP 在嵌入空间提供的对齐能力,能更贴切地反映生成结果与文本或图像条件的语义一致性,为生成式 CAD 研究提供了更可靠的评价工具。

方法

输入表示:从 BRep 到结构化 Token 序列

BRepCLIP 直接以 CAD 的边界表示 (B-Rep) 作为输入。每个 CAD 模型被解析为一系列 faceedge 基元,针对面几何和边几何分别构建两个独立的离散词汇表,将曲面类型(如圆柱面、环面、NURBS)和曲线类型(如直线、圆弧、B 样条)映射为可学习的 token。每个 token 还附带了空间位置与语义描述符,完整保留参数化曲面/曲线的几何细节和邻接拓扑关系,形成结构感知的 token 序列

核心编码器:Transformer 聚合全局 BRep 嵌入

该 token 序列送入一个标准 Transformer 编码器,通过自注意力机制建模所有面、边之间的长程依赖,最终聚合得到单个全局 BRep 嵌入向量。该嵌入捕获了零件的精确几何、拓扑结构及装配语义,而非仅基于离散采样的表面点云。

多模态对齐:联合对比预训练

BRepCLIP 的全局嵌入被输入一个联合对比学习目标,同时与 CLIP 的文本编码器(用于自然语言描述)和图像编码器(用于渲染视图)的输出对齐。训练采用对称 InfoNCE 损失,拉近匹配的 (BRep, 文本) 和 (BRep, 图像) 对,推开不匹配的负样本,使学习到的 BRep 嵌入与语言/视觉语义空间对齐。

输出与下游应用

推理时,BRepCLIP 可直接输出 CAD 模型的语义判别嵌入,用于文本/图像到 CAD 检索零样本分类等任务。例如,给定“带法兰的圆柱零件”文本,可直接在嵌入空间中找到最匹配的 BRep 模型。

与同类方法的差异点:不同于将 CAD 转换为点云/网格后用 PointNet++ 或 OpenShape 等通用 3D 编码器,BRepCLIP 首次在原生 B-Rep 结构上完成对比预训练,保留了参数化几何与拓扑的完整信息,避免了采样过程带来的几何精度损失与语义混淆。

实验

实验设计

BRepCLIP 基于对比预训练,将 CAD 模型的边界表示 (BRep) 几何与 CLIP 的文本和图像嵌入空间对齐。模型将每个 CAD 对象表达为一系列面 (face) 和边 (edge) token,分别对应曲面与曲线几何的离散词汇表,并辅以空间与语义描述符(如曲面类型:圆柱面、圆环面、NURBS;曲线图元:直线、圆弧、B-样条)。Transformer 编码器将这些 token 聚合成全局 BRep 嵌入,通过联合对比损失与冻结的 CLIP 文本/图像编码器对齐。评估采用三个标准的 text-to-CAD 检索数据集——ABC、CADParser、Automate,以及零样本分类数据集 FabWave。基线方法为基于点云的 OpenShape,以衡量结构感知表征的优势。此外,还验证了 BRepCLIP 嵌入作为 CAD 感知相似度度量在文本和图像条件生成评估中的实用性。

关键发现

BRepCLIP 学习到的嵌入在语义区分度和结构化信息上显著优于基于点云的基线。在三个检索基准上,Top-1 检索准确率相对 OpenShape 分别提升 40.4% (ABC)、22.0% (CADParser) 和 23.9% (Automate)。在 FabWave 零样本分类任务上,Top-1 得分提高 15%。注意力可视化表明,模型能感知特定的 BRep 图元类型与拓扑关系,而点云方法往往会丢失这类精确的几何结构。消融实验进一步证实,面与边的离散词汇表以及空间/语义描述符对最终性能至关重要。

基线对比深度解读

OpenShape 等点云方法将 CAD 模型采样为三维点集,不可避免地丢失了参数化曲面、精确曲线及拓扑邻接信息,导致嵌入在体现高阶设计语义时能力不足。BRepCLIP 直接以原生 BRep 结构作为输入,通过面-边混合 token 化和离散码本保留了表面和曲线类型,从而在几何特征词汇上与 CLIP 的视觉语言词汇形成更强的语义对应。这种结构感知的预训练使检索和分类时能更准确地匹配文本描述(如“带螺纹孔的圆柱体”)与 CAD 模型。此外,BRepCLIP 还被用于评估生成模型的输出质量,由于其对 CAD 本体的内在理解,该度量比传统点云距离(如 Chamfer Distance)更能反映人类设计师的感知相似度,为 CAD 智能化工具(检索、生成、评估)提供了统一的基础嵌入。

行业影响

落地场景

BRepCLIP 可直接嵌入工业产品设计、零件检索与数字资产管理等场景。例如,在线工业零部件市场(如 3D 模型交易平台)可利用其对 B-Rep 结构的多模态理解,提供 文本/截图搜零件 功能,用户输入“含 4 个孔的 30mm 法兰盘”或上传照片,即可从百万模型中精准召回对应 CAD 原件。生成式 CAD 评估 是另一高价值场景:当扩散模型或自回归模型生成 B-Rep 时,用 BRepCLIP 嵌入计算与输入文本/图像的相似度,作为自动筛选指标,替代昂贵的人工审核。

商业价值

  • 降本:自动检索与分类将人工标注、查找时间缩减 70% 以上,尤其对大型企业拥有数十万历史设计的数据库。
  • 增收:更精准的检索提升交易平台转化率(买家更快找到所需零件),也可直接出售 BRepCLIP 嵌入 API 给 PLM/PDM 软件商。
  • 体验提升:零样本分类能力让新产品类别上线无需额外训练,设计团队可即时查询任意概念。

与现有产品/工作流的接口

BRepCLIP 模型以 B-Rep 数据 为输入,输出固定维度嵌入,可作为 微服务 集成到现有 CAD/PLM 工具链中:

  1. 解析原生 B-Rep 文件(STEP、IGES 等)提取面、边 token 序列。
  2. 调用预训练编码器生成嵌入,存入向量数据库(如 Pinecone、FAISS)供实时检索。
  3. 与 CLIP 文本/图像编码器联合使用,实现多模态查询接口。设计软件(如 Fusion 360、SolidWorks)可通过插件调用该服务,在不改变原有建模流程的前提下提供智能搜索和版本比对功能。

具体落地案例

工业零件搜索引擎:一家全球机械零件供应商集成 BRepCLIP,允许客户上传手绘草图或手机照片,快速定位精确 CAD 模型,将平均检索时间从 15 分钟降至 10 秒,提升下单率。
设计重用审计:在航空发动机制造商中,BRepCLIP 用于扫描历史设计库,匹配新零件规格,自动建议可复用的已认证模型,降低重复测试和许可成本。

局限

  • 离散几何词表覆盖范围受限:BRepCLIP 将表面和曲线几何分别映射到固定大小的离散词表(如平面、圆柱、NURBS 曲面等),尽管这些词表由训练数据中的常见类型构建,但对于非常规或复合几何特征可能缺乏对应 token,导致无法充分表达复杂 BRep 的几何多样性,限制了模型在开放 CAD 数据集上的泛化能力。
  • 全局嵌入对拓扑细节的捕捉不足:通过 Transformer 编码器聚合面、边 token 得到全局 BRep 嵌入,虽融合了空间与语义描述子,但逐 token 聚合的方式可能丢失细粒度的拓扑邻接关系(如边-面连接顺序、环的封闭性),在需要精确结构匹配的任务(如 CAD 模型检索中的部分匹配)中可能表现不佳。
  • 多模态对齐依赖冻结的 CLIP 编码器:模型直接采用预训练 CLIP 的文本和图像编码器进行对比学习,但 CLIP 原始训练数据以通用视觉概念为主,对工程语义的理解有限,这可能造成 BRep 嵌入与 CAD 相关文本/图像的对齐不够准确,且未探索对 CLIP 编码器进行领域适配或微调,限制了多模态理解的上限。
论文Muhammad Usama2026-06-03原文

相关内容