论文

P3D-Bench: 用于参数化3D生成和结构推理的多模态大语言模型基准测试

P3D-Bench: 用于参数化3D生成和结构推理的多模态大语言模型基准测试

现有的3D生成基准主要评估网格或隐式表示,忽略了参数化3D程序所需的几何精度、语义对齐和装配一致性。参数化3D程序通过代码暴露明确的尺寸、构建操作和部件关系,不仅能检验外观,更能揭示模型是否真正理解设计结构。 为此,我们提出 P3D-Bench,一个统一协议下的参数化3D生成基准。它涵盖三个任务族:Text-to-3D、Image-to-3D和Assembly-3D,并针对每个输出计算 可执行性、几何保真度、拓扑、文本约束、多视角语义对齐 和 部件级结构 六个维度的评分。 我们在400个文本用例、400个图像用例和203个带标注的装配体上评估了前沿的多模态大语言模型(MLLMs)和纯文本LLMs,并以领域专用模型作为参考。实验获得三个主要发现: 1. 装配体是最困难的设置,模型仍无法将多个部件组合成连贯结构; 2. 模型常能恢复目标对象的整体形状和语义身份,却无法再现输入指定的精确参数化几何; 3. 部件级建模在装配体上表现薄弱,模型既不能恢复每个部件的几何,也无法获得正确的部件数量。 这些结果确立了 P3D-Bench 作为评估参数化3D生成中精确几何和部件级结构的标杆基准。

论文精读

TL;DR P3D-Bench 通过代码生成任务评估 MLLM 的参数化 3D 建模能力,聚焦几何精度、语义对齐与装配一致性,揭示模型的结构推理短板。

问题

多模态大语言模型(MLLM)通过编写代码实现程序化 3D 建模,为基于先验知识和推理的 3D 生成开辟了新方向。然而,现有基准大多评估直接生成的网格或点云,忽略了参数化 3D 程序的可编辑结构信息,导致评估维度片面。

现有方法的局限在于:1)只检查生成形状的外观相似度,不验证尺寸精度、拓扑一致性和部件装配关系;2)缺乏对代码可执行性的系统度量,模型常输出看似合理但无法编译或执行出错的程序;3)面向装配体的基准空缺,无法评估模型对多部件组合的结构化推理能力。这些不足使得仅靠外观指标无法区分模型是否真正掌握了设计逻辑和几何约束。

该问题的难度与重要性体现在:参数化 3D 生成要求模型从文本或图像描述中推理出显式的构建操作序列、精确的几何参数和部件依赖,本质是视觉-语言-几何的跨模态结构化推理。工业设计、CAD 自动化和机器人操作等领域对可编辑、可制造的 3D 程序有强烈需求,但当前前沿模型在复杂装配任务中仍频繁失败,部件数量和几何准确率不足,凸显该基准的紧迫价值。

行业类比:正如代码生成需从“可运行”进阶到“符合规范、架构整洁”,3D 生成基准也需从“看外观”升级为“验结构”,类似 CodeBLEU 对代码语义的评估深化。 P3D-Bench 正是为此设计的结构化测试场。

核心洞察

  • 参数化代码生成作为评估媒介,直接衡量模型对精确几何结构、尺寸约束与部件关系的理解,而非仅仅外观相似性。与主流 3D 生成基准(如 CLIP-based 方法或网格质量评估)不同,P3D-Bench 迫使模型通吃几何语义对齐与装配一致性,揭示出现有 MLLM/LLM 在“视觉-结构-代码”链路上的系统性偏差——它们能恢复全局形状语义,却频繁丢失精确参数化细节。
  • Assembly-3D 任务成为当前模型的“硬天花板”,绝大多数前沿 MLLM 在组合多个部件为连贯总成时表现薄弱,不仅部件几何还原差,部件数量也常出错。这一发现直指多模态模型的空间组合推理能力不足,与二维布局或单物体建模形成尖锐反差,为下一代 3D 编码器-解码器架构和细粒度空间预训练指明了缺口。

方法

P3D-Bench 以 参数化 3D 程序 (parametric 3D program) 为输出载体,构建了一个从 输入 → 数据集构建 → 模型生成 → 多维度自动评测 的完整流水线。

输入与任务定义

基准覆盖三种任务:

  • Text-to-3D:输入自然语言描述(如“一个20mm长的六角螺栓”)
  • Image-to-3D:输入单张渲染图
  • Assembly-3D:输入包含多个零件的装配描述,要求生成整体可装配的程序

数据集构建与过滤

数据源来自 Text2CADFusion 360 Gallery,经两步清洗:

  • 过滤流水线 (Filtering Pipeline):利用 MLLM 审查 自动剔除几何过于简单、歧义或高度重复的样本,并通过 近似去重 (near-duplicate removal) 保证多样性。
  • 标注流水线 (Annotation Pipeline):为每个样本补全参数标注(尺寸、约束)、拓扑关系图、多视角语义描述,并在 Assembly-3D 中提供零件分解与归属信息。最终形成 400 个文本样例 / 400 个图像样例 / 203 个装配样例 的数据集。

评估协议

模型生成的 OpenSCAD 程序需经过统一的多维打分:

  • 可执行性 (Executability):检查代码能否无错运行并产出实体
  • 几何保真度 (Geometric Fidelity):渲染深度图/点云与真值进行 Chamfer 距离 等对齐度量
  • 拓扑一致性 (Topology):统计实体建模错误(如自交、法向翻转)
  • 文本约束满足 (Text-grounded Constraints):MLLM 判分是否满足尺寸、数值要求
  • 多视图语义对齐 (Multiview Semantic Alignment):基于 CLIP 或 MLLM 判断渲染多视图与目标语义的一致性
  • 部件级结构 (Part-level Structure)(专用于 Assembly-3D):零件数量、匹配度、装配拓扑的正确性,通过 装配分解 (Assembly Decomposition)保真门控 (Fidelity Gate) 机制细化计分

评测结果按桶聚合,得到单任务综合性能。

与现有 3D 基准主要侧重网格/点云外观不同,P3D-Bench 从 代码生成视角 直接检验模型是否恢复了设计的 显式结构(尺寸、操作、零件关系),为参数化 CAD 生成提供了首个标准化评估框架。

实验

实验设计

P3D-Bench 覆盖三类任务:Text-to-3DImage-to-3DAssembly-3D,各包含约 400 条文本提示、400 张输入图像及 203 个带标注的装配体。输出统一为参数化 3D 程序(如 CAD 脚本),通过可执行性几何保真度拓扑正确性文本约束满足多视角语义对齐部件级结构六个维度自动评分,并引入 MLLM 评判器辅助语义评估。受测模型包括前沿 MLLM、纯文本 LLM 以及领域特定基线。

关键发现

  1. 装配体任务最难:模型难以将多个部件组合为连贯结构,部件级建模尤其薄弱,既无法恢复单部件几何,也常输出错误部件数量。
  2. 全局形状可辨但细节失准:多数模型能还原目标物体的粗略外形和语义类别,但无法复现输入指定的精确参数化尺寸。
  3. 代码执行性不足:不少生成程序无法直接执行,暴露出模型在语法控制和 API 调用上的不足,导致后续几何评估无法进行。

与基线对比

领域特定模型(如针对 CAD 训练的专用系统)在几何精度和部件一致性上明显优于通用 MLLM/LLM,说明通用模型的先验知识虽有助于语义理解,但缺乏精确参数化建模所需的约束推理能力。该基准的核心价值在于暴露这一差距,并推动模型向结构推理(而非仅外观拟合)演进。

行业影响

落地场景

P3D-Bench 驱动的参数化 3D 生成能力可融入多种产品与业务:

  • 电商与营销:消费者上传一张产品照片,系统即可生成可编辑的参数化 3D 模型,用于在线 360° 展示、AR 试摆,提升转化率;
  • 工业设计与制造:从设计草图或文字规格直接生成参数化 CAD 程序(如 OpenSCAD 脚本),支撑快速原型与参数化衍生变体;
  • 游戏与影视内容生产:根据概念图批量生成家具、建筑模块等结构化资产,并通过参数暴露部件尺寸和装配关系,便于后期修改;
  • 教育与培训:将物理模型描述转为可交互的 3D 装配体,用于虚拟拆解教学。

具体用例

  1. 电商平台的即时 3D 商品生成:商家上传一张椅子照片,模型输出参数化组装程序,生成包含座面、椅腿等独立部件的模型,用户可在线调整椅腿长度、材质颜色并实时预览。
  2. 机械设计辅助插件:在 CAD 软件中嵌入 AI 助手,输入“M8 螺栓连接两个法兰,间距 50 mm”,模型生成带约束关系的装配脚本,设计师只须微调即可导入现有设计流。

商业价值

  • 降本:将传统耗时数小时的单体建模大幅缩短到分钟级,减少专业建模人力需求;部件可复用和参数化调整的特性进一步降低变体设计成本;
  • 增收:电商场景中,交互式 3D 展示可提升用户停留时长和转化率;设计行业中,快速出图能力允许承接更多项目;
  • 体验升级:让非专业人士也能通过自然语言或图像创建可编辑的 3D 资产,扩展用户基础;在 AR/VR 应用中提供更真实的互动感。

与现有产品/工作流的接口

参数化 3D 程序与现有工具链的集成方式清晰:

  • API 驱动:模型以 REST/gRPC 接口部署,接收文本或图像,返回标准格式的 程序化 3D 代码(如 Python CSG 脚本、OpenSCAD 源码),可直接被 Blender、FreeCAD、Rhino 等软件通过脚本接口导入;
  • 插件集成:以 IDE 插件 形式嵌入建模软件,用户选中参考图或输入自然语言后,自动生成带参数的装配树,保留完整的设计历史和约束关系;
  • 持续质量检验:P3D-Bench 中的 可执行性、几何保真度、装配一致性 指标可作为自动化测试套件,在集成前对模型输出进行校验,确保生成结果在语义和结构上满足工程标准。

局限

  • **任务覆盖的领域较窄,数据集规模受限**:P3D-Bench 当前仅聚焦于 CAD 设计中的参数化实体建模,且数据主要源自 Text2CAD 和 Fusion 360 Gallery,合计约 1000 个样本。对于更广泛的 3D 生成场景(如有机形状、隐式曲面、装配体以外的复杂工程结构),基准的覆盖度不足。样本量也较小,可能无法充分考验模型的泛化能力,尤其对于弱监督或零样本场景。
  • **评估协议依赖特定渲染与对齐管线,扩展性有限**:几何保真度、拓扑和多视图语义对齐等指标高度依赖从参数化程序渲染出的网格与参考网格的比较。这一流程对非网格表示(如点云、NeRF)不友好,也无法衡量参数化程序的可编辑性、参数合理性或代码风格的优劣,这些才是程序化设计的真实价值所在。此外,对 OpenSCAD 代码的严格执行性检查限定了输出格式,将其他可能的程序化 3D 表示排除在外。
  • **装配任务与零件级推理仍极具挑战,模型表现普遍较弱**:论文承认装配-3D 是当前最难的任务,前沿 MLLM 在多零件组合、零件数和零件几何恢复上均表现不佳。进一步,基准未探索为什么模型在结构推理上失败:是空间关系理解不足、还是代码合成能力跟不上。缺少对失败原因的细粒度诊断,可能限制社区针对性地改进模型架构或训练范式。
论文Yikang Yang2026-06-09原文

相关内容