论文

aDSL: 基于智能体-程序联合设计的Agentic 3D生成

aDSL: 基于智能体-程序联合设计的Agentic 3D生成

程序化表示提供了一种引人注目的 3D 内容创作范式,支持细粒度编辑、可解释性和显式结构控制。然而,依赖大型语言模型(LLM)编写 3D 程序的智能体工作流仍然脆弱,常常无法将高层意图转化为一致的底层几何。我们将这种脆弱性归因于现有程序化接口与 LLM 推理优势之间的错配——LLM 更擅长语义结构和空间关系,而非脆弱的数值选择。 本文通过联合设计 智能体中心领域特定语言(aDSL) 和 角色专业化多智能体系统 来弥合这一差距。aDSL 通过强调组合性和空间推理来桥接语义逻辑与几何约束,使智能体能够通过关系运算符而非脆弱的绝对坐标操控几何。基于 aDSL,我们的免训练多智能体系统遵循 Plan-Execute-Critic 循环,分解请求、综合代码,并利用执行反馈迭代修复错误和约束违规。 实验表明,这种协同设计提升了鲁棒性、可控性和对用户意图的忠实度。我们的方法在 文本转形状 和 图像转形状 任务上优于先前的 LLM 基线,同时保留了显式结构、可编辑性和可解释性。该方法还支持下游应用,如 可动部件物体生成 和 结构化场景组合。代码已开源:https://github.com/sig-pku/aDSL。

论文精读

TL;DR 论文联合设计面向智能体的 DSL(aDSL)与多智能体系统,用关系运算符替代脆弱绝对坐标,结合 Plan-Execute-Critic 迭代执行反馈,显著提升 LLM 生成 3D 程序的鲁棒性、可控性与用户意图一致性。

问题

问题背景

程序化 3D 表示近年来成为 3D 内容创建的重要范式,它通过代码显式描述几何结构,天然支持精细编辑、解释性和结构控制。与此同时,基于 LLM 的 agentic workflow 开始被用于自动编写 3D 程序,尝试将自然语言或图像条件直接转化为可执行的几何脚本。

现有方法局限

然而,现有 LLM 驱动的 3D 程序生成方法普遍脆弱。核心矛盾在于:现有程序化接口与 LLM 的推理强项不匹配。以 OpenSCAD、CadQuery 等为代表的传统 DSL 大量依赖绝对坐标和底层数值参数;LLM 在生成精确数值时容易出错(例如坐标偏移、尺寸不一致),却擅长语义标签和空间关系表达。同时,常见单 agent 流水线缺少执行反馈闭环,语法错误或约束冲突只能重新采样,导致生成结果不稳定、可控性差。

为什么这个问题难且重要

该问题的技术挑战在于需要同时解决两个层次的对齐:

  • 语义层:用户意图(如“一个带把手的茶杯”)到高层结构(杯体、把手)的映射;
  • 几何层:高层结构到具体参数化几何(位置、旋转、尺寸)的映射。

LLM 天然适合前者,却难以胜任后者。3D 程序空间巨大,且存在严格的几何约束(如部件不重叠、连接处对齐),错误会在渲染后立即显现。工业界对可编辑、可解释的 3D 资产生成需求旺盛(游戏、影视、仿真),但现有网格生成模型输出不可直接编辑,程序化方法又因生成质量不稳定而难以落地。因此,联合设计面向 agent 的 DSL 与协作式多 agent 系统,是提升 LLM 3D 创作实用性的关键路径。

行业类比

这一挑战类似于 LLM 辅助前端开发:直接生成带绝对像素样式的 HTML/CSS 往往布局错乱,而引入组件化设计系统(如 Tailwind CSS 类名)后,LLM 可以复用语义化 token 和预设约束,显著提高生成页面的一致性。

核心洞察

  • 联合设计 **Agent-centric DSL** 与多智能体系统,而非仅优化 LLM 或提示工程,是提升 3D 程序生成鲁棒性的关键。以往工作直接让 LLM 编写 Blender Python 或 OpenSCAD,这些接口包含大量脆弱数值和语法细节,与 LLM 的空间推理优势不匹配;aDSL 用关系运算符(如相对定位、对齐约束)取代绝对坐标,使 agent 能自然表达“把轮子放在车轴两端”这类语义关系,大幅减少数值错误。同时多智能体 `Plan-Execute-Critic` 利用执行反馈迭代修复约束违反,训练无关,与依赖 RL 或大规模对齐的端到端生成模型形成明显差异。
  • aDSL 强调 **可组合性与空间推理**,让生成结果保留显式结构和可编辑性,同时支持下游复杂任务(如铰接物体生成、结构化场景布局)。不同于 NeRF/SDF 等隐式表示难以局部编辑,程序化表示天然可解释,但此前 agent 很难稳定生成这类表示。本文通过 DSL 与 agent 共设计,使同一结构化表示同时支撑文本/图像条件生成与后续编辑、场景组合,打通了从高层意图到低层几何的链路,工程上降低了后续交互式应用的开发成本。

方法

输入为文本描述或单张图像(text-to-shape / image-to-shape),输出为可编辑、可解释的 3D 程序(几何资产)。

关键模块

  1. aDSL(Agent-centric Domain-Specific Language)
    针对 LLM 推理特点设计,强调 组合性 与 空间推理。用关系算子(如相对位置、对齐、布尔组合等)替代脆弱的绝对坐标,使模型专注于语义结构与空间关系,减少对数值精度的依赖。

  2. 角色专用多智能体系统
    遵循 Plan–Execute–Critic 循环:

    • Planner 将高层意图分解为结构化子任务;
    • Executor 基于 aDSL 生成程序代码;
    • Critic 利用执行反馈(编译错误、约束违反等)迭代修复。 整个过程配合内存与上下文管理,保持多轮交互的一致性。
  3. 训练免微调
    无需额外训练或微调 LLM,通过 DSL 与工作流的联合设计提升稳定性。

该方法与同类工作的差异在于:不是简单地在现有程序化接口上调用 LLM,而是协同设计语言与多智能体流程,从根源缓解脆弱数值选择问题,显著提高鲁棒性、可控性与用户意图保真度。

实验

实验设计

在 text-to-shape 与 image-to-shape 两项任务上评估方法,对比 prior LLM-based baselines。消融实验分别考察 aDSL 语言设计(3D Modeling Language)、多智能体工作流(Agentic Workflow)以及两者联合(Joint Effects)的贡献。下游应用测试包括 articulated shape generation、shape editing、high-fidelity shape generation、scene generation 与 interactive user integration。

关键发现

方法在两项生成任务上均优于基线,同时保留显式结构、可编辑性与可解释性。鲁棒性、可控性与意图忠实度显著提升。消融显示:单独使用 aDSL 或单独使用多智能体系统均带来改进,但联合设计(co-design)效果最佳,验证了语言与智能体架构协同的必要性。

与基线对比的深度解读

现有 programmatic 3D 接口依赖绝对坐标与脆弱数值,与 LLM 偏好语义结构和空间关系的推理特性不匹配。aDSL 引入 relational operators(关系算符)与 composability 设计,使 agent 通过空间关系而非数值坐标操作几何,大幅降低了低层几何不一致的发生。训练无关(training-free)的多智能体 Plan-Execute-Critic 循环利用执行反馈迭代修复错误与约束违反,避免了对特定数据集的过拟合。对工程实践的启示:在代码生成类任务中,领域特定语言与智能体工作流的协同设计比单纯优化 prompt 或模型规模更有效,值得在类似场景中推广。

行业影响

落地场景

aDSL 面向需要可编辑程序化 3D资产的产品:电商 3D 商品展示、游戏资产生成、影视预演、AR/VR 内容创作、教育仿真等。例如电商平台将商品上传图片转换为结构化 3D 模型,支持实时改材质、改尺寸;游戏工作室用自然语言批量生成带约束的场景道具,后续可手动精调。

商业价值

核心降本:大幅减少人工建模与修改时间。传统程序化生成依赖开发者硬编码,LLM 生成常因绝对坐标脆弱而返工。aDSL 的关系算子与 Plan-Execute-Critic 循环减少错误,提高一次生成合格率。增收方面,支持个性化 3D 内容规模化生成,如按用户偏好定制虚拟商品。体验提升:模型保留显式结构和可编辑性,非黑盒输出,便于设计师二次修改。

与现有产品/工作流接口

可作为 DSL 编译层嵌入现有 3D 工具链:接入 Blender/Maya 插件、Unity/Unreal 导入器,将 aDSL 程序转换为引擎可读格式。也可作为 LLM agent 框架的垂直能力模块,通过 API 提供 text-to-aDSL 或 image-to-aDSL 服务,输出文本代码而非网格,与版本控制、资产管理天然兼容。

具体落地用例:

  1. 电商平台:用户上传商品照片,自动生成可编辑 3D 模型,用于 AR 试戴或 360 度展示;运营人员用文本修改“将把手左移 2cm”等关系指令,无需建模。
  2. 内容平台:短视频创作者输入“生成一个北欧风客厅,含沙发和落地灯,灯在沙发右侧”,系统生成结构化场景,可继续用自然语言调整物体相对位置。

局限

  • **依赖 LLM 推理能力**:aDSL 通过关系算子降低了对绝对坐标的依赖,但复杂几何细节或精确数值约束(如精确尺寸、公差、物理属性)仍依赖 LLM 的推理可靠性。论文实验主要评估语义正确性和结构合理性,未系统覆盖高精度工业设计或物理仿真场景。当用户需求包含严格几何约束或复杂拓扑时,LLM 可能生成逻辑不一致或无法满足所有约束的程序,导致仍需要人工干预或后处理,限制了在苛刻工程环境下的直接可用性。
  • **DSL 表达力与泛化性有限**:aDSL 的原语和角色专门化设计主要针对 text-to-shape 和 image-to-shape 任务,对其他 3D 表示(如点云、网格直接编辑)或更通用的编程任务可能需要重新设计 DSL 或调整 agent 角色,迁移成本较高。虽然展示了 articulated object 和 scene composition,但缺少在大规模场景(如数百个物体)或高保真资产(如细致纹理、精细几何)上的充分实验,泛化性未经验证,可能难以直接扩展到超高复杂度场景。
  • **多 Agent 推理成本较高**:Plan-Execute-Critic 迭代循环涉及多次 LLM 调用、代码执行和反馈,推理延迟和 token 成本显著高于单次生成方法。论文未提供与单 agent 基线在效率(如平均迭代次数、总时间、API 成本)上的量化对比,实际部署可能无法满足实时交互式建模需求。此外,Critic 阶段依赖预定义的约束检查,对于未建模的错误类型可能漏检,需要额外设计规则或人工审查,增加了系统维护复杂度。
论文Rui-Huan Wang2026-08-18原文

相关内容