Arbor: 显式几何条件约束用于可控3D资产生成
文本和图像条件化的3D模型现在能够生成可信的资源,但在控制物体应占据或避免的空间方面仍缺乏直接手段。在实际创作中,这种空间意图通常在生成前就已明确:椅子应适配座舱空间,道具应预留运动间隙,部件应暴露接触面。提示词和图像视图难以承载此类约束,亟需显式的控制接口。 我们提出 Arbor,一种可训练的插件,用于文本条件化的潜在空间3D生成。Arbor 将约束网格(constraint meshes)作为原生3D控制接口,包含三类区域:外壳区域(hull regions,需存在几何)、避让区域(avoidance regions,需保持空置)、接触区域(touch regions,需接触物体)。与补全或整体支架控制不同,这些网格并非目标证据,而是局部类型化需求,甚至可以包含不应出现表面的区域。Arbor 通过将约束网格转化为令牌,并在冻结去噪器内学习路由附着,将信号保留为几何形式。因此,每个潜在区域能够接收与其空间位置相关的约束部分。 我们在自动和艺术家策划的控制基准上评估 Arbor,涉及外壳、避让和接触约束,并将指标趋势与用户偏好研究进行对比。即使没有专用的合规损失,Arbor 在保持物体质量和变异性的同时,提升了约束遵从性。
论文精读
TL;DR Arbor 为文生 3D 增加约束网格(hull/avoidance/touch)作为显式空间控制接口,将几何约束转化为 token 并路由至冻结去噪器的潜空间区域,在无专属损失下显著提升约束遵循度,同时保持资产质量与多样性。
问题
问题背景
3D 生成模型当前已能通过文本或图像条件产生逼真资产,但在实际创作流程中,生成前就明确的空间意图(如物体应占据或避开的体积)仍然缺乏直接控制手段。
现有方法局限
主流控制方式依赖 prompt 或 图像视角,它们难以精确传递空间约束,例如“椅子必须适配座椅包络”“道具需为运动留出间隙”“零件需在接触面上暴露连接区域”。 现有工作中,补全式生成(如从局部点云恢复完整形状)或整体 scaffold 引导(如用粗略体素框限定外轮廓)本质是将约束视为目标证据,要求生成结果严格贴合输入几何。
这带来三类典型局限:
- 约束表达单一:只能定义“应有”区域,无法定义“禁止出现”或“必须接触”的区域;
- 缺乏局部语义:约束作用于整个物体,不能对不同部位施加差异化要求(如底座可接触地面,但椅背不可);
- 信号形式与生成器不兼容:约束几何直接作为条件输入时,常被冻结去噪器误解为必须重建的部分,而非柔性引导。
技术挑战与业界关注度
将显式空间约束融入潜在 3D 生成面临双重挑战:
- 表示难度:约束网格(constraint mesh)本身是连续几何,如何将其编码为与潜在空间对齐的 token,并传递给不同空间位置的 latent 区域,是跨模态理解问题;
- 训练稳定性:在冻结的大型去噪器中植入可控模块,需避免破坏原有质量与多样性,同时让约束类别(hull / avoidance / touch)被差异化执行,这要求设计专用的路由机制而非简单连接。
业界对可控生成需求强劲,从游戏资产布局到工业设计公差验证,均需要生成结果满足预定义的空间合同,而非仅靠文本反复采样试错。
行业类比
类似 自动驾驶仿真 中要求合成传感器数据严格匹配真实道路拓扑,3D 资产生成若无法施加体积占用约束,就像用文本描述去限定车道线位置——信息载体与空间精度之间存在语义鸿沟。
核心洞察
- 将约束网格作为原生3D控制界面:Arbor 直接使用 hull(占据区域)、avoidance(避让区域)、touch(接触区域)三类约束网格来指定空间要求,而非通过文本或图像间接暗示。这使得控制意图精确且可局部化,避免了自然语言描述歧义,尤其适合需要精确尺寸和空间关系的工业设计或动画装配场景,比现有基于草图或骨架的3D控制方法更直观且可验证。
- 区域化路由的条件注入机制:Arbor 将约束网格编码为 token,并通过可训练路由器分配到潜空间各区域,使每个空间局部仅关注与之相关的约束部分。这种设计避免了全局条件信号带来的无关干扰,相比 ControlNet 等全局附加结构,能更好保留对象质量与多样性,同时通过隐式学习实现约束遵守,无需显式合规损失,简化了训练流程并提升了控制鲁棒性。
方法
输入:文本 + 约束网格
Arbor 接受文本提示与一组约束网格作为输入,约束网格分为三类:
- hull 区域:几何体必须占据的包络空间
- avoidance 区域:必须保持空置的禁止区
- touch 区域:对象需接触的表面
关键模块
- 约束编码器 (Constraint Encoding)
将多类约束网格统一转换为空间感知的 token 序列。利用 3D 点采样与 Transformer 结构编码几何形状和类型标签,输出 token 既携带局部位置信息又包含约束语义。 - 控制适配器路由器 (Control Adapter Router)
嵌入在冻结的 TRELLIS 文本条件去噪器内部的轻量可训练模块。它根据去噪潜伏表示中每个空间区域的坐标,动态选择并注入相关约束 token:通过交叉注意力或基于坐标的门控,使每个潜伏区块仅关注与其空间邻近的约束信息,实现“按需分配”。 - 基础 3D 生成模型
沿用 TRELLIS 架构,在潜伏空间执行扩散去噪,文本条件通过原有路径注入。Arbor 不修改其权重,仅增加侧支适配器,避免灾难性遗忘并保持生成多样性。
训练与输出
训练时仅更新约束编码器与路由器,标准扩散噪声预测损失驱动,无需额外合规性损失。推理阶段,给定约束与提示,去噪器在适配器引导下生成符合空间约束的 3D 资产(网格或隐式场)。
与同类方法的差异
不同于对目标形状的补全或支架控制,Arbor 的约束网格是局部类型化需求(含避空区域),且信息通过空间路由机制有选择地注入生成过程,而非将约束作为全局条件强加。
实验
实验设计
评估基于自动化指标和艺术家策划的约束基准,涵盖 hull(包络)、avoidance(避让)、touch(接触)三类空间约束。与基线文本条件 3D 生成模型(推测为 TRELLIS)对比,并开展用户偏好研究验证指标趋势。消融实验分析适配器路径、路由机制等模块的贡献;固定约束下测量生成多样性,以验证控制是否损害变化性。
关键发现
- 即使未引入专门的一致性损失函数,Arbor 仍显著提升约束遵从性。
- 对象生成质量与变化性未因额外控制而退化,部分指标持平或改善。
- 用户偏好结果与自动化指标趋势一致,偏好 Arbor 控制下的生成结果。
与基线对比深度解读
相较纯文本/图像条件,约束网格 作为显式 3D 控制接口,直接定义占位需求,消除自然语言描述的空间歧义。Arbor 将约束网格编码为 token,并通过冻结去噪器内的路由适配器注入不同潜变量区域,使每个区域只接收与其空间位置相关的约束片段,实现解耦调控。与补全式或 scaffold 控制不同,Arbor 的约束并非目标证据,而是“类型化需求”,可指定避让区等不应出现表面的负空间,更贴近工业创作中的真实约束。实验表明,这种显式几何条件可在不牺牲基础生成能力的前提下,大幅提高可控性,为 3D 资产生成管线提供实用的可控增强方案。
行业影响
落地场景
Arbor 适用于任何需要精确空间受控的 3D 资产生成 的业务场景:游戏与影视制作中,可根据关卡体积和干扰区生成道具;电商 3D 商品展示可绑定生成模型与指定摆放区域;工业设计与建筑可视化可生成符合工程约束的零部件。
商业价值
Arbor 将约束表达从繁琐的提示词工程转变为直观的几何网格,直接降低 人工试错与返工成本。设计师仅需提交粗略的占位体、避开体和接触面,即可批量产出合规资产,使非专业建模师也能参与创作。这显著缩短从概念到可用模型的周期,并在自动化管线中支持大规模内容生产。
与现有工作流集成
Arbor 是 冻结基座模型上的可训练附接模块,可作为插件嵌入 Blender、Maya 等 DCC 工具,或通过 API 接入云生成平台。它接受约束网格与文本提示,输出 3D 资产,与现有的 TRELLIS 等潜伏扩散模型无缝对接,无需改动管线其他部分。
具体落地用例
- 虚拟家居电商:基于用户上传的房间扫描,系统利用 Arbor 生成尺寸适配、不与现有家具冲突的推荐商品模型,同时满足靠墙、落地等接触要求。
- 开放世界游戏开发:为 NPC 巡逻路线自动生成路障或掩体,用回避网格确保不堵塞路径,只用一个占位体裁剪出符合空间限制的数百个变体。
局限
- **缺少显式合规损失**:论文提到“Even without dedicated compliance losses”,表明模型训练时未直接优化约束满足程度,而是依赖适配器在冻结降噪器中的隐式学习。这可能导致在约束稀疏或相互冲突时,合规性表现不稳定,且无法直接量化控制对象的遵从度,限制了其在精确工程场景中的可靠性。
- **约束网格创建成本高**:Arbor 引入的 **hull、avoidance、touch** 约束网格需要用户手动构建,这要求一定的三维建模经验。相比纯文本或图像条件,额外的前期设计步骤可能降低工作流效率,尤其对非专业用户不友好,自动化程度有待提升。
- **可迁移性与约束类型受限**:当前实现附着于 **TRELLIS** 特定降噪器,未验证在其他基础模型上的即插即用能力。约束类型目前只覆盖占用、避让和接触,缺乏对更丰富几何关系(如对称性、尺寸参数化、零件装配)的支持,限制了在复杂创作任务中的泛化性。