论文

SpaceFlow: 局部可控的 3D 生成

SpaceFlow: 局部可控的 3D 生成

当前 3D 生成 方法缺乏显式的局部控制:几何贴合程度往往由全局控制强度决定,外观也无法在局部指定。 我们提出 SpaceFlow,一种免训练的局部可控 3D 生成流程,输入为文本描述与一组几何基元。每个基元作为某个物体部件的代理,并配有独立的 局部控制级别,用户可指定哪些区域应严格遵循输入形状、哪些允许生成式补全。在结构生成阶段,我们在 生成流(generative flow) 过程中施加这些空间约束。外观合成时,将生成的结构分割并与基元匹配,每个生成部件仅以分配给它的文本或图像提示为条件,从而限制跨部件信息泄漏。 区域几何指标表明,SpaceFlow 在高控制区域能保持指定几何,在低控制区域可产生合理的形状变化;用户研究进一步显示,其在几何保真度与生成自由度之间的平衡在整体质量上仍具竞争力。在固定几何上评估外观时,文本条件路由 取得了最优的提示忠实度与颜色/材质准确度,定性结果还展示了图像提示的局部路由能力。项目主页见 SpaceFlow3D.github.io。

论文精读

TL;DR SpaceFlow 通过几何基元为 3D 生成提供局部几何和外观控制:高控制区域严格贴合输入形状,低控制区域允许生成式补全,并隔离跨部分外观泄漏,无需训练即可生成可控 3D 资产。

问题

问题背景:文本到 3D 生成已在速度与质量上取得显著进展,但可控性仍落后于 2D 生成,用户无法像编辑图像那样细粒度地指定几何与外观约束。

现有方法局限:主流 SDS 类方法(如 DreamFusion、ProlificDreamer)通常只有一个全局控制强度参数,几何遵循度要么整体严格、要么整体宽松,无法对不同部件施加差异化约束;外观方面,文本或图像条件被全局应用,容易造成各部件语义泄漏,难以实现局部材质、颜色或参考图绑定。训练-free 流程虽然无需成对数据,但现有工作往往牺牲局部可控性来换取零样本能力,缺乏结构与外观解耦的显式局部路由机制。

为什么难/重要:局部可控需要将空间约束与生成式先验精确对齐,而 NeRF、3DGS 等隐式表示不像 2D 掩码那样天然支持区域划分;原语到部件的匹配、跨部分外观梯度隔离、以及局部几何/外观的量化评估都是技术挑战。工程上,设计两阶段(结构生成与外观生成)分离的管线,并引入原语代理与局部控制强度,能降低复杂度,为可控 3D 资产生成提供可落地的思路。业界对 3D 内容生成正从“能生成”转向“可控生成”,该方向具有明确的实用价值。

行业类比:类似图像生成中 ControlNet 提供的空间条件控制,但针对 3D 生成中的部件级约束,用户希望像操作 3D 建模软件一样对每个 part 设置遵循强度,并独立绑定外观提示词或参考图。

核心洞察

  • **局部可控性** 是 SpaceFlow 区别于现有 3D 生成方法的核心维度。不同于主流工作仅通过全局控制强度约束几何,该方法将 3D 原语(primitive)作为对象部分的代理,并为每个原语分配独立的局部控制级别,允许高控制区域严格吻合输入形状,低控制区域由文本提示驱动生成。这种细粒度控制为 3D 内容创建提供了类似 2D 图像局部编辑的自由度,同时保持生成结构的整体一致性。
  • **训练无关的局部控制与外观路由** 是 SpaceFlow 实现实用性的关键。该方法不微调或重新训练生成模型,而是在生成流过程中直接注入空间约束,并对生成的结构进行分割-匹配,使每个部分仅由对应的文本或图像提示条件化。这种策略有效限制跨部分属性泄漏,避免了全局提示导致的材料混合。与需要额外训练或借助分割先验的 baseline 相比,SpaceFlow 在推理时即可组合多种视觉参考,且几何忠实度与生成自由度达到平衡。

方法

输入与问题定义

  • 用户提供文本提示、一组几何基元(如超二次曲面)以及每个基元的局部控制强度。
  • 基元作为物体部件的代理,控制强度定义该区域的几何约束等级:高控制表示严格遵循输入形状,低控制允许生成式补全。

局部几何控制

  • 在生成流过程中施加空间约束:对高控制区域,输出几何强制与输入基元对齐;低控制区域则允许模型自由生成。
  • 实现方式可理解为通过空间掩码或加权引导,对 flow 的更新方向进行局部调节,从而在单个生成流程中融合显式几何先验与生成自由。

局部外观路由与引导

  • 生成结构被分割为多个部件,并匹配到对应的输入基元。
  • 每个部件仅使用其绑定的文本或图像条件进行外观合成,防止跨部件信息泄漏。
  • 文本条件路由在固定几何上实现了最优的提示忠实度与颜色/材质准确性;图像 cue 也能被局部绑定到指定部件。

原文指出:每个 generated part 仅以分配到的文本或图像 cue 为条件,从而限制跨部件泄漏。

输出

最终得到同时满足局部几何保真与局部外观控制的 3D 资产。

与同类方法的差异:相比使用全局控制强度或统一外观条件的现有 3D 生成方法,SpaceFlow 在无需训练的前提下,首次将几何约束和外观条件显式分解到部件级别,实现局部可控生成。

实验

实验设计

论文构建了一个包含 83 个资产 的评估数据集,每个资产由多个超二次曲面基元组成,并在不同区域分配不同的局部控制强度(强/弱)。几何控制评估通过区域几何指标测量高控制区域保真度与低控制区域形状变化;外观控制则在固定几何上使用文本或图像提示进行局部路由,评估提示忠实度与颜色/材质准确性。同时进行了用户研究,比较几何保真度与生成自由度的平衡。

关键发现

  1. 几何控制:在高控制区域,SpaceFlow 能严格保留输入几何形状;在低控制区域,允许生成式补全产生合理变化,且空间特征距离显示局部控制有效。
  2. 外观控制:通过将生成结构分割并匹配到基元,每个部分仅以指定提示为条件,有效限制了跨部分泄漏。文本条件路由在固定几何上达到了 SOTA 的提示忠实度和颜色/材质准确性。
  3. 用户研究:结果表明 SpaceFlow 在几何保真度与生成自由度之间取得了竞争力的平衡,整体质量不输于全局控制方法。

与基线对比解读

传统 3D 生成方法通常使用全局控制强度,难以对特定区域进行差异化约束。SpaceFlow 的局部控制级别允许用户指定哪些部分严格跟随输入形状、哪些部分允许自由生成,这是对现有方法的重要扩展。相比固定几何的全局文本条件,SpaceFlow 的局部提示路由避免了多个提示间的干扰,使外观控制更精准。实验结果证明,在保留几何细节和生成合理补全之间,局部控制策略优于单一全局强度调节,且外观控制达到当前最佳水平。

行业影响

落地场景

SpaceFlow 的局部可控 3D 生成能力适用于需要精确控制资产形状和外观的行业。

  • 电商产品展示:商家上传基础模型,用几何基元标记关键部件(如鞋底、鞋面),对品牌特征区域设置高控制强度,对其他区域设置低控制以生成风格变体,快速产出多款产品 3D 展示。
  • 游戏/影视资产生成:艺术家提供粗略代理几何,对武器柄部、机械关节等必须严格遵循设计的部分设置高控制,对装饰性部分设置低控制,实现可控的批量资产生成。
  • AR/VR 内容创作:允许创作者在保留核心结构的同时探索外观变化,加速原型迭代。

商业价值

该工作处于几何保真度与生成自由度的平衡点,直接降低 3D 资产制作中的返工成本。

  • 降本:训练无关的特性避免了为特定任务微调模型的开销,局部控制减少手动修正时间。
  • 增收:电商场景中快速生成多款式商品 3D 模型,可提升用户交互时长与转化率;内容平台能加速 UGC 3D 内容供给,增强用户粘性。
  • 体验提升:相比全自动生成的黑盒输出,局部可控让设计师对结果有更可预测的掌控,提升工具信任度。

与现有工作流的接口

SpaceFlow 输入为文本提示和超二次曲面基元(superquadric primitives),输出标准 mesh 与材质,可无缝嵌入现有 DCC 工具链。

  • 集成方式:可作为 Blender/Maya 插件,艺术家在场景中放置基元并设置控制级别,一键调用生成;或封装为云端 API,接收前端上传的基元参数与提示,返回生成资产。
  • 与现有 3D 生成模型配合:先用 SpaceFlow 生成结构,再用其他模型(如 MVDream、DreamFusion 变体)进行纹理细化或高分辨率优化,形成两阶段流水线。
  • 数据格式:支持导出 OBJ/FBX/glTF 等标准格式,便于进入游戏引擎(Unity/Unreal)或渲染管线。

典型用例:某电商平台为家具类目提供 3D 定制服务,商家上传基础桌椅模型,用基元框选椅背、扶手并设定高控制,座垫区域低控制生成不同软包形态,同时绑定局部材质提示(如“皮革”“织物”),快速生成系列化产品 SKU。

局限

  • 依赖用户提供几何原语,对非专业用户不友好。SpaceFlow 要求用户输入一组几何原语作为部件代理,并手动指定每个原语的控制强度,这增加了使用门槛。原语形状、位置、尺度的选择会显著影响生成结果:若原语过于简化或与目标形状偏差较大,高控制区域可能产生不自然的几何约束,导致结构扭曲;若原语数量不足或排列不当,低控制区域可能无法获得有意义的生成引导。论文未提供自动生成原语或从文本推断原语的机制,限制了该方法的易用性和规模化应用潜力。
  • 作为训练免优化方法,生成效率较低。SpaceFlow 在结构生成阶段通过生成流过程施加空间约束,在外观合成阶段进行分割匹配和条件化生成,均涉及迭代优化。与当前主流的前馈式 3D 生成模型(如单步扩散模型或 GAN)相比,其推理时间可能高出数倍至数十倍。论文未报告具体的生成时间或与其他方法的效率对比,但从方法设计可推断,完成一个资产的完整生成可能需要分钟级时间,这使其难以应用于实时交互、批量内容生产或需要快速迭代的设计工作流。
  • 局部外观路由依赖结构分割质量,复杂拓扑下可能失效。该方法将生成结构分割并与原语匹配,从而为每个部件分配独立的文本或图像提示。然而,分割算法在面对高度耦合的部件、薄壁结构或遮挡区域时可能出现边界错误,导致提示信号跨区域泄漏。论文在相对简单、部件分离明显的几何体上验证了外观控制效果,但对细粒度对象(如人物手指、动物毛发、复杂机械结构)的鲁棒性未做充分评估。此外,不同部件之间的外观一致性协调尚未被显式建模,可能产生局部风格冲突。
论文Neil De La Fuente2026-10-08原文

相关内容