论文

SceneFrom3D: 基于几何条件与视图调度的室外3D场景生成及物体级控制

SceneFrom3D: 基于几何条件与视图调度的室外3D场景生成及物体级控制

几何条件3D场景生成允许用户从提供的几何形状创建3D环境,提供对场景结构和物体布局的直接控制。现有方法通常采用三阶段设计:先定义视图调度,再沿调度视图合成多视角观测,最后从生成图像重建3D表示。然而,对于室外场景,视图调度成为主要瓶颈——大面积、非结构化和无界的几何使得难以获得既能充分覆盖又支持稳定生成的视图。 为解决这一瓶颈,我们提出SceneFrom3D框架,它自动从输入几何中调度视图。SceneFrom3D构建了一个有向生成图,其中节点表示锚点视图,边表示插值轨迹,从而定义哪些视图需要合成、哪些视图对需要插值以及生成的顺序。 除了自动视图调度,SceneFrom3D还通过物体级条件进一步提升了可控性:为每个物体分配一个身份图像用于外观引导,以及一个几何遵循参数用于对输入几何的区域级控制。实验表明,SceneFrom3D在几何条件室外3D场景生成中达到了最先进水平,生成了高质量场景,且可控制物体外观和几何遵循度。

论文精读

TL;DR SceneFrom3D 通过有向生成图自动调度视图,从户外几何输入直接生成高质量 3D 场景,并支持对象级的外观和几何控制。

问题

问题背景

3D 场景生成正从手工建模转向数据驱动,几何条件生成 (geometry-conditioned generation) 允许用户通过简单几何体控制场景结构与物体布局,大幅降低制作门槛。

现有方法局限

主流方案采用三阶段流水线:定义 视图调度 (view schedule)、沿调度视图合成多视角观测、从生成图像重建 3D 表示(如 3D Gaussian Splatting)。然而,视图调度严重依赖人工设计或简单启发式规则,在大型、无界、非结构化的户外场景中暴露出两个致命缺陷:

  • 覆盖率不足: 手动选取的相机位姿难以保证对广阔几何的全覆盖,导致生成内容缺失或质量不均;
  • 生成不稳定: 视图间缺乏协同,相邻生成结果风格差异大,重建时出现伪影与撕裂。 因此,现有方法生成的户外场景常出现物体错位、纹理模糊等问题,无法满足生产需求。

为什么这个问题难/重要

  • 技术挑战: 户外几何通常稀疏、无定形,需自动推理出生成覆盖率高、且能保证多视图一致性的视图序列;同时要求生成过程中对每个物体进行外观与几何附着度的精细控制,这涉及离散视图规划与连续生成控制的联合优化。
  • 业界关注度: 自动驾驶仿真、城市数字孪生、影视虚拟制片等领域急需可扩展的户外 3D 场景自动生成管线,直接提升内容生产效率与迭代速度。

行业类比

类似 NeRF 重建时需要精心设计相机路径以覆盖大场景,但 SceneFrom3D 需要为 未知内容 凭空规划最优观察序列,难度陡增——恰如为尚未绘制的巨大壁画自动生成描摹流程。

核心洞察

  • 视图调度图:该工作将户外 3D 场景生成的视图规划抽象为有向生成图(directed generation graph)的构造,利用节点表示锚视图、边表示插值轨迹,并自动求解最优调度顺序。与先前方法依赖人工预设或简单启发式不同,这套机制能应对大规模、无边界几何带来的覆盖率与稳定性挑战,为城市场景生成提供了可扩展的自动化方案。
  • 对象级条件:通过为场景中每个物体分配单独的身份图像(identity image)和几何依附度参数(geometry-adherence parameter),该框架实现了细粒度控制:外观上可利用参考图引导纹理生成;几何上可独立设定物体与输入几何的贴合程度。相比现有全局条件或场景级注入,这种对象级操控使生成结果更易于满足特定设计意图,且在保持整体一致性的同时允许局部灵活变动。

方法

输入与总体流程

用户提供 outdoor geometry(非结构、无界的室外三维几何),SceneFrom3D 自动生成三维场景。整体分为三阶段:视图调度多视图生成三维重建

视图调度:自动构建有向生成图

针对室外场景空间大、无规则的特点,传统手工定义视图排程的方法覆盖不足且不稳定。SceneFrom3D 构建一个有向生成图,节点代表锚点视图,边代表插值轨迹,同时定义生成顺序。

  • 节点构建:在几何表面采样初始相机位姿,通过可见性度量(综合距离、视野范围、前向朝向等因子)筛选高可见位置。随后用倾斜损失 ℒ_tilt 确保视角平稳,排斥损失 ℒ_rep 使采样点分布均匀,最终优化得到锚点视图位姿。
  • 边构建:在节点间根据空间邻近性建立插值路径,形成图边。
  • 方向构建:为每条边赋予方向,决定多视图生成的先后顺序,保证生成质量。

多视图生成:物体级控制

  • 锚点视图生成:对每个锚点视图,输入身份图像(identity image)为场景中的物体提供外观参考,并引入几何依从参数(geometry-adherence parameter)在区域级别控制生成图像对输入几何的顺应程度(例如墙壁、地面可强约束,植被可松散约束)。利用预训练的扩散模型从这些条件合成多视角图像。
  • 锚点视图插值:使用视频插值模型在有序锚点视图间生成平滑过渡帧,获得致密的多视角观测序列。

三维重建

基于生成的多视角图像,通过 3DGS 优化(结合深度损失和 LPIPS 损失)重建最终的三维高斯泼溅场景,支持实时渲染。

与同类方法的差异

将视图调度从人工规则升级为基于可见度与优化的自动图构建,并首次在室外几何条件生成中引入物体级外观与几何依从的精细控制。

实验

实验设计

SceneFrom3D 在几何条件化的室外场景生成任务上进行评估。作者通过 自动视角调度对象级条件控制 以及基于 3DGS 的重建流水线,与现有基线方法进行对比。实验设计包括:(1) 场景生成质量的定性定量评估;(2) 与 baseline 方法的系统对比;(3) 针对调度损失函数、视频插值模块、精细化循环等关键组件的消融研究;(4) 几何贴合控制参数的分析。

关键发现

  • 视角调度有效性:自动构建的生成图确保了室外场景的全覆盖与生成稳定性,解决了手工定义视角的瓶颈。
  • 对象级控制提升:通过身份图像和几何贴合参数,用户可独立调节每个物体的外观和形状约束,实现精细控制。
  • 消融实验验证:倾斜损失 ℒ_tilt排斥损失 ℒ_rep 对视角质量至关重要;视频插值增强了视图间一致性;精细化循环进一步优化生成质量。
  • SOTA 性能:在视觉质量、几何一致性和生成可控性上均优于现有方法。

与基线的深度对比

与传统的三阶段生成方法相比,SceneFrom3D 不再依赖预定义的固定视角路径,而是基于输入几何动态生成 有向生成图,这显著提升了室外无界场景的生成鲁棒性。在基线方法中,视角调度通常需要人工设置或采用均匀采样,导致覆盖不足或生成伪影;SceneFrom3D 通过 节点构建-边构建-方向构建 的自动化流程,实现了视角覆盖率与生成质量的平衡。此外,对象级条件控制让几何贴合不再是全局统一约束,而是可细粒度调节,这在基线方法中几乎不可实现。消融实验证明,移除任何关键组件都会导致性能退化。

行业影响

落地场景

SceneFrom3D 的几何条件户外3D场景生成能力,可快速将用户提供的粗糙几何轮廓转化为逼真3D环境,直接影响以下领域

  • 游戏与影视内容制作:自动生成开放世界地图、电影预可视化场景,减少关卡设计师的手工重复劳动。
  • 自动驾驶仿真:根据道路几何输入生成多样化的街景,为感知与规划模型提供无限训练数据。
  • 电商与房产展示:基于户型图或户外景观草图,直接生成可交互的3D导览,替代实地拍摄。
  • 增强现实(AR)/虚拟现实(VR):动态生成用户所在环境的虚拟叠加内容,增强沉浸感。

商业价值

  • 降本增效:将传统手动3D建模的人天成本降低至分钟级,尤其适合需快速迭代场景的团队(如游戏工作室、设计公司)。
  • 体验升级:对象级外观控制(identity image)与几何贴合度参数可让非专业人士精确调控场景细节,拓宽创作者经济。
  • 商业模式创新:SaaS化的3D场景生成API可为内容平台提供按需服务,开辟新的订阅收入流。

与现有产品/工作流的集成

SceneFrom3D 采用视图调度→多视图生成→3DGS重建的三阶段设计,天然适配现有图形管线:

  • 输出为 3D Gaussian Splatting (3DGS) 表示,可直接加载至 Unreal Engine / Unity 或 WebGL 前端,无需额外转换。
  • 对象级条件(identity image + 语义mask)可通过插件形式接入Blender / Maya,作为生成式辅助工具。
  • 自动驾驶仿真平台(如 CARLA / AirSim)可将路面几何作为输入,批量生成带语义控制的街景序列,提升模型的泛化性。

具体用例

  1. 家具电商的3D场景生成:商家上传产品模型和一张户外庭院草图,SceneFrom3D 自动生成带交互的虚拟庭院,用户可更换家具外观(identity image)实时预览效果,提升转化率。
  2. 车企的智能驾驶测试:工程师仅需提供城市路网几何,即生成多样化的街景(不同天气、建筑风格),用于端到端模型的闭环训练,显著降低实车路采成本。

局限

  • **依赖于预训练多视图生成模型的质量与一致性**:SceneFrom3D 沿用三阶段管线,多视图生成阶段需要预训练的 view interpolation 模型和 anchor-view 生成器。这些模型的局限性(如细节丢失、视点间不一致、对特定对象类别泛化不足)会直接传递到最终场景,且论文未讨论当生成失败时如何优雅回退或人机协作修正。
  • **对复杂地形或高度遮挡区域的鲁棒性未充分验证**:视图调度中的可见性度量基于表面采样和启发式打分(视场角、距离、前向朝向),在极端地形(如陡峭斜坡、洞穴状结构)或密集植被遮挡下,优化得到的 anchor views 可能无法保证充分覆盖,导致重建空洞。实验场景相对规整,缺少对此类困难情况的定量分析。
  • **对象级控制依赖用户提供身份图像与几何黏附参数**:虽然允许精细控制,但要求为每个对象准备身份图像(理想视角、干净背景)增加了人工负担,且几何黏附参数需要手工调整以平衡外观保持与几何贴合,自动化程度不足。当场景包含大量对象时,用户交互成本显著升高,不利于大规模场景的快速原型设计。
论文Geonung Kim2026-07-05原文

相关内容