论文

SynCity 3000: 引导场景级3D扩散

SynCity 3000: 引导场景级3D扩散

当前图像到3D生成器能从单张图像生成复杂3D资产,但扩展到整个场景时面临全局一致性和细粒度布局控制的挑战。为此,我们提出 SynCity 3000 框架,通过将生成器适配为 卷积算子,实现任意规模和复杂度的连贯3D场景生成。 方法上,我们首先设计了一个 合成数据引擎,生成大量场景级训练数据以缓解真实3D场景数据稀缺问题。然后对图像到3D生成器进行 微调,使其能作为卷积算子逐块处理场景。推理时,根据用户提示生成整个场景的 等轴测图像(dimetric image),再通过微调后的生成器逐块生成并融合,得到最终场景。 实验表明,SynCity 3000 在多样化的提示和布局下,能输出大范围、连贯且细节丰富的3D场景,有效克服了先前方法在场景生成中的碎片化和一致性不足问题。

论文精读

TL;DR SynCity 3000 将单物体图像到 3D 生成器改造为卷积算子,通过合成数据微调,从轴测图直接生成全局连贯、可控制布局的大规模 3D 场景。

问题

问题背景

3D 内容自动生成正从单物体向完整场景级创作演进,直接影响影视、游戏、仿真等万亿级产业的管线效率。

现有方法局限

当前主流的 image-to-3D 生成器(如 Zero-1-to-3LGM 等)能够从单张图像重建高质量单个资产,但其设计局限于固定尺寸的输入输出,无法直接处理场景规模的全局结构:

  • 缺乏平移等变性:模型无法在图像的不同空间位置以相同方式生成 3D,因此不能滑动窗口式地铺设场景。
  • 缺少场景级数据:训练仅用单物体数据集,导致对多物体空间关系的理解缺失。
  • 布局控制弱:基于语言或粗略 sketch 的方法无法提供精确的物体位置与边界控制,生成结果常出现漂浮、重叠或比例失衡。

为什么这个问题难且重要

  • 技术挑战:将单物体生成器改造为卷积算子,既需要保持其生成质量,又要使其具备对空间坐标的敏感性;同时,训练所需的场景级 3D 数据极度稀缺,手工标注成本高昂。
  • 管线价值:场景生成是 3D 制作流程的“最后难题”,若能解决,可将原画师或 layout 艺术家数周的工作压缩至分钟级,因此业界高度关注。

行业类比

类似于 视频扩散模型 从单帧生成扩展到时序一致性生成,3D 场景级扩散也需要在空间维度引入“全局一致性”的归纳偏置,其解决思路可启发自动驾驶仿真、数字孪生等需要大规模多样化虚拟场景的领域。

核心洞察

  • 将 image-to-3D 生成器改造为卷积算子,是实现大规模 3D 场景可控生成的一种简洁而有效的工程范式。不同于以往先分解场景再组装或依赖隐式表示的方法,SynCity 3000 直接对场景的俯视投影图进行滑窗式生成,通过引入位置编码和将单目标模型 fine-tune 为可处理稀疏、重叠上下文的卷积核,每次调用生成局部 3D 结构,最终融合成全场景。这种算子化转换消除了场景边界限制,使生成大小可扩展,且布局控制自然而灵活,为 3D 内容管线提供了类似图像卷积的便利性。
  • 利用合成数据引擎自举训练策略,突破了 3D 场景生成的数据瓶颈。3D 场景的标注数据极为稀缺,而 SynCity 3000 提出了一套完整的样本生成管线,自动组合单个 3D 资产并渲染成具有重叠上下文的训练对,再用于 fine-tune 基础生成器。这种“用合成数据教会模型生成合成数据”的循环,不仅有效绕过了真实数据需求,还使模型学到了场景级别的连续性和一致性。与直接使用有限真实数据的方案相比,该方法在成本、多样性和可控性上具有明显优势,为数据饥渴的 3D 生成领域提供了一种高可行性的落地参考。

方法

方法概览

SynCity 3000 将单物体的图像到 3D 生成器扩展为场景级生成框架,核心思路是把生成器当作卷积算子,在整张场景图上滑动卷积,从而输出任意大小的 3D 场景。方法分为三个阶段。

1. 二维模板生成

用户提供文本提示词,系统首先调用一个二维扩散模型(如 Stable Diffusion),生成一张等轴测投影(dimetric projection)的鸟瞰图。这张图像作为整个场景的布局蓝图,规定了物体分布、道路走向、建筑位置等全局结构,并保留从任意视点观察时的空间一致性。

2. 图像到 3D 生成器的卷积化改造

直接应用现有单物体生成器会导致场景块之间不连贯。为此,作者构建了一个合成数据引擎,自动生成大量场景类训练数据:将多个三维资产按随机布局放入场景,从不同视角渲染出图像和对应的三维体素或高斯表示。随后,在一个预训练的单物体图像到 3D 扩散模型上,对编码器的自注意力层加入位置编码(positional encoding),并用这些合成场景数据微调整个模型。微调后,模型能理解输入图像块在全局场景中的位置,且当以卷积方式滑动窗口处理图像时,各窗口输出的三维内容之间保持几何与语义一致性。

3. 卷积式场景推理

将第一步得到的等轴测图像划分为有重叠的网格窗口。每个窗口送入微调后的生成器,同时注入该窗口的位置编码,生成对应区域的三维表示(如 3D 高斯泼溅)。由于生成器本质是卷积算子,不同窗口的计算共享权重,输出的三维块可无缝拼接成完整场景。最后通过重叠区域融合与全局优化消除接缝,得到完整的 3D 场景。

与同类方法的差异:现有场景生成方法多先生成布局再填充资产,或直接一次性预测固定大小的场景,难以扩展规模且常丢失局部细节。SynCity 3000 首次将图像到 3D 生成器转化为卷积算子,通过位置编码注入全局上下文,在保持任意大场景全局一致的同时,保留了高保真度的局部几何与纹理。

实验

实验设计

作者借助自研的合成数据引擎生成大量“场景式”训练数据,微调图像到 3D 生成器,使其具备卷积运算能力。评估时,先用文本生成场景的 dimetric 图像,再将卷积生成器在该图像上滑动,逐块生成 3D 内容并拼接,得到任意尺寸的场景。对比实验覆盖了基于图像、基于资产以及显式场景生成的多种基线方法,通过定性分析、用户研究以及消融实验(卷积操作、合成数据微调等模块)验证各组件贡献。

关键发现

  • 全局连贯性:SynCity 3000 能生成大规模、全局一致的 3D 场景,克服了分块生成中常见的接缝和语义断裂。
  • 细节与可控性:在保持高密度几何和丰富纹理的同时,支持通过文本或布局对场景进行细粒度控制。
  • 扩展性:卷积式生成使得场景大小仅受显存和图像尺寸限制,理论上可无限扩展。

基线对比解读

相比传统“先产资产再拼搭”的做法,SynCity 3000 直接从图像像素到 3D 场景,避免了资产库局限和拼凑痕迹。与端到端场景生成方法相比,其卷积式设计天然保证了相邻区域的空间平滑过渡,而无需额外后处理。消融实验进一步表明,合成数据微调是保证模型适应场景级生成的关键,若去除则会导致生成质量显著下滑。总体来看,该方法填补了从单物体到完整场景生成的空白,为后续高保真、可编辑 3D 环境构建提供了新范式。

行业影响

落地场景

SynCity 3000 能够从文本描述直接生成大规模、连贯的 3D 场景,并支持细粒度的布局控制,可赋能以下典型业务:

  • 影视与游戏预演:快速生成概念场景的 3D 原型,加速美术讨论和导演预览,减少前期手工搭建成本。
  • 虚拟现实与数字孪生:为 VR 培训、线上展厅或工业仿真按需生成场景变体,支持交互式内容产出。
  • 电商与广告视觉内容:围绕商品自动生成风格一致的 3D 空间背景,批量产出用于产品展示的渲染图或环物视频。

商业价值

  • 降本:场景搭建从人工建模转向自动化生成,可将单个场景的制作周期从天级压缩到分钟级,显著降低美术外包或内部劳动力成本。
  • 增收与体验提升:支持快速迭代和大量变体输出,使内容平台、游戏工作室能够更频繁地更新场景内容,维持用户活跃度;在电商领域,通过高质 3D 展示提升转化率。
  • 风险规避:合成数据引擎生成的场景数据可规避真实场景的版权与隐私问题,方便商用。

与现有产品/工作流的集成

  • 3D 创作工具插件:通过集成到 BlenderUnreal EngineUnity 的工作流中,作为场景起点生成器,艺术家可进一步编辑和细化。
  • 云端 API 服务:以类似 Midjourney 的文生图模式提供文生 3D 场景 API,嵌入内容管理平台或自动化渲染管线,接收布局参数并输出场景资产。
  • 训练数据增强:合成场景可作为自动驾驶仿真或机器人训练的环境数据补充,与现有仿真框架(如 Isaac Sim)对接。

具体落地 Use Case

  1. 电商平台商品视觉生成:某跨国电商平台需要为每年数万款新品生成不同场景的 3D 渲染图。团队利用 SynCity 3000 根据商品属性(如“户外露营椅”)生成森林、沙漠、湖岸等布局可控的 3D 场景,自动适配摄像机角度并批量渲染,代替传统摄影棚费用,将单 SKU 的视觉生产周期从 3 天降至 4 小时。

  2. 虚拟制片 Previs:一影视制作工作室在剧本讨论阶段使用该框架,快速将分镜脚本转换为可漫游的 3D 城市或建筑群落,导演与摄影师在虚拟环境中确定机位和光照方案,显著减少后期实拍返工率,并可将预演资产直接用于后期视效背景。

局限

  • **纹理细节丢失与卡通化外观**:由于训练数据完全由合成数据引擎生成,模型生成的 3D 场景在纹理真实感和材质多样性上明显不足,整体风格偏向卡通化。这在需要高保真视觉质量的游戏、影视应用中构成瓶颈。虽然在合成域内效果可接受,但跨域泛化到真实照片级场景时出现严重退化。
  • **布局控制粒度有限**:用户通过 2D 模板图像间接控制场景布局,难以精确指定物体的位置、朝向和交互关系,对于需要精细编辑的场景设计(如建筑可视化)不适用。此外,非专业用户生成高质量 dimetric 模板存在门槛,限制了工具的易用性。
  • **结构重复与透视失真**:卷积形式的生成器在滑动窗口推理时可能产生重复纹理或结构,尤其是在大场景中,缺乏对全局一致性的显式约束。同时,dimetric 投影失去了透视信息,导致生成的 3D 场景在自由视角下可能出现透视扭曲,影响沉浸感。
论文Paul Engstler2026-07-06原文

相关内容