论文

BRDFusion: 物理与生成相结合用于城市场景逆渲染

BRDFusion: 物理与生成相结合用于城市场景逆渲染

从捕获视频中逆渲染城市场景能够支持众多应用,包括内容创建和自动驾驶模拟。基于物理的渲染方法遵循并控制光照物理,但存在重建和渲染伪影。而生成模型能生成逼真的视频,但一致性和可控性有限。我们提出 BRDFusion,一个统一框架,结合了两种互补模型用于逆渲染和正渲染。具体来说,BRDFusion 通过物理建模恢复显式、一致的场景属性,并利用生成先验缓解优化歧义。在正渲染过程中,物理模型提供基于场景配置的可控渲染,生成模型则去噪并修复伪影。因此,我们的方法能够生成高质量视频,同时允许精确控制,在真实和合成场景中均优于基线方法。此外,BRDFusion 支持新颖视角重光照、夜间模拟以及动态物体插入/编辑。项目页面:https://shigon255.github.io/brdfusion-page/

论文精读

TL;DR BRDFusion 结合物理建模与生成先验,实现城市场景高质量、可控的逆渲染与正向渲染,有效消除伪影并支持新视角重光照、夜模拟等应用。

问题

城市街景的逆渲染(inverse rendering)旨在从拍摄视频中恢复场景的几何、材质与光照等物理属性,支撑内容创作、自动驾驶仿真与增强现实等应用。该领域长期面临 真实感可控性 的权衡:既要渲染出照片级画质,又需对光照、视角甚至动态物体进行灵活操纵。

现有方法大致分为两类:

  • 基于物理的渲染(PBR)方法 遵循光照传输方程,可显式分解场景属性并提供操控接口,但重建过程极易受优化歧义(如材质-光照耦合)影响,产生明显的渲染伪影和几何噪声。
  • 生成式模型(如视频扩散模型)能合成高度逼真的连续帧,却缺乏对场景结构的显式建模,难以保证多帧间几何一致性,无法支持重新打光、视角外推或物体编辑等精确控制。

该问题的挑战在于:物理建模与生成能力本质互补,但直接串联或切换会引入新的不一致。物理重建的误差会累积,而生成先验若不加约束又会破坏物理合理性。业界对 同时满足高质量渲染与细粒度操控 的解决方案需求强烈,尤其在自动驾驶仿真(需夜晚场景、动态障碍物插入)和影视预演(需灵活打光与重照明)中,任何渲染瑕疵都可能导致仿真偏差或视觉瑕疵。

可以类比 NeRF 与扩散模型的结合:NeRF 提供连续场景表征与可控重渲染,但面对稀疏视角或复杂光照易失败;扩散模型可修复视图缺失,却无法保证 3D 一致性。一种理想的方案应让两者协同,而非简单堆砌。

核心洞察

  • 物理建模与生成先验的双向协同:BRDFusion 不是简单拼接,而是让物理模型和生成模型在逆渲染与正向渲染两个方向相互增强:逆渲染时用生成先验正则化优化,避免材质和光照估计陷入局部歧义;正向渲染时物理模型提供精确可控的渲染,生成模型作为后处理去噪和修复伪影。这与以往要么纯物理(NeRF-based inverse rendering)常有黑斑和闪烁,要么纯生成(如 InfiniCity)能生成逼真视频但无法精确控制物体、光照的路线截然不同,真正实现了可控且逼真的统一框架。
  • 以可微渲染为纽带实现“精确控制+自由生成”:关键创新在于利用可微渲染管线输出显式场景表示(材质、光照、几何),同时用扩散模型对渲染结果进行保真度增强。这保留了传统图形管线允许任意参数调整(相机、材质、光照)的优势,又用生成模型弥补了重建误差。其他工作如 UrbanIR 或 IBL-NeRF 专注于更好的逆渲染,但正向渲染仍依赖物理引擎,质量受限于模型精度;BRDFusion 引入生成去噪步骤,大幅提升最终输出质量。这给工程启示:可以将生成模型视为一个“可学习的后处理”,而非替代整个渲染流程。

方法

方法总览

BRDFusion 面向城市视频的逆渲染与可控新视角生成,采用 物理建模 + 生成先验 双分支协作框架,从输入视频中恢复一致的场景属性,并支持高保真重合成。

输入 → 关键模块

  1. 逆渲染阶段

    • 输入:单目或运动视频拍摄的城市街景。
    • 物理分支:基于可微分渲染与 BRDF 模型,显式估计 几何(深度/法向)材质(漫反射/镜面反射)光照(环境图与光源位置) 等属性。
    • 生成分支:引入扩散模型或 GAN 作为先验,在优化过程中提供“可能场景”的分布约束,缓解物理估计中的模糊性(例如低纹理区域、反射/透明表面造成的歧义)。
    • 训练技巧:物理损失(光度、法向一致性)与感知损失(VGG/CLIP 特征距离)混合,生成先验通过 latent 空间正则化项参与优化,避免陷入局部极值。
  2. 前向渲染与修复阶段

    • 给定恢复的场景配置,物理渲染器生成基础视图(如改变相机位姿、光照方向)。
    • 该基础渲染通常存在孔洞、噪点或边缘闪烁等瑕疵,此时启用 生成修复模块
      • 将物理渲染结果作为条件输入到生成模型(例如 Stable Diffusion 的条件 in-painting 管道),利用生成先验填补缺失区域、提高纹理细节,同时保持整体一致性。
      • 可选的 时序平滑 对生成帧序列施加光流约束,减少帧间闪烁。

输出

  • 高质量 自由视角、重光照、昼夜转换 的视频。
  • 支持 动态物体插入/编辑:先渲染物理一致的静态场景,再通过生成模型将新物体无缝融合。

与同类方法的差异

相比纯物理逆渲染(如 NeRF-based 方法)常产生模糊或错误的重建,以及纯生成模型(如视频扩散模型)难以精确控制视角和光照,BRDFusion 通过物理与生成的闭环协作,首次在城市场景中同时实现 精确可控性高真实感视频合成

实验

实验设计

BRDFusion 在真实与合成城市驾驶场景上进行评估,验证其逆渲染恢复场景属性(几何、材质、光照)的能力,以及前向渲染生成高质量可控视频的效果。实验主要分为三部分:

  • 场景重建质量:对比恢复的几何与材质参数在重投影误差、法线一致性等物理指标上的表现。
  • 渲染保真度与可控性:在新视角合成、重光照、夜间仿真等任务中,衡量生成图像与真值之间的失真度,同时测试光照、纹理、物体插入等编辑的响应准确性。
  • 消融研究:逐一移除物理模型、生成先验、去噪模块,观察对重建精确度与渲染真实感的影响。

比较对象包括纯物理可微渲染管线与纯生成式方法(如基于StyleGAN或扩散模型的场景编辑)。

关键发现

  1. 物理与生成互补:物理模型在复杂光照和反射下会出现重建模糊与渲染噪点,生成先验能有效去除这些伪影并填充缺失细节,而生成模型单独使用时缺乏对场景属性的显式控制,会破坏时序一致性。BRDFusion 通过联合优化实现属性一致、渲染真实的输出
  2. 显著超越基线:在真实场景中,BRDFusion 的 PSNR 与 SSIM 指标超过纯物理方法,同时保留了可解释的场景参数;与纯生成方法相比,它提供了精确的光照旋转、材质修改等控制能力,后者往往只能通过隐空间插值产生不可预测的变化。
  3. 任务泛化能力:框架支持新视角重光照夜间模拟动态物体插入与编辑,展现出统一的逆渲染-前向渲染流水线的实用价值。

与基线对比的深度解读

传统物理基方法依赖显式光照方程,优化过程易陷入局部最优,特别是在大面积无纹理区域或镜面反射表面产生条带 artifacts;生成模型如对抗网络扩散模型虽能生成逼真图像,却难以保持跨帧一致性,也无法交互式编辑独立场景属性。BRDFusion 将生成先验作为正则化项嵌入物理优化循环,既缓解了欠定问题的模糊性,又为生成模型引入了可操控的物理约束。这种设计在工业仿真与内容创作中具有启示意义:对于需要同时满足视觉真实性和可控性的应用,直接拼接黑盒生成模型与物理引擎并非最优,而应在优化过程中深度融合两种范式。未来工作可沿材质与光照的解耦粒度大规模动态场景扩展方向继续提升框架的鲁棒性。

行业影响

落地场景

BRDFusion 可直接应用于 自动驾驶仿真影视特效与虚拟制片游戏场景生成 以及 城市数字孪生 等产品线。它从真实视频中恢复城市场景的显式几何、材质与光照,支持新视角重光照、夜景模拟和动态物体插入,让仿真平台能以低成本获取高逼真、可编辑的驾驶环境。影视和游戏团队可利用它快速生成同一地点在不同天气、时间下的渲染结果,加速内容迭代。

商业价值

  • 降本:替代昂贵且耗时的城市场景物理扫描或人工建模,从视频自动重建可控三维资产,大幅降低自动驾驶数据采集与标注成本,缩短影视后期场景制作周期。
  • 增收:为仿真产品提供差异化能力,例如向车企或自动驾驶公司出售高质量、多样化的场景生成服务,提升产品竞争力。
  • 体验提升:生成结果无物理渲染常见的伪影,且具备生成模型的真实感,使仿真画面的视觉效果更贴近真实摄像头,改善感知模型训练的域迁移性能,并提高虚拟预览的沉浸感。

与现有工作流的集成

BRDFusion 的逆渲染输出为标准的 PBR 材质网格环境光照,可直接导入 Unreal EngineBlenderNVIDIA Omniverse 等主流引擎。其正向渲染模块可作为插件或微服务嵌入仿真闭环,为 CARLA、Drive Sim 等平台提供动态场景素材。通过部署生成模型去噪的后处理步骤,它可与现有渲染管线无缝结合,仅替换有伪影的区域,而无需推翻现有流程。

具体落地用例

  1. 自动驾驶感知模型训练:某自动驾驶公司从城市道路采集的数千小时视频中,用 BRDFusion 重建交叉路口的三维场景,批量渲染不同光照、季节和车流配置的图像,从而生成稀有长尾场景,弥补真实数据不足,提升感知算法在夜间或逆光条件下的鲁棒性。
  2. 影视虚拟制片:特效团队为一部都市题材电影拍摄参考视频后,快速生成整个街区的数字孪生,并实时调整灯光方向和天色,导演可通过 VR 预览不同叙事氛围下的画面,显著减少现场布光和补拍成本。

局限

  • 物理建模依赖简化光照假设(如漫反射与低阶 SH),对城市场景中普遍存在的镜面反射、各向异性材质和复杂间接光照重建能力不足,导致逆向阶段恢复的材质参数存在系统偏差,限制了在玻璃幕墙、金属表面等场景的再现质量。这一弱点在同轴物理基方法中普遍存在,但结合生成先验时可能被掩盖而非真正解决。
  • 生成先验虽能填补视觉缺失,但可能引入非物理的纹理伪造。当训练数据分布与测试场景差距较大时,网络倾向于生成似真但不符合场景固有属性的细节,例如错误的反射或阴影方向,损害了渲染结果的可控性和几何一致性。在正向渲染中,去噪步骤也可能抹除有益的物理细节,折损重光照精度。
  • 推理效率是实际部署的关键瓶颈。每帧需迭代优化 BRDF 参数、再经生成网络修复,内存与计算开销显著高于纯物理或纯生成方法。论文未提供端到端推理时间对比,对于需要实时仿真的自动驾驶测试等场景,当前框架难以直接应用,需模型压缩或高效采样等工程优化。
论文Yi-Ruei Liu2026-06-15原文

相关内容