论文

RenderFormer-V2:异构场景基元神经渲染

RenderFormer-V2:异构场景基元神经渲染

我们提出 RenderFormer-V2,一种统一的、基于学习的 transformer 神经渲染模型,与当代基于物理的渲染系统互补。它无需逐场景训练或专用代码,即可处理 焦散、体积散射、环境光照、带纹理与置换的表面,以及 分布外材料 等多种光传输效果。 RenderFormer-V2 将全局光传输建模为 序列到序列变换。沿用前作的两阶段流程:视图无关阶段解析场景内基元间的传输,视图相关阶段将内部 神经场景表示 转换为图像像素。与 RenderFormer 不同,该模型在视图无关阶段引入新颖的 窗口注意力 与渲染启发的 注意力汇(attention sink)相结合,在保持渲染精度的同时提升可扩展性。 为增强通用性,RenderFormer-V2 支持 异构场景基元,包括环境贴图和参与介质;并采用独立于底层表面反射模型的 材质编码,通过新颖的 神经嵌入 编码材质外观。我们在多种场景上验证其通用性,并对改进的注意力机制进行了广泛消融实验。

论文精读

TL;DR RenderFormer-V2 将全局光传输建模为序列到序列变换,以两阶段 Transformer 架构统一处理焦散、体积散射、环境光照与异质材质,无需逐场景训练;窗口注意力 + 渲染感知 attention sink 提升可扩展性与精度。

问题

问题背景

神经渲染领域的核心目标之一,是构建一个统一的模型,能替代或补充传统物理渲染系统,处理复杂的全局光传输效果(如焦散、体积散射、环境光照、位移表面及分布外材质),且无需逐场景训练或编写专用代码。

现有方法局限

  • 物理渲染系统 需要针对不同光传输路径和表面模型手写专用代码,渲染质量依赖大量采样与调参,成本高。
  • 早期神经渲染模型 多数需要 per-scene 训练或只支持单一效果,难以泛化到新场景;此前 RenderFormer 采用全自注意力机制,序列长度随场景 primitive 数量二次增长,可扩展性受限。
  • 材质编码 通常绑定特定 BRDF 模型(如 Disney BSDF),无法灵活适配各种反射模型;场景表示也缺少对参与介质、环境贴图等异构 primitive 的统一支持。

为什么这个问题难/重要

全局光传输本质上是场景中大量 primitive 之间的能量交换,需建模长程依赖;同时场景 primitive 类型多样、规模差异大,要求模型既能捕捉全局交互又保持计算效率。业界对 通用神经渲染 的关注日益增加,因为一个无需重训、能处理多样化场景的模型可大幅降低内容生产与渲染管线成本。

行业类比

这与 通用大语言模型 用统一序列到序列架构处理多种自然语言任务的设计思路相似,目标都是“一次训练,多场景复用”。

核心洞察

  • RenderFormer-V2 将全局光传输建模为序列到序列变换,实现统一处理多种光传输效果的神经渲染模型。区别于需要每场景训练或专用代码的方法,它无需逐场景优化即可处理焦散、体积散射、环境光照等复杂效果,这为可泛化的渲染模型提供了新范式。
  • 引入渲染感知的 attention sink 与窗口注意力结合,在保持渲染精度的同时提升长序列可扩展性。原始 RenderFormer 使用全注意力,在大场景或高分辨率下计算代价高;新机制通过注意力汇降低复杂度,并利用渲染先验引导注意力分配,解决了神经渲染中长程依赖与计算效率的平衡问题。
  • 支持异构场景基元与材质嵌入独立于表面反射模型,增强模型对多样化场景和未见材质的泛化能力。传统神经渲染模型通常针对同质基元或特定材质模型设计,RenderFormer-V2 通过统一嵌入环境贴图、参与介质、纹理表面等,使模型能处理更广泛的实际场景,降低了部署时对材质模型先验知识的依赖。

方法

输入与场景嵌入

RenderFormer-V2 接收 异构场景基元(heterogeneous scene primitives),包括三角网格、体素(参与介质)、三角光源、环境贴图及相机。每种基元通过独立嵌入模块编码为统一 token:

  • 三角网格:顶点、法线、材质、纹理分别嵌入;材质采用与表面反射模型无关的 神经嵌入,支持 out-of-distribution 外观。
  • 体素:嵌入旋转、缩放、散射与吸收系数,处理体积散射。
  • 光源 / 环境贴图:编码方向、纹理与强度。
  • 相机:编码内外参。

两阶段 Transformer 架构

模型以 序列到序列 方式建模全局光传输,分为两个阶段:

  1. View-independent 阶段(场景内部传输)
    将所有场景 token 输入 Transformer,解析基元间光传输。核心创新为 组合窗注意力 + 渲染感知的 attention sink:

    • 窗注意力:将 token 按空间邻近或语义分组,限制注意力范围,提升长序列可扩展性。
    • Attention sink:引入专门 sink token 聚合跨窗口的全局光照信息,弥补窗口化带来的全局信息缺失,维持渲染精度。
  2. View-dependent 阶段(图像解码)
    结合相机 token,将内部神经场景表示转换为指定视角的像素颜色,输出最终渲染图像。

训练与优化

训练基于大量合成场景,使用渲染损失(如 L2 或感知损失)对比预测图像与参考图像,并通过两阶段逐步细化。模型无需 per-scene 训练或专用代码,可处理焦散、体积散射、环境光照、纹理位移表面等多样效果。

与同类方法差异:相较前代 RenderFormer,V2 通过窗注意力 + attention sink 显著提升可扩展性,并首次统一支持异构基元与模型无关材质编码,无需为特定光传输效果编写专用模块。

实验

实验设计

  • 作者在多种合成场景中评估 RenderFormer-V2 对 焦散、体散射、环境光照、纹理/位移表面 及 分布外材质 的全局光传输能力。
  • 模型采用两阶段序列到序列:view-independent 阶段解析图元间传输,view-dependent 阶段生成像素。
  • 重点消融 windowed-attention 与 rendering-informed attention sink 组合,对比基线 RenderFormer。
  • 对比维度包括架构差异、定性渲染质量、分辨率可扩展性与完整指标。

关键发现

  • 新注意力机制在保持渲染精度的同时显著提升长序列可扩展性,缓解标准 Transformer 的注意力复杂度瓶颈。
  • 支持 异构场景图元(环境贴图、参与介质、三角形光源、体素)后,模型无需逐场景训练或专用代码即可处理复杂光传输。
  • 材质神经嵌入 独立于底层表面反射模型,使分布外材质泛化成为可能。

与基线对比

  • 相比 RenderFormer,RenderFormer-V2 通过窗口化注意力和渲染感知的 attention sink 重新组织全局 token 交互,减少冗余计算,但论文未披露具体 PSNR/SSIM 数值,因此无法给出定量提升幅度。
  • 定性结果表明新架构在焦散、体散射等长程依赖场景下渲染噪声控制更好;分辨率扩展性实验则指向物体级可扩展的趋势。
  • 对实际工程启示:若需在统一神经渲染管线中接入异构图元,可参考两阶段 token 化与排序序列化策略;注意力机制设计需权衡全局交互与计算预算。

行业影响

落地场景

RenderFormer-V2 作为统一神经渲染模型,可嵌入需要高频生成高质量光照效果但避免逐场景调参的业务。典型 use case:

  • 电商 3D 商品展示:商家上传 CAD 模型后,模型自动处理焦散、纹理位移、环境光照等复杂效果,生成逼真渲染图,无需人工设置光源和材质参数。
  • 电影/游戏预可视化:在资产迭代早期快速预览全局光传输效果,帮助导演或美术确认光照方向,减少传统渲染农场等待时间。

商业价值

商业价值主要体现在降本和体验提升两条线:

  • 降本:替代部分离线渲染任务,减少渲染农场硬件消耗和美术调参时间,尤其适合大量小场景的快速出图。
  • 体验提升:交互式设计工具中可实时预览焦散、体散射等复杂效果,提升设计迭代效率;同时让中小团队以较低成本获得接近物理渲染的视觉质量。

工作流接口

模型采用两阶段序列到序列架构,输出直接为图像像素,可无缝接入现有渲染管线:

  • 作为 Blender / Unreal Engine 插件,在视口中提供近似物理渲染的预览,最终出图仍可切换到物理渲染器。
  • 通过 云渲染 API 提供按需渲染服务,客户端上传场景基元(三角形、体素、环境贴图等),服务端返回渲染图像,适合 SaaS 集成。
  • 与物理渲染系统互补:先由 RenderFormer-V2 快速生成预览,再对重点镜头使用路径追踪精细渲染。

局限

  • 尽管采用了 windowed-attention 和 attention sink 提升可扩展性,模型仍依赖大规模多样化训练数据;对于训练分布外的极端几何、复杂介质散射或非标准材质,泛化能力可能有限。新增异构图元(如 environment map、participating media)需要预定义嵌入模块,扩展新的场景图元类型仍需修改架构并重新训练,灵活性受限。
  • 论文未报告实时渲染或交互帧率性能;与专门优化的物理渲染器或 per-scene 神经渲染相比,推理计算量仍可能较高,限制在 AR/VR、游戏引擎等延迟敏感场景中的应用。此外,窗口注意力机制虽然降低了复杂度,但可能牺牲部分长程光传输的精确建模,尤其在焦散和体散射的高频细节上。
  • 与物理仿真相比,神经渲染缺乏严格误差界,近似误差不可控;对于需要物理精确性的工程仿真、照明设计等任务,RenderFormer-V2 不能替代传统路径追踪。对比前代 RenderFormer,改进主要集中于效率与异构支持,并未在基础渲染质量上实现质的提升。
论文Chong Zeng2026-09-04原文

相关内容