RenderFormer-V2:异构场景基元神经渲染
我们提出 RenderFormer-V2,一种统一的、基于学习的 transformer 神经渲染模型,与当代基于物理的渲染系统互补。它无需逐场景训练或专用代码,即可处理 焦散、体积散射、环境光照、带纹理与置换的表面,以及 分布外材料 等多种光传输效果。 RenderFormer-V2 将全局光传输建模为 序列到序列变换。沿用前作的两阶段流程:视图无关阶段解析场景内基元间的传输,视图相关阶段将内部 神经场景表示 转换为图像像素。与 RenderFormer 不同,该模型在视图无关阶段引入新颖的 窗口注意力 与渲染启发的 注意力汇(attention sink)相结合,在保持渲染精度的同时提升可扩展性。 为增强通用性,RenderFormer-V2 支持 异构场景基元,包括环境贴图和参与介质;并采用独立于底层表面反射模型的 材质编码,通过新颖的 神经嵌入 编码材质外观。我们在多种场景上验证其通用性,并对改进的注意力机制进行了广泛消融实验。
论文精读
TL;DR RenderFormer-V2 将全局光传输建模为序列到序列变换,以两阶段 Transformer 架构统一处理焦散、体积散射、环境光照与异质材质,无需逐场景训练;窗口注意力 + 渲染感知 attention sink 提升可扩展性与精度。
问题
问题背景
神经渲染领域的核心目标之一,是构建一个统一的模型,能替代或补充传统物理渲染系统,处理复杂的全局光传输效果(如焦散、体积散射、环境光照、位移表面及分布外材质),且无需逐场景训练或编写专用代码。
现有方法局限
- 物理渲染系统 需要针对不同光传输路径和表面模型手写专用代码,渲染质量依赖大量采样与调参,成本高。
- 早期神经渲染模型 多数需要 per-scene 训练或只支持单一效果,难以泛化到新场景;此前 RenderFormer 采用全自注意力机制,序列长度随场景 primitive 数量二次增长,可扩展性受限。
- 材质编码 通常绑定特定 BRDF 模型(如 Disney BSDF),无法灵活适配各种反射模型;场景表示也缺少对参与介质、环境贴图等异构 primitive 的统一支持。
为什么这个问题难/重要
全局光传输本质上是场景中大量 primitive 之间的能量交换,需建模长程依赖;同时场景 primitive 类型多样、规模差异大,要求模型既能捕捉全局交互又保持计算效率。业界对 通用神经渲染 的关注日益增加,因为一个无需重训、能处理多样化场景的模型可大幅降低内容生产与渲染管线成本。
行业类比
这与 通用大语言模型 用统一序列到序列架构处理多种自然语言任务的设计思路相似,目标都是“一次训练,多场景复用”。
核心洞察
- RenderFormer-V2 将全局光传输建模为序列到序列变换,实现统一处理多种光传输效果的神经渲染模型。区别于需要每场景训练或专用代码的方法,它无需逐场景优化即可处理焦散、体积散射、环境光照等复杂效果,这为可泛化的渲染模型提供了新范式。
- 引入渲染感知的 attention sink 与窗口注意力结合,在保持渲染精度的同时提升长序列可扩展性。原始 RenderFormer 使用全注意力,在大场景或高分辨率下计算代价高;新机制通过注意力汇降低复杂度,并利用渲染先验引导注意力分配,解决了神经渲染中长程依赖与计算效率的平衡问题。
- 支持异构场景基元与材质嵌入独立于表面反射模型,增强模型对多样化场景和未见材质的泛化能力。传统神经渲染模型通常针对同质基元或特定材质模型设计,RenderFormer-V2 通过统一嵌入环境贴图、参与介质、纹理表面等,使模型能处理更广泛的实际场景,降低了部署时对材质模型先验知识的依赖。
方法
输入与场景嵌入
RenderFormer-V2 接收 异构场景基元(heterogeneous scene primitives),包括三角网格、体素(参与介质)、三角光源、环境贴图及相机。每种基元通过独立嵌入模块编码为统一 token:
- 三角网格:顶点、法线、材质、纹理分别嵌入;材质采用与表面反射模型无关的 神经嵌入,支持 out-of-distribution 外观。
- 体素:嵌入旋转、缩放、散射与吸收系数,处理体积散射。
- 光源 / 环境贴图:编码方向、纹理与强度。
- 相机:编码内外参。
两阶段 Transformer 架构
模型以 序列到序列 方式建模全局光传输,分为两个阶段:
View-independent 阶段(场景内部传输)
将所有场景 token 输入 Transformer,解析基元间光传输。核心创新为 组合窗注意力 + 渲染感知的 attention sink:- 窗注意力:将 token 按空间邻近或语义分组,限制注意力范围,提升长序列可扩展性。
- Attention sink:引入专门 sink token 聚合跨窗口的全局光照信息,弥补窗口化带来的全局信息缺失,维持渲染精度。
View-dependent 阶段(图像解码)
结合相机 token,将内部神经场景表示转换为指定视角的像素颜色,输出最终渲染图像。
训练与优化
训练基于大量合成场景,使用渲染损失(如 L2 或感知损失)对比预测图像与参考图像,并通过两阶段逐步细化。模型无需 per-scene 训练或专用代码,可处理焦散、体积散射、环境光照、纹理位移表面等多样效果。
与同类方法差异:相较前代 RenderFormer,V2 通过窗注意力 + attention sink 显著提升可扩展性,并首次统一支持异构基元与模型无关材质编码,无需为特定光传输效果编写专用模块。
实验
实验设计
- 作者在多种合成场景中评估 RenderFormer-V2 对 焦散、体散射、环境光照、纹理/位移表面 及 分布外材质 的全局光传输能力。
- 模型采用两阶段序列到序列:view-independent 阶段解析图元间传输,view-dependent 阶段生成像素。
- 重点消融 windowed-attention 与 rendering-informed attention sink 组合,对比基线 RenderFormer。
- 对比维度包括架构差异、定性渲染质量、分辨率可扩展性与完整指标。
关键发现
- 新注意力机制在保持渲染精度的同时显著提升长序列可扩展性,缓解标准 Transformer 的注意力复杂度瓶颈。
- 支持 异构场景图元(环境贴图、参与介质、三角形光源、体素)后,模型无需逐场景训练或专用代码即可处理复杂光传输。
- 材质神经嵌入 独立于底层表面反射模型,使分布外材质泛化成为可能。
与基线对比
- 相比 RenderFormer,RenderFormer-V2 通过窗口化注意力和渲染感知的 attention sink 重新组织全局 token 交互,减少冗余计算,但论文未披露具体 PSNR/SSIM 数值,因此无法给出定量提升幅度。
- 定性结果表明新架构在焦散、体散射等长程依赖场景下渲染噪声控制更好;分辨率扩展性实验则指向物体级可扩展的趋势。
- 对实际工程启示:若需在统一神经渲染管线中接入异构图元,可参考两阶段 token 化与排序序列化策略;注意力机制设计需权衡全局交互与计算预算。
行业影响
落地场景
RenderFormer-V2 作为统一神经渲染模型,可嵌入需要高频生成高质量光照效果但避免逐场景调参的业务。典型 use case:
- 电商 3D 商品展示:商家上传 CAD 模型后,模型自动处理焦散、纹理位移、环境光照等复杂效果,生成逼真渲染图,无需人工设置光源和材质参数。
- 电影/游戏预可视化:在资产迭代早期快速预览全局光传输效果,帮助导演或美术确认光照方向,减少传统渲染农场等待时间。
商业价值
商业价值主要体现在降本和体验提升两条线:
- 降本:替代部分离线渲染任务,减少渲染农场硬件消耗和美术调参时间,尤其适合大量小场景的快速出图。
- 体验提升:交互式设计工具中可实时预览焦散、体散射等复杂效果,提升设计迭代效率;同时让中小团队以较低成本获得接近物理渲染的视觉质量。
工作流接口
模型采用两阶段序列到序列架构,输出直接为图像像素,可无缝接入现有渲染管线:
- 作为 Blender / Unreal Engine 插件,在视口中提供近似物理渲染的预览,最终出图仍可切换到物理渲染器。
- 通过 云渲染 API 提供按需渲染服务,客户端上传场景基元(三角形、体素、环境贴图等),服务端返回渲染图像,适合 SaaS 集成。
- 与物理渲染系统互补:先由 RenderFormer-V2 快速生成预览,再对重点镜头使用路径追踪精细渲染。
局限
- 尽管采用了 windowed-attention 和 attention sink 提升可扩展性,模型仍依赖大规模多样化训练数据;对于训练分布外的极端几何、复杂介质散射或非标准材质,泛化能力可能有限。新增异构图元(如 environment map、participating media)需要预定义嵌入模块,扩展新的场景图元类型仍需修改架构并重新训练,灵活性受限。
- 论文未报告实时渲染或交互帧率性能;与专门优化的物理渲染器或 per-scene 神经渲染相比,推理计算量仍可能较高,限制在 AR/VR、游戏引擎等延迟敏感场景中的应用。此外,窗口注意力机制虽然降低了复杂度,但可能牺牲部分长程光传输的精确建模,尤其在焦散和体散射的高频细节上。
- 与物理仿真相比,神经渲染缺乏严格误差界,近似误差不可控;对于需要物理精确性的工程仿真、照明设计等任务,RenderFormer-V2 不能替代传统路径追踪。对比前代 RenderFormer,改进主要集中于效率与异构支持,并未在基础渲染质量上实现质的提升。