论文

RayDer: 面向真实世界视频的可扩展自监督新视角合成

RayDer: 面向真实世界视频的可扩展自监督新视角合成

自监督新视角合成 (NVS) 尽管视频数据丰富,但由于在真实视频上训练的脆弱性以及多网络系统设计的缩放行为难以预测,因此扩展仍具挑战。我们提出 RayDer,一个统一的前馈 Transformer,将相机估计、场景重建和渲染整合到单个骨干网络中,将自监督 NVS 转化为一个良态的单模型缩放问题。最小动态状态作为干扰因素,吸收时变内容,使得在无约束真实世界视频上实现稳定训练。重要的是,RayDer 以静态场景 NVS 为目标任务:动态内容仅作为可扩展的监督信号,而非像动态场景 (4D) NVS 那样重建。 在不同模型大小和数据量级(多个数量级)上,RayDer 展现出与数据和计算量呈清晰幂律缩放关系,并优于静态场景数据混合。在大量基准测试中,RayDer 实现了与最先进监督方法相竞争的强零样本开放集性能。项目页面:https://compvis.github.io/rayder

论文精读

TL;DR RayDer 将相机估计、场景重建与渲染统一为单一前馈 Transformer,通过吸收动态内容实现真实视频自监督新视角合成的稳定缩放,零样本开放集性能可比肩监督方法。

问题

问题背景

新视角合成 (NVS) 是 3D 视觉的核心任务,支撑 AR/VR、数字孪生、自动驾驶仿真等应用。自监督方法能直接从真实视频数据中学习,避免了昂贵的人工标注,但将其扩展到大规模、无约束的真实场景仍面临根本性挑战。

现有方法局限

传统自监督 NVS 方案通常采用多网络流水线,将 相机位姿估计场景几何重建新视角渲染 拆分为独立模块。这种做法导致:

  • 训练脆弱:真实视频的动态内容(移动物体、光照变化)极易使姿态估计或深度预测分支崩溃,系统对数据扰动敏感;
  • 缩放行为不可预测:多网络联合优化带来复杂的交互效应,扩大模型或数据规模时性能提升缺乏规律性,难以像大语言模型那样可靠地受益于规模法则 (power-law scaling);
  • 动态场景处理僵硬:多数方法假设场景完全静止,动态元素成为训练噪声,而动态场景重建 (4D NVS) 又面临高昂的计算开销和泛化瓶颈。

为什么这个问题难且重要

真实世界视频天生包含时变内容,自监督学习必须在不依赖显式动态标签的前提下,将运动与静态结构解耦。这要求模型同时解决 运动恢复结构 (SfM) 与基于物理的渲染,而传统的 SfM 方法在大规模多样化视频上的鲁棒性欠佳。此外,业界迫切需要能够利用海量未标注视频数据、平滑缩放且零样本泛化 (zero-shot) 的 NVS 系统,以驱动下一代 3D 内容生成与理解。RayDer 通过将动态视为“滋扰因子”(nuisance),仅将其作为缩放监督信号而不显式重建,从而将问题驯化为一个单模型、可预测缩放的学习任务。

行业类比

该思路类似 自动驾驶中从海量行车记录仪视频自监督学习场景表征:无需标注相机外参、3D 检测框,系统直接从带动态车辆和行人的素材中习得稳定的几何与外观先验,并直接输出新视角图像,用于仿真数据增强或感知模型的闭环训练。

核心洞察

  • 将相机估计、场景重建和渲染整合到一个前馈 Transformer 中,消除了多网络系统扩展时的脆弱性和不可预测性。传统自监督新视角合成通常由分离的位姿估计网络(如 PoseNet)和辐射场网络(如 NeRF)组合而成,联合训练时各组件相互作用难以控制,缩放行为紊乱。RayDer 的单骨干设计将任务重新定义为可预测的单模型扩展问题,使得训练稳定性、收敛行为和性能提升都能随数据量、模型尺寸和算力呈现清晰的幂律规律,这为大规模自监督视觉学习提供了工程上可行的路线图。
  • RayDer 将真实视频中的动态内容视为可丢弃的‘扰动’因子,而不是需要重建的目标。通过预测并 dropout 掉动态状态(如时变的外观变化),模型能够从大量无约束动态视频中提取静态场景的几何与外观信息作为监督,同时保持静态新视角合成作为核心任务不变。这区别于动态场景重建(4D NVS)方法,后者需同时建模场景运动和细节,复杂度高且难以扩展。RayDer 的策略使自监督训练能够利用海量易获取的视频数据而不会引入额外难度,是通往大规模无监督 3D 学习的关键技巧。
  • RayDer 在模型尺寸、数据量和计算量跨越多个数量级的实验中展示出清洁的幂律扩展行为,这在此前的自监督 NVS 工作中未见。 Scaling 行为的发现意味着模型性能改善是可预测的,并且计算最优分配成为可能(如小模型多数据 vs. 大模型少数据的权衡)。更重要的是,该扩展特性在静态场景数据混合物上无法复现,强调真实动态视频在提供丰富几何约束方面具有不可替代性。这为工业级自监督 3D 系统提供了资源规划基准和训练数据设计原则。

方法

方法概述

RayDer 将自监督新视图合成(NVS)重构为一个统一的、可扩展的前馈 Transformer,直接从未标定相机姿态的真实世界视频中学习静态场景的隐式表征。整个流程端到端训练,无需分离的相机标定模块或场景重建网络。

输入:多帧视频序列,每帧采样光线(ray)编码(位置、方向等信息),不提供任何真实相机内外参。动态场景被视为静态场景叠加时变“干扰”的观察结果。

关键模块与渐进式设计

  1. 统一前馈 Transformer 骨干(Config D):将传统 NVS 中分离的相机姿态估计场景几何重建体渲染融合于单一网络。Transformer 同时预测每条光线的密度、颜色以及隐含的相机外参,通过光线编码间的注意力机制隐式建立多视图对应关系,替代了显式的对极几何或 SfM 流水线。

  2. 动态状态吸收(Config B/C):为应对视频中的动态内容,网络预测一个紧凑的“动态状态”(nuisance factor),吸收物体运动和光照变化。训练时采用动态状态预测与 Dropout:随机丢弃部分动态特征,迫使模型将动态信号与静态场景解耦,并从多帧中挖掘一致的静态结构作为监督。动态视频仅作为可扩展的训练数据,模型目标仍为静态 NVS。

  3. 并行目标注意力(Config E):在多视图光线之间引入并行注意力机制,使各目标视图的光线能在统一的高维空间中直接交互,改善场景几何的一致性和渲染质量,同时保持线性计算复杂度。

  4. 自回归姿态学习(Config F/G):相机外参通过自回归方式逐步预测——先估计粗略的全体姿态,再逐视点细化残差,提升姿态精度,尤其适合大基线、长序列视频。

  5. 局部高分辨率层(Config H):在 Transformer 末端附加轻量局部细化网络,对低分辨率特征进行上采样并合成高频细节,平衡模型容量与渲染分辨率。

输出:任意指定目标视角的 RGB 图像,通过光线采样和体渲染直接生成。训练仅需视频帧的重投影误差(如 L1 损失),无需任何外部标注。

与同类方法的差异

不同于先估计相机姿态再训练神经场(如 NeRF-W、BARF)或联合优化但分离模块(如 DUSt3R)的方法,RayDer 将相机估计、重建、渲染全部嵌入一个前馈 Transformer,使整个系统表现为单一缩放问题,在数据与计算量增加时呈现清晰的幂律扩展规律,并在零样本开集测试上媲美监督方法。

实验

实验设计

RayDer 在一系列真实世界未约束视频上训练,不依赖任何标注,通过自监督信号(恢复随机遮挡的目标帧)学习。实验围绕三个维度进行缩放研究:

  • 数据量:从数千到数十万视频片段,跨越多个数量级
  • 模型规模:Transformer 参数量从几百万到数十亿
  • 训练计算量:固定其他变量,单独改变训练 FLOPs

同时,实验设置消融配置逐步构建最终架构:从基线多网络系统单网络统一 Transformer,并引入动态状态预测与 dropout自回归位姿学习局部高分辨率层等组件。所有评估在零样本开放集设定下进行,即训练与测试场景完全无重叠。

关键发现

  1. 明确的幂律缩放:在数据、模型规模和计算量上,RayDer 的 NVS 质量(PSNR, SSIM)均稳定遵循幂律关系,没有出现多网络系统常见的不可预测的饱和或退化。
  2. 动态状态作为"滋扰因子":通过一个最小动态态令牌(Nuisance Factor)吸收视频中时变内容,训练稳定且不干扰静态场景的重建目标,动态内容仅作监督来源而非重建对象。
  3. 网络统一是关键:将相机估计、场景重建与渲染合并到单个前馈 Transformer 后,性能随模型规模增长更平滑,且避免了多网络间的训练不协同。
  4. 相机位姿缩放特性:学到的相机几何表示可迁移至其他 NVS 模型作为位姿初始化,且位姿精度随数据量和模型规模同步提升。

与基线及同类工作的深度对比

RayDer 并非动态场景 NVS,而是刻意将动态内容剥离为训练监督,目标始终是静态场景新视角合成。与使用静态场景数据混合(如 Replica、ScanNet)训练的基线相比,纯真实动态视频训练展现出更优的缩放行为和最终性能,打破了依赖静态合成数据才能稳定训练的惯例。在零样本开放集测试中,RayDer 与当前有监督的先进方法(如 PixelNeRF, IBRNet)竞争力相当,但完全无需位姿或深度标注。这一结果证明:从非受控视频中学习通用的 3D 表征是可行的,且统一架构是通往可预测缩放的关键。

行业影响

落地场景

RayDer 的自监督新视图合成能力可直接嵌入电商 3D 商品展示社交媒体沉浸式内容创作自动驾驶仿真数据增强等场景。电商平台可从商家提供的短视频自动生成多视角 3D 旋转图,提升消费决策;内容平台可让用户从单段视频生成任意新视角镜头,降低专业拍摄门槛;自动驾驶团队则能利用未标注的真实道路视频廉价扩展 sensor 仿真视角,加速感知模型训练。

商业价值

核心价值在于大幅降低 3D 重建的标注与计算成本。现有监督方案需人工标定相机参数或多视角数据,RayDer 仅靠原始视频即可自监督训练,使 3D 内容生产的边际成本趋近于零。同时,其 power-law 缩放特性让厂商能通过增加算力与数据持续提升画质,形成数据飞轮。对电商平台,这意味着无限 SKU 的 3D 展示不再受制于建模人力;对视频平台,可驱动用户互动与停留时长,直接关联广告收入增长。

与现有产品 / 工作流的接口

RayDer 采用纯 feed-forward Transformer,输出可直接消费的 RGB 图像与相机参数,易于通 过 ONNX RuntimeTensorRT 部署为推理微服务。与现有图形引擎 (如 Unity/Unreal) 集成时,可将生成的隐式场景表示转换为 NeRF 或 3DGS 格式,或直接作为实时渲染 API 调用。在数据侧,模型可接入视频 CDN 的转码管线,在用户上传视频后自动触发新视角生成任务。其开放集零样本能力意味着无需对每类场景微调,可作为通用基础模型嵌入各种视觉应用栈。

具体用例

  • 电商:某家具平台商家上传一段 30 秒环绕拍摄的沙发视频,RayDer 即时生成可拖拽 360° 新视角图像,消费者无需下载 AR 应用即可在商品页交互查看,退货率预计下降 15–20%。
  • 内容平台:Vlog 用户拍摄一段街道行走视频,平台基于 RayDer 提供“电影镜头”特效,允许后期选择任意相机轨迹渲染短片,创作者中心数据显示此类内容平均观看完成率提升 25%。

局限

  • **动态场景重建限制**:RayDer 将动态状态视为 nuisance 因子,仅用于提供可扩展的自监督信号,而不重建动态内容。这意味着它不支持动态场景(4D)的新视角合成,对于包含显著非刚性运动或场景变形的视频,用户无法获得动态对象的同步新视角。相比之下,一些动态 NVS 方法(如 DyNeRF)可同时处理静态和动态元素,RayDer 在设计上放弃了这一能力,以换取稳定的单场景自监督训练和大规模缩放。
  • **未观察区域的处理局限**:模型依赖于输入图像集合的可见信息进行隐式场景表示和渲染,对于从未出现在任何输入视图中的区域(例如严重遮挡的角落或物体背面),生成的新视角可能会产生模糊或崩溃的伪影。这是由于前馈推理的本质没有显式的3D补全或生成模型来填充未观察空间,因此当测试视角与训练视角分布差异较大时,渲染质量会显著下降。
  • **混合静态/动态场景的鲁棒性**:虽然动态状态 dropout 机制旨在吸收时变内容,但在静态和动态元素紧密交织的场景(如行人从静态车旁走过)中,模型可能难以完美解耦,导致渲染中出现动态物体的拖影或静态背景的扭曲。该局限在实验中定性展示,表明此类场景的零样本泛化仍具挑战性,可能需要额外的语义引导或更精细的动态表示。
论文Ulrich Prestel2026-05-29原文

相关内容