论文

Walking in the Implicit: 基于神经场景表示的交互式世界探索

Walking in the Implicit: 基于神经场景表示的交互式世界探索

交互式视频生成系统通过逐步生成连续潜在视频帧来实现摄像机控制的世界探索,但这种方法将状态转移与高频观测合成耦合在一起,导致长程一致性差且计算成本高。 我们提出 Walking in the Implicit,一种以场景为中心的范式,将生成变量从帧潜在变量转变为固定长度的可渲染隐式状态,称为 神经隐式场景 (Neural Implicit Scene, NIS)。该范式将交互式生成分解为紧凑场景状态的随机转移和基于采样状态的条件渲染。我们将其实例化为 NeuWorld:一个 Transformer VAE 从稀疏带位姿帧中学习局部锚定的 NIS;一个 扩散 Transformer 根据未来相机轨迹和几何感知检索历史来演化 NIS。 通过复用 VAE 编码器作为统一条件器,NeuWorld 将相机、参考图像和历史线索映射到同一 NIS 模态,避免了外部异构编码器。在公开位姿视图数据上从零训练,无需预训练视频骨干或辅助 3D 重建器,NeuWorld 实现了强长程一致性和优越的推理效率。

论文精读

TL;DR NeuWorld 将交互式场景漫游重新定义为对紧凑的神经隐式场景状态(NIS)的演化,分离动态转换与姿态驱动渲染,实现长序列一致且高效的可控视频生成。

问题

问题背景

交互式世界探索(interactive world exploration)要求模型根据任意相机轨迹即时生成新视角的真实感画面,这在数字孪生、自动驾驶仿真和沉浸式应用中需求迫切。当前方法大多将任务建模为相机控制视频生成(camera-controlled video generation),即给定历史帧和未来姿态,滚动预测后续帧。

现有方法局限

主流方案基于潜在扩散模型(latent diffusion)或自回归视频生成器:将相机运动解耦为帧级潜变量(latent video frames)的逐步展开,每步同时隐式建模场景状态变化与高频纹理渲染。这种做法存在三重缺陷:

  • 状态-观测耦合:场景几何的动态更新与像素级渲染纠缠在同一个高维潜空间,导致长期生成时几何漂移严重,难以维持多帧一致性。
  • 线性计算增长:序列越长,潜变量缓存越大,计算量随视野扩展线性膨胀,阻碍长距离交互。
  • 历史信息低效:依赖于外部视觉编码器或像素级检索,难以将历史帧统一为与当前相机位姿显式对齐的紧凑表示。

技术挑战与重要性

该问题跨越高效世界状态表示长序列时空一致性两个前沿难点。核心挑战在于:既要捕捉场景的全局几何,又要以极低开销在任意时刻渲染细节;同时,当相机自由往复运动时,必须避免视觉漂移和形变。业界对实时潜世界漫游(latent world walkthrough)的关注飙升,因为这可能为 XR、自动驾驶闭环仿真、3D 内容创作提供轻量级后端。若无法将状态表示为一种可重渲染的隐式表征,推理效率与几何保真度将难以兼得。

行业类比

就像 NeRF 用一个隐式函数紧凑封装静态场景,现在需要一种动态隐式状态,让系统像在自动驾驶仿真中即时切换观察角度一样,无需预先重建完整 3D 地图即可随时响应视角变化。

核心洞察

  • - 隐式状态作为 rollout 变量:NeuWorld 提出以固定长度的神经隐式场景(NIS)代替不断增长的 latent video frames 作为交互生成的递归变量,将状态转移与高帧率观测合成解耦,从根本上避免长序列自回归生成中的误差累积和计算冗余。与直接在像素或 latent 空间滚动生成帧序列的视频扩散模型不同,NeuWorld 的场景状态转移由扩散模型在低维空间完成,帧渲染则是确定性的姿态条件解码,从而确保了长程一致性并大幅降低推理计算量。
  • - 统一条件编码器:通过复用 NIS-VAE 的编码器,将相机轨迹、参考图像和历史信息全部映射为同一 NIS 模态的条件,无需为不同模态设计异构编码器,简化了训练信号流并增强了条件一致性。传统方法常采用多个独立编码器处理不同输入,造成特征空间不对齐和训练困难。NeuWorld 的 unified conditioner 强制所有条件在同一个隐式场景空间中表达,使扩散模型能够更一致地理解条件与状态的交互,并在抗漂移训练中起到关键作用。

方法

核心范式:从帧潜在变量到场景隐式状态

传统交互式视频生成沿时序滚动生成潜在帧序列,状态转移与高频观察合成耦合,导致误差累积和计算冗余。NeuWorld 提出场景中心范式:将展开变量从变长潜在视频帧替换为固定长度的可渲染隐式状态——神经隐式场景(NIS)。交互过程被分解为:紧凑场景状态的随机转移,以及基于采样状态和相机姿态的确定性渲染。

输入→关键模块→输出

  1. NIS-VAE(变分自编码器)

    • 输入:稀疏的带姿态图像帧。
    • 架构:Transformer VAE 将图像编码为局部锚定的 NIS,固定长度(标记数 L)且通道维度为 D。解码时,给定相机姿态和 NIS,通过姿态条件渲染直接生成对应视图。
    • 统一条件器:VAE 编码器同时将相机、参考图像和历史线索映射到同一 NIS 模态,避免引入外部异构编码器。
  2. NIS-DiT(扩散 Transformer)

    • 输入:当前 NIS、未来相机轨迹、几何感知检索的历史 NIS 片段。
    • 架构:基于集合的扩散 Transformer,对 NIS 进行条件化演化。训练采用流匹配目标替代传统去噪扩散损失,并引入训练课程:先学习 NIS 先验(仅姿态条件),再对齐参考外观,最后融入历史交互。
    • 抗漂移提升:通过条件增强(对历史 NIS 加噪)和混合几何感知记忆检索(结合时序邻近与轨迹感知评分)确保长程一致性。
  3. 推理与输出

    • 给定起始帧和相机轨迹,VAE 编码得到初始 NIS,DiT 迭代更新 NIS,再由 VAE 解码渲染出新视图,形成闭环交互式视频生成。

与同类工作的差异

免外部单目深度估计器或预训练视频骨干,直接端到端从公开姿态视图数据训练,将交互式生成从“长序列潜在帧回归”转变为“固定长度隐式场景状态演化”,从而实现解耦、高效且长程一致的探索。

实验

实验设计

NeuWorld 在公开 RealEstate10K 数据集上从头训练,不依赖预训练视频主干或外部 3D 重建器。模型由 NIS-VAE(将稀疏有姿态帧编码为固定长度的神经隐式场景状态)与 NIS-DiT(以相机轨迹和检索历史为条件生成 NIS 状态)组成。评估包括两种交互模式:1) 前向轨迹生成,衡量沿新轨迹的逐帧渲染质量与长期一致性;2) 循环重访,测试相机回到历史位置时的记忆保持。消融实验覆盖 NIS 几何可探测性、隐状态 vs 视频帧隐码表示效率、NIS 容量、统一条件化、抗漂移增强与记忆检索策略。

关键发现

NeuWorld 在维持高效推理的同时,实现了远超传统隐视频帧 rollout 范式的长程一致性。通过将交互生成解耦为紧凑场景状态的随机转移与确定性姿态渲染,避免了逐步误差累积。统一条件编码(复用 VAE 编码器将相机、参考图与历史线索直接映射到同一 NIS 模态)消除了异构编码器,提升了条件融合效率。消融验证了 NIS 空间的平滑几何结构,增大 token 数或通道数可增强重建,而几何感知历史检索与轨迹训练课程对长程稳定交互至关重要。

与基线对比

有别于 latent video frame rollout 范式,NeuWorld 的隐式场景状态 rollout 分离了观测合成与状态转移,使模型专注于轨迹条件场景进化。在无 3D 监督或预训练先验下,其循环重访一致性超越多数依赖显式重建或预训练扩散基线的方案,计算量远低于逐帧生成高分辨率隐码序列。这验证了“以场景为中心”的交互生成范式的优势,为轻量级、高效的世界探索模型提供了新路径。

行业影响

落地场景

NeuWorld 将交互式世界探索中即时生成新视角视频的能力产品化,可落地于以下领域:

  • 虚拟漫游与线上展示:房地产、零售电商(家具、汽车)等业务中,让用户自由拖拽摄像机视角实时探索场景,无需预录制大量固定轨迹视频。
  • 影视预演与虚拟拍摄:导演基于少数参考帧即可实时调整镜头轨迹并预览高保真画面,大幅缩短前期筹备周期。
  • 自动驾驶仿真:根据路采图像与规划轨迹,生成多视角未来帧,用于感知模型训练与场景回放。

传统方法依赖密集3D重建或大量手工建模,NeuWorld 从稀疏姿态视图直接学习隐式场景表达,推理时仅需给定相机轨迹即生成一致画面,显著降低部署门槛。

商业价值

  • 降本:省去繁琐的3D建模、全光场采集或预渲染成本。仅需少量参考帧即可生成任意视角的交互视频,将制作时间从天级压缩到分钟级。
  • 增收:沉浸式体验可提升电商转化率(如虚拟试摆家具时自由视角观察细节),或作为内容差异化卖点吸引用户。
  • 体验升级:长视距一致性避免漂移和闪烁,推理效率支持实时交互,用户获得流畅无缝的虚拟探索体验。

与现有产品/工作流的接口

NeuWorld 可作为即插即用的神经渲染服务嵌入现有管线:

  1. 通过 API 接受 (参考图像, 相机姿态),输出目标姿态下的画面帧。
  2. 直接利用现有 SfM/MVS 工具(如 COLMAP)估计的位姿作为条件,无需完整几何模型,与 AR/VR 内容创建工具链无缝衔接。
  3. 基于 Transformer 架构,训练与推理兼容主流扩散模型框架(如 Hugging Face Diffusers),易于部署到云端或嵌入式设备。

具体案例

  • 线上家居展示:用户浏览沙发时,用 NeuWorld 根据几张营销图实时生成环绕视角视频,替代传统 360 度手动拍摄序列,每件单品可节省大量拍摄与后期成本。
  • 影视预演工具:集成到虚拟制片软件,导演导入实拍参考帧并草绘镜头轨迹,NeuWorld 生成全局一致的运动画面,辅助分镜决策,避免搭建昂贵临时布景。

局限

  • **场景表达能力受限于固定容量**:Neural Implicit Scene (NIS) 使用固定的 token 长度与通道维度来压缩场景信息,虽然实验证明在一定范围内容量越大质量越高,但面对大规模、高细节的真实环境时,固定的表征预算可能成为瓶颈。论文未探讨动态扩展 token 数或层次化表示的机制,这意味着对于开放世界探索,可能需要手动调节超参数,缺乏自适应的容量分配策略。
  • **动态元素建模缺失**:方法假设场景完全静态,隐式场景表示天然无法处理运动物体。在真实世界交互式探索中,行人、车辆等动态物体会破坏几何一致性,导致渲染失真。论文未讨论任何动态场景扩展方案,限制了其在动态环境(如街道、室内人流场景)中的直接应用。
  • **训练成本与场景泛化矛盾**:NeuWorld 从零开始训练 VAE 与 DiT,需要大量带姿态标注的多视图数据,且每个新场景都必须独立训练,无法像预训练视频生成模型那样快速泛化到未见环境。同时,推理依赖精确的相机轨迹,对姿态噪声的鲁棒性尚未充分验证,这在实际交互中(如来自不精确的 SLAM 或手柄输入)可能造成性能下降。
论文Zhiqi Li2026-06-29原文

相关内容