论文

AlayaVista: 从全景状态到透视视频的流式世界建模

AlayaVista: 从全景状态到透视视频的流式世界建模

交互式视频世界模型需在相机运动下保持宽广的场景上下文,同时以低延迟输出高保真观测。现有方法在表示上存在取舍:透视模型 基于局部视角运作,需要在长时 rollout 中维持画面外内容;而更广的空间覆盖通常依赖合成全球面视频或构建显式 3D 表示。 受视觉感知中全局上下文与选择性局部锐度互补这一特性的启发,我们提出 AlayaVista,一个相机可控的流式视频世界模型,它将 全景世界演化 与 透视观测合成 解耦。给定单张透视图像,AlayaVista 先用预训练的全景扩展模型构建 360 度场景先验,随后将场景演化为以相机为条件的 全景隐状态。一个 隐空间视口渲染器 将该状态映射为所请求的透视视频 latent,再由 透视精修模块 恢复细节、抑制伪影并完成超分。 为支持高效流式生成,我们将全景生成器改造为 分块自回归 生成,并将全景生成与透视精修二者蒸馏为少步过程。为提供该设计所需的监督信号,我们构建了 MUGEN,一个大规模真实世界全景视频数据集,包含 1,318 小时、分辨率至少 4K 的视频,并配有丰富的语义与几何标注。

论文精读

TL;DR AlayaVista 将全景场景演化与透视视频合成解耦,实现相机可控的流式世界建模,并发布 1318 小时 4K 全景视频数据集 MUGEN。

问题

问题背景

互动视频世界模型(interactive video world models)需在相机运动下维持全局场景上下文并生成高保真局部观测,当前研究焦点是同时满足低延迟流式推理与长时一致性。

现有方法局限

  • 透视模型 仅在局部视口操作,长 rollout 中需保留屏幕外内容,但隐式记忆易产生累积漂移,空间覆盖严重受限。
  • 全景视频生成 覆盖 360° 空间,但直接合成球面视频计算开销大,且与透视视角的映射不够高效。
  • 显式 3D 表示,如 NeRF、3DGS,可提供几何一致性,但重建与渲染管线复杂,难以融入潜空间流式生成框架。

这些方案都未解耦“全局场景演化”与“局部视角合成”,工程上迫使在上下文完整性和推理速度之间做取舍。

为什么这个问题难/重要

技术挑战在于需用单一潜状态编码球面全景信息与相机条件,并支持 chunk-autoregressive 流式生成和 few-step 蒸馏以降低延迟。高质量全景视频数据稀缺、标注困难,进一步限制了监督信号。AlayaVista 通过 潜视口渲染器 与 透视细化器 将全景状态映射到任意请求视角,并采用 MUGEN(1,318 小时 4K+ 全景视频),提供训练数据,展示了可扩展的流式世界建模路径,对自动驾驶仿真、具身智能训练等长时相机控制场景具有直接工程价值。

行业类比

类似自动驾驶仿真同时维护全局鸟瞰图与局部前视视野:全局状态保证一致性,局部渲染保证实时性。

核心洞察

  • AlayaVista 的核心创新在于将全景世界状态演化与透视观测合成解耦:用一个相机条件化的全景 latent 状态维护 360° 场景上下文,再通过 latent viewport renderer 按需投影出当前视角的视频 latent,最后用 perspective refiner 恢复细节并做超分。这一设计同时规避了纯透视世界模型在长 rollout 中丢失屏幕外内容的缺陷,以及直接生成全景视频或显式 3D 重建的高计算成本,与人类视觉中全局背景与局部敏锐度分工的机制相呼应。
  • 面向交互式世界模型的实时性需求,AlayaVista 将全景生成器改造为 chunk-autoregressive 模式(按块自回归而非逐帧),并对全景生成和透视细化分别做 few-step 蒸馏,从而在保持高保真输出的同时支持流式低延迟推理。相比现有方法通常依赖完整全景生成或高步数扩散过程,这种工程化设计显著降低了每次相机移动的等待时间,为实际部署到游戏、仿真等场景提供了可行路径。
  • MUGEN 数据集作为该架构的关键支撑,提供了 1,318 小时、分辨率至少 4K 的真实世界全景视频,并附带语义与几何标注,规模与标注质量均优于现有全景视频数据集。它不仅用于训练全景生成器和透视细化器,还通过统一的 ERP-based 标注流水线生成视频级上下文与片段级动态描述,使得全景状态演化与透视渲染能够获得充分的监督信号,弥补了此前真实全景视频数据匮乏的问题。

方法

输入与初始化

给定单张透视图像,AlayaVista 先利用预训练全景扩展模型构建 360° 场景先验,将局部视角提升为全景表示,为长时 rollout 保留屏幕外上下文。

关键模块

全景状态生成器(ERP-Aware Panoramic State Generator)接收初始化先验与相机轨迹,在 球形表示 下以 chunk-autoregressive 方式演化全景隐状态:一次预测一个时间块内的隐变量,并将上一块状态作为条件,降低流式生成延迟。相机条件通过 ERP 感知编码注入,使全景演化对相机运动可控。

隐式渲染模块(Latent Render Module)根据当前视口参数,从全景隐状态中提取对应透视视频隐状态,无需显式 3D 几何或全帧视频合成,实现全局覆盖与局部高保真的平衡。

透视细化器(Perspective Video Refiner)对渲染隐状态进行空间上采样、伪影抑制与细节恢复,采用 carrier-conditioned causal refinement,同样以 chunk 因果方式生成;通过 四步自强制蒸馏(Four-step Self-Forcing distillation)与多步质量适配,将推理压缩到约 4 步。

训练与输出

全景生成器依次进行双向全景适配、chunk-autoregressive 训练和少步蒸馏;渲染模块与细化器单独训练,细化器包括隐空间上采样器训练、多步质量适配和四步因果推理蒸馏。最终输出为相机可控的透视视频帧,支持流式生成。

与同类方法相比,AlayaVista 将全景演化与透视合成解耦,避免显式 3D 表示或全球视频生成的高昂成本,同时保持全局上下文与局部细节。

实验

实验设计叙述

AlayaVista 的实验围绕解耦的流式世界建模展开,重点评估相机控制下的视角视频生成质量与一致性。训练与评测基于自建的 MUGEN 数据集(1,318 小时、至少 4K 分辨率),该数据集包含真实场景的语义和几何标注,为全景生成与视角合成提供监督。评测从定量和定性两个层面展开:定量指标涵盖全景视频生成和视角世界模型常用评估项,定性则关注相机控制精度与全景-视角对应关系。

关键发现

解耦设计有效缓解了视角模型在长时间 rollout 中丢失屏幕外内容的问题。通过引入 panoramic latent state 与 latent viewport renderer,模型在保持全局场景上下文的同时,能输出高保真的局部视角视频。chunk-autoregressive 生成和 few-step distillation 显著降低了推理延迟,支持流式应用。

与基线对比的深度解读

相比纯视角世界模型,AlayaVista 避免了局部视野导致的空间不一致;相比显式 3D 重建或全 360 度视频合成,它不依赖昂贵的三维表示或超高分辨率全景输出,在计算效率和视觉保真度之间取得平衡。MUGEN 数据集的规模与标注丰富度为这一解耦范式提供了关键的数据支撑,使模型能够学习到从单张视角图像到全景状态的可靠映射。

行业影响

落地场景

AlayaVista 适用于需要交互式全景视频合成 的产品:

  • 电商虚拟展示:用户上传单张商品图,系统实时生成可自由旋转视角的展示视频,用于汽车、家具、房产等大件商品。
  • 教育与文旅:从单张历史遗址照片生成可探索的 360° 场景,支持虚拟实地考察。
  • 游戏与虚拟制作:快速搭建可交互环境背景,降低美术预渲染成本。
  • 自动驾驶仿真:生成多视角街景视频,丰富训练数据。

商业价值

  • 降本:避免预先渲染所有视角或构建显式 3D 模型,大幅降低内容生成计算与存储成本。
  • 增收:提供新的沉浸式交互体验,可转化为 AR/VR 内容订阅或虚拟展厅服务。
  • 体验提升:camera-controllable streaming 保证低延迟、高保真观测,提升用户互动流畅度。

与现有工作流集成

  • 模型可作为即插即用组件,通过 API 嵌入现有视频生成或 3D 内容管线。
  • 对已有透视视频生成模型,可替换其世界状态模块,增强长时程视角一致性。
  • 支持chunk-autoregressive 与 few-step 蒸馏,可部署在实时推理服务中;MUGEN 数据集可复用于微调其他全景模型。

局限

  • AlayaVista 依赖预训练 **全景扩展模型** 从单张透视图像构建 360 度场景先验。该初始化步骤的质量直接决定后续全景状态演化与透视视频生成的上限。若输入图像包含动态物体、严重遮挡或极端光照,扩展模型可能生成几何不一致、纹理扭曲或缺失内容,且这些误差会随 roll-out 时间步累积。论文未深入分析该瓶颈对长时生成稳定性的影响,也未报告扩展模型失败案例的量化评估。
  • **chunk-autoregressive 生成** 与 **few-step 蒸馏** 在提升流式效率的同时,可能引入时序一致性与细节保真度的折损。块边界处的潜在状态拼接可能导致伪影,蒸馏后的少步推理可能无法完全恢复原多步模型的动态细节。作者未提供与全自回归或多步推理的详细定量对比,也未报告实际推理延迟或吞吐指标,难以判断该方法是否满足真实交互式应用的实时性要求。
  • **MUGEN** 数据集虽规模达 1,318 小时,但采集自真实场景的全景视频可能存在分布偏差(如场景类型、光照条件、相机运动模式),且自动标注的语义与几何信息可能包含噪声,影响模型训练与泛化。论文未系统评估该数据集在跨域、跨设备或户外极端条件下的鲁棒性,也未开源数据集的详细分布统计或标注质量报告。
论文Jiaming Tan2026-09-13原文

相关内容