论文

HelixWorld: 一个实时交互式音视频世界模型

HelixWorld: 一个实时交互式音视频世界模型

世界模拟本质上是多感官的,需要视觉与声学动态在实时条件下同步演化。然而,当前主流的交互式世界模型仍然完全静音,只专注于视觉渲染与控制,忽视了声学维度。为此,我们提出 HelixWorld,一个实时交互式音视频世界模型,让视觉场景与基于相机的空间立体声在用户交互下原生地协同演化。 我们构建了一个高保真空间音视频数据集,包含真实立体声学信息与度量相机位姿,并以此预训练一个双向教师模型,其条件输入为 6-DoF 相机轨迹与用户动作。为实现低延迟的因果交互,我们通过在线轨迹蒸馏损失将教师模型蒸馏为少步流式学生模型,从而在单张 GPU 上以 24 FPS 维持无漂移的联合音视频推演。 此外,我们形式化了空间-声学一致性,并提出 HelixBench,用于评估合成声场是否忠实跟踪动态视点运动。大量实验表明,HelixWorld 在视觉保真度与响应性上可媲美最先进的静音世界模型,同时在相机对齐的空间声学沉浸感上显著超越现有基线。

论文精读

TL;DR HelixWorld 是首个实时交互式音频-视觉世界模型,通过教师-学生蒸馏在单 GPU 上实现 24FPS 视觉与空间立体声同步生成,并推出 HelixBench 基准评估空间声学一致性。

问题

问题背景

交互式世界模型(world models)是当前具身智能与实时仿真领域的核心方向,目标是在用户动作驱动下生成高保真、可交互的环境,用于策略训练、游戏内容生成和虚拟测试。现有工作主要集中在视觉渲染质量和控制响应速度上。

现有方法局限

主流的交互式世界模型(如 GameNGen、Oasis、DIAMOND)完全忽略声学维度,生成的环境是“静默”的。即使存在少量音视频生成模型,它们要么不是交互式的,要么缺乏真正与相机位姿对齐的空间立体声。具体技术限制包括:

  • 数据缺失:现有数据集很少提供真立体声音频和度量相机位姿,导致模型无法学习声音随视点移动的空间变化。
  • 架构不匹配:多数模型采用双向注意力或非因果结构,无法满足实时交互所需的低延迟流式推理。
  • 训练目标单一:仅优化视觉保真度,未显式约束跨模态一致性,导致生成音频与视觉场景脱节。
  • 评估缺位:缺乏衡量“声场是否忠实地跟随视点运动”的基准,难以定量比较不同模型的沉浸感。

为什么这个问题难且重要

技术挑战在于需要同时解决多模态同步、因果生成和实时性。音频采样率远高于视频帧率(例如 48 kHz 对比 24 FPS),联合建模要求精细的时间对齐;空间音频必须根据 6-DoF 相机轨迹动态变化,对生成模型的几何感知能力提出高要求。此外,构建高质量音视频数据集成本高昂,且需处理真实录制中的噪声与同步问题。业界关注度方面,随着 VR/AR、游戏引擎和机器人仿真对沉浸式环境的需求增长,音视频世界模型被认为是通往通用世界模拟器的关键一步。HelixBench 的提出也说明缺少标准评测是一个主要瓶颈。

行业类比

这类似于自动驾驶仿真中仅模拟摄像头而忽略激光雷达——视觉信息虽丰富,但缺乏空间感知维度,导致策略在真实环境中容易失效;同样,没有音频的世界模型训练出的具身智能体无法利用声音线索。

核心洞察

  • 交互世界模型首次原生引入空间立体声,将环境模拟从单模态视觉扩展到同步音视频。现有交互世界模型(如 Genie、GameNGen 等)仅渲染视觉并处理控制,无声输出,而 HelixWorld 构建了包含真实立体声和度量相机位姿的高保真数据集,训练双向教师模型,使视觉景物与相机坐标系下的空间声场协同演化,实现 camera-grounded spatial acoustics。这一设计让世界模型更接近真实多感官仿真,为具身智能与虚拟环境交互提供新的感知维度。
  • 采用 self-forcing 与在线轨迹蒸馏实现低延迟因果生成,同时保持长时 joint audio-visual rollout 无漂移。同类工作常用教师强制或自回归生成,在长序列推理时容易累积误差导致漂移;HelixWorld 将双向教师蒸馏为少步流式学生模型,通过 online trajectory distillation loss 驱动学生模仿教师自回归生成的轨迹,配合长时流式调优,最终在单个 GPU 上以 24 FPS 实时运行。这为实时交互世界模型的训练范式提供了可复用的工程路径。

方法

输入与输出

HelixWorld 接收 6-DoF 相机轨迹与 用户交互动作 作为控制信号,输出 同步的视觉帧与相机坐标系下的空间立体声。视觉与音频以原生耦合方式共同演化,而非事后合成。

关键模块

  1. 双向教师模型:以未来和过去信息为条件进行预训练,捕获长时上下文的音视频关联。训练采用 渐进式条件注入,逐步引入相机位姿和动作,避免模式崩塌。教师模型可双向推理,但无法实时交互。

  2. 因果学生模型:为了低延迟流式推理,将教师蒸馏为仅依赖过去帧的因果学生。学生采用 少量去噪步(few-step),并利用 因果初始化 将教师权重迁移到学生,减少冷启动开销。

  3. 在线轨迹蒸馏损失:学生训练时使用 自强制 策略,在自回归 rollout 过程中计算与教师输出的分布距离(如 DMD score),并通过 在线轨迹蒸馏 对齐整个预测轨迹,而非单步,从而抑制误差累积。

  4. 长时流式调优:在蒸馏后加入 长视界调优 与 有界历史缓存,使推理时无需无限回溯,支持 24 FPS 单 GPU 实时生成。

输出特性

学生模型以 流式方式 逐帧输出视觉帧和空间音频,保持相机运动与声场变化的严格对齐,实现 drift-free joint rollouts。

与现有 silent world models 的差异点:HelixWorld 首次将相机对齐的空间立体声纳入实时交互式世界模型,并通过双向教师到因果学生的蒸馏,解决了音频视觉联合生成中的因果性与保真度冲突。

实验

实验设计

HelixWorld 构建了高保真空间音视频数据集,包含真实立体声和度量相机姿态;先预训练双向教师模型,通过在线轨迹蒸馏得到少步流式学生模型,在单 GPU 上实现 24 FPS 实时推理。评估采用自建 HelixBench,覆盖空间声学一致性、跨模态对齐等指标。

关键发现

  • 视觉维度:与 SOTA 无声世界模型相比,HelixWorld 的视觉保真度与响应速度处于同一水平,未因引入音频而牺牲视觉质量。
  • 音频维度:在相机对齐的空间声学沉浸感上显著超越现有基线,证明声场能随视角运动动态变化。
  • 实时性:单 GPU 24 FPS 的流式推理支持低延迟交互,满足实时世界模拟需求。

与基线对比解读

现有交互世界模型普遍仅处理视觉信号,在动态交互中缺乏听觉反馈;HelixWorld 通过原生联合建模视觉与空间音频,填补了这一空白。相比传统音视频生成模型依赖事后合成或静态音频,HelixWorld 的因果蒸馏与流式推理解码保证了交互闭环中的音画同步与低延迟,对需要多感官反馈的具身智能、游戏引擎等工程场景具有直接参考价值。

行业影响

落地场景

HelixWorld 作为实时交互式音视频世界模型,可直接应用于 游戏引擎动态场景生成、虚拟制片、AR/VR 沉浸式体验 以及 数字孪生 等场景。其 24 FPS 单 GPU 因果推理能力,使其能够嵌入需要低延迟闭环反馈的应用,如交互式虚拟展厅、多人在线游戏中的环境音画同步。

商业价值

从降本线看,传统实时 3D 音视频内容制作依赖手工建模、环境音录制与人工同步,HelixWorld 通过生成方式显著降低资产制作成本。从体验线看,空间立体声与视觉的联合演化带来更强的临场感,可提升用户留存与付费意愿。此外,作为可交互的世界模型,它可成为 UGC 平台或内容工具的底层引擎,按 API 调用计费实现新营收。

与现有产品/工作流的接口

HelixWorld 可通过 ONNX Runtime 或 TensorRT 部署为独立推理服务,或封装为 gRPC / WebSocket API 供上游应用调用。与现有游戏引擎(如 Unity、Unreal)集成时,可将生成结果作为动态场景节点替换传统静态资源;与视频编辑工具或直播平台集成时,可作为实时背景生成与空间音频合成模块。关键差异在于其双向教师→因果学生的蒸馏设计,可直接替代现有 silent world model 的渲染后端,无需中断现有视觉管线。

具体落地 use case:

  1. 虚拟电商展厅:用户通过 6DoF 视角浏览商品时,HelixWorld 实时生成与视角一致的环境音(如脚步回声、物品摩擦声),增强沉浸式购物体验,降低单独制作空间音频的成本。
  2. 游戏原型快速验证:开发者输入动作轨迹与场景语义,HelixWorld 即时输出带空间音频的交互原型,用于玩法测试与用户研究,缩短从概念到可玩 demo 的周期。

局限

  • **数据集规模与多样性受限**:论文构建的空间音视频数据集虽经过多级筛选,但主要来源为网络视频、游戏录制和开源语料,场景分布可能偏向特定类型(如室内、城市),对极端声学环境(如户外空旷、强混响)覆盖有限。实际应用中,用户所处的任意真实环境声学特性难以完全覆盖,模型可能对未见声学条件泛化不足。
  • **依赖精确相机位姿估计**:空间声场生成高度依赖 6-DoF 相机轨迹,而数据 pipeline 中的位姿估计难免存在噪声,尤其动态场景或快速运动下误差会累积,导致声音空间定位偏移。模型未显式处理位姿不确定性,实际部署时若位姿估计模块精度下降,音频空间一致性将显著恶化。
  • **少步蒸馏可能限制生成多样性**:为满足 24 FPS 实时交互,学生模型通过轨迹蒸馏压缩为 few-step,牺牲了部分生成多样性和音频细节。与离线高步数扩散模型相比,复杂声景下的音质和动态范围可能有所下降,在需要高保真音频的场景(如音乐演出、精细环境声)中表现不如专用音频合成模型。
论文Lei Ke2026-09-29原文

相关内容