论文

视频 = 世界 + 事件流

视频 = 世界 + 事件流

我们介绍了 Wan-Streamer v0.3,它将原生流式交互模型统一在一个观点下:视频 = 世界 + 事件流。世界 是视频展开的持久上下文,包括环境、场景、主体、环境声学条件、声音特征及其他相对稳定的条件。事件流 是世界内随时间变化的一切,包括场景或环境变化、主体行为、语音及其他声音。 基于此,我们提出了一个在大量真实视频上进行的通用预训练任务:给定一个世界和输入,预测世界如何实时移动、变化和响应。该能力可适用于广泛的实时下游任务。我们将其实例化为实时全双工视听交互,其中事件流包括智能体的语音及自由形式的行为。 功能上,模型的多模态理解过程类似于视觉-语言-动作:它将多模态用户输入映射为语言形式的语音和行为动作。Wan-Streamer v0.3 保持了 v0.2 的操作特性:640×368 视频,25 FPS,160 ms 流式单元,约 200 ms 模型侧响应延迟,以及在 350 ms 双向网络预算下约 550 ms 的总体交互延迟。

论文精读

TL;DR 将视频分解为“世界”与“事件流”,提出一个通用预训练任务,使模型从海量真实视频中学习实时动态响应,并应用于低延迟全双工音视频交互。

问题

问题背景

实时音视频交互系统正追求低延迟、全双工、类人自然感的目标,要求感知、决策与生成在单一因果时间线上紧密耦合。

现有方法局限

  • 模块级联范式(ASR→NLU→TTS)长期主导,但独立优化带来延迟叠加与信息瓶颈,难以产生可见的倾听反应等同步行为。
  • 端到端流式模型如Wan-Streamer v0.1/v0.2 虽消除了级联,但其训练目标直接绑定在“代理说话并反应”这一特定交互任务上,缺乏从大规模非标注视频中学习通用世界理解与实时预测能力的预训练范式,泛化性受限于该单一应用实例。
  • 其他视频预训练方法(掩码重建、对比学习)多关注短期片段,无法建模持久世界上下文下事件流的演化

为什么这个问题难/重要

  • 技术挑战:视频本质上是持久“世界”与动态“事件流”的复合体,两者耦合紧密。如何设计一个可扩展的分解与预测任务,让模型从海量原生视频中学会“给定世界状态和当前输入,预测世界如何实时变化”,在架构与损失函数上均有本质难度
  • 业界关注:这是通往通用世界模型的关键尝试,与JEPA、扩散世界模型等前沿方向齐头并进。若能突破,可大幅降低实时交互系统的定制成本,并统一赋能具身智能、虚拟角色、实时监控分析等广阔下游。

行业类比

如同语言模型通过**“下一个token预测”** 从纯文本语料习得通用语言能力,Wan-Streamer v0.3 希望以“给定世界和事件,预测世界下一步变化”为通用预训练任务,从海量视频中蒸馏出可迁移的实时交互智能。

核心洞察

  • 视频分解为“世界”与“事件流”提供了一个面向实时动态的通用预训练任务,不再局限于静态语义识别,而是要求模型预测给定持久世界下,随时间变化的运动、状态演变与响应。这与主流视频自监督方法(如 MAE 掩码重建、VideoBERT 式 token 预测)形成鲜明区别:后者隐式学习时空关联,但缺乏显式的因果时间建模和实时演变压力,而世界-事件分解迫使模型在连续因果时间线上理解环境恒常性与变化,更贴近真实世界交互所需的物理直觉与动态推理能力。
  • 预训练与下游实时交互的解耦设计让 Wan-Streamer v0.3 跳出将特定对话形式作为唯一训练目标的限制,先在大规模真实视频上学习通用的实时动态预测能力,再专门化到全双工音视频交互。较之 v0.1/v0.2 将交互设定与模型能力紧耦合的做法,这种范式更接近语言模型的预训练-微调路线,为构建可复用的实时视频基础模型打开了空间,使得同一预训练主干能移植到多种实时下游任务(如监控、远程操控等),显著提升工程复用性。

方法

核心视角:视频 = 世界 + 事件流

Wan-Streamer v0.3 将视频拆解为两个时间尺度不同的成分:

  • 世界 (World):场景、环境、说话者音色、声学条件等相对稳定的持续上下文。
  • 事件流 (Event Stream):随时间变化的动态内容,如主体动作、语音、环境变化。

基于此分解,模型被设计为基于世界上下文,对未来事件流进行实时预测的通用架构

流式架构与处理管线

模型以流式单元(160 ms)处理640 × 368@25 FPS 的视频流与对应的音频流。世界表示从历史帧中在线提取,形成持久记忆;事件流则捕获当前输入的多模态变化。核心模块为单个 Transformer,在因果时间线上同时建模:

  1. 世界编码器:将稳定视觉-听觉特征压缩为潜在世界状态。
  2. 事件编码器:将当前流式单元中的用户语音、视频行为编码为事件 token。
  3. 融合与预测头:Transformer 自回归地解码出下一时刻的响应,包括语言形式的语音文本以及行为动作(如面部表情、身体动态)。

模型端到端地映射多模态用户输入到语言形式的动作,其处理过程类似视觉-语言-动作 (VLA) 模型:感知 → 理解 → 生成。

预训练与下游迁移

该方法的核心创新在于预训练任务:在大量真实视频上,给定一段世界和一段事件流,训练模型预测世界如何实时演变与响应。这使模型学到了通用的物理世界动态、交互模式。随后,该能力被专业化到实时全双工交互任务上,仅需将事件流实例化为智能体的语音与自由形式行为,世界则成为会话场景与智能体身份。

与同类方法的差异点在于:v0.2 及传统方案直接针对交互任务设计目标,而 v0.3 通过世界-事件解耦,构建了一个可复用、可迁移的通用视频理解与生成预训练框架,大幅提升了数据效率和交互行为的可控性。

实验

实验设计

  • 预训练任务:基于"视频 = 世界 + 事件流"的分解,在大规模真实视频上训练模型。给定一个静态的"世界"(场景、光照、声学环境等)和动态的"事件流"(动作、语音、环境变化),预测世界如何随时间演变与响应。
  • 下游任务:在实时全双工音视频交互上微调,事件流具体化为智能体的语音与自由行为。模型接收用户的多模态输入,输出语言形式的语音与行为动作。
  • 评估维度:侧重系统实时性(延迟、帧率),功能验证交互连贯性,未报告定量任务指标。

关键发现

  • 模型保留了 v0.2 的操作点640×368 @ 25 FPS,流式单元 160 ms,模型侧响应延迟约 200 ms,总交互延迟约 550 ms(含 350 ms 往返网络预算)。
  • 通过世界-事件分解,将交互视为在持久上下文中的动态预测,而非分离模块的级联,实现了感知、响应、说话、可见聆听与同步视频的端到端学习。
  • 重构并未改变实时性能,但为扩展至更广的实时下游任务提供了统一的预训练框架。

与基线对比的深度解读

  • 本文未给出与独立模块系统或 v0.2 的定量性能对比,仅声明了延迟指标的一致性。
  • 相较于 v0.1 的端到端流式建模与 v0.2 的高分辨率并行优化,v0.3 的核心变化是从单一交互目标转向通用的"世界预测"预训练,可能带来更强的泛化能力,但在当前版本中尚未通过实验量化。
  • 对工程实践的启示:这一框架若验证有效,可降低为不同实时任务(如远程协作、虚拟助手等)分别设计模型的需求,用同一预训练骨干加速多场景部署。

行业影响

落地场景

Wan-Streamer v0.3 将视频建模为世界 (world)事件流 (event stream) 的联合,专为实时全双工音视频交互设计,毫秒级延迟 (模型侧 ~200ms) 使其可直用于需要自然“看听说动”的交互产品。典型场景包括:

  • 虚拟数字人:电商直播中的 AI 主播、内容平台中的虚拟角色,能实时理解观众评论和环境变化,并作出语音与肢体回应。
  • 在线教育与培训:提供具有实时反馈的 AI 导师,观察学习者行为并即时调整讲解。
  • 游戏 NPC:与玩家进行实时视听对话,根据游戏世界变化动态反应。
  • 远程协作与客服:通过视频窗口的拟人化助理,实现多模态实时答疑和操作指引。

商业价值

  • 降低运营成本:替代人工直播、客服等重复性角色,减少真人人力投入。
  • 提升用户粘性与转化:实时、拟人的交互体验能显著延长用户停留、增加付费转化(如电商直播引导下单)。
  • 增强服务可用性:7×24 无间断服务,在金融咨询、应急响应等场景保证即时响应。 核心价值来自极低延迟端到端一体化,避免了传统多模块级联带来的延时和误差累积,使得体验更接近真人对话。

与现有产品/工作流的接口

模型输出为语言形式的语音和行为动作,具备VLA (Vision-Language-Action) 结构,易于对接现有音视频管道:

  • 视频输入/输出:支持标准分辨率 (640×368, 25 FPS) 和 160ms 流式单元,可直接接入 WebRTCFFmpeg 等流媒体协议。
  • 语音交互:生成语音可直接送入 TTS 引擎,结合原有语音活动检测 (VAD) 等模块构建对话管理。
  • 角色控制:通过 role-play 格式的自由行为描述,可集成到游戏引擎或动画系统,实现虚拟形象驱动。 与现有产品栈的集成主要体现在API 化模型推理层,上行视频/音频流至模型,下行接收语音文本与行为指令,无需对现有前端做大幅改造。

具体落地用例

  1. 电商直播虚拟主播:平台接入 Wan-Streamer,构建品牌专属虚拟主播,实时讲解商品、回答评论提问,并根据直播间的热度或弹幕情绪调整语气和动作,提升互动率和成交额。
  2. 教育平台的 AI 导师:一对一视频辅导场景中,AI 导师通过摄像头观察学生表情和动作,实时调整讲解节奏,并在学生困惑时给予即时鼓励或提示,打造媲美真人私教的体验。

局限

  • **世界-事件流分解的普适性受限**。该方法假设视频可严格分解为静态世界和动态事件流,但真实视频常包含快速场景切换、全动态背景或瞬变光照,此类内容难以被清晰归入预设的两个分量,可能导致建模偏差与预测质量下降。论文未给出在这些退化情况下的定量评估,因此该预训练框架在开放域视频上的鲁棒性仍有待验证。
  • **延迟指标尚未完全覆盖高实时性场景**。当前模型侧约 200ms 的响应延迟虽已较低,但对于乐器合奏、高速运动游戏等对毫秒级反馈敏感的任务仍显不足。此外,流式处理中的误差累积及长序列遗忘问题未详细讨论,可能影响长时间交互的一致性与流畅性。
  • **下游任务泛化尚未充分证明**。论文聚焦于实时全双工视听交互实例,未提供预训练模型转移到其他任务(如场景理解、动作预测、视频问答)的实验证据。通用预训练目标的有效性仅通过单一特化任务间接体现,缺少多任务基准对比,限制了其作为通用视频骨干的潜力。
论文Lianghua Huang2026-07-16原文

相关内容