论文

Wan-Streamer v0.1: 端到端实时交互基础模型

Wan-Streamer v0.1: 端到端实时交互基础模型

Wan-Streamer 是一种原生流式、端到端的交互式基础模型,专为实时、低延迟、全双工的视听交互设计。它通过单个 Transformer 统一建模语言、音频和视频,将序列表示为交错的视觉、音频、文本输入令牌与视觉、音频、文本输出令牌,并由 块因果注意力(block-causal attention) 协调以实现增量流式处理。 与依赖独立 VAD、ASR、语言、TTS、音频驱动动画或视频生成模块的级联交互系统不同,Wan-Streamer 无需外部语言、语音、虚拟形象或视频生成模块:感知、推理、生成、响应时序、轮次管理以及跨模态同步均在单一模型中联合学习,从而减少流水线延迟和错误累积。 为了支持自然的视听响应,我们围绕流式能力重新设计了整个栈,包括 因果编码器(causal encoders)、因果解码器(causal decoders)、块因果注意力以及 低延迟多模态令牌调度(low-latency multimodal token scheduling),使得流式单元短至 160 毫秒(25 fps)。Wan-Streamer 实现了约 200 毫秒 的模型侧响应延迟,结合 350 毫秒 双向网络延迟后总交互延迟约 550 毫秒,支持亚秒级双工视听通信。这些结果使 Wan-Streamer 成为用于低延迟流式交互的统一、端到端多模态交互基础模型。

论文精读

TL;DR Wan-Streamer 是首个原生流式、全双工端到端交互模型,在单一 Transformer 内统一处理语言、音频与视频的输入输出,通过块因果注意力将响应延迟降至约 200 ms,实现亚秒级实时音视频对话。

问题

问题背景
实时交互式 AI 正从异步、单模态走向全双工、多模态的自然对话,业界迫切需要能持续感知、推理并生成音频-视觉响应的基础模型,以支撑数字人具身助手实时直播等应用。

现有方法局限
主流方案仍是级联流水线:串联 VAD、ASR、语言模型、TTS、音频驱动动画或视频生成等多个独立模块。这种方式存在三个刚性局限:

  • 延迟累积:每个模块引入数十到数百毫秒处理延迟,总延迟轻易超过 1 秒,破坏实时感;
  • 误差传播:前端识别错误被固定传递给下游,无松耦合修正机制;
  • 协同缺失:响应时机、对话轮次管理、唇音同步等须额外协调模块硬编码规则,难以学习自然的交互节奏。

技术挑战与重要性
构建真正的端到端流式交互模型面临多重难题:

  • 模态统一:须在单一 Transformer 内同时处理文本、语音、视频的 token 化输入与输出,设计合理的交迭序列及注意力掩码;
  • 流式机制:编码器/解码器均需因果性(只依赖过去帧),且支持极短帧组(如 160 ms)的增量调度,实现 25 fps 低延迟推流;
  • 全双工控制:模型必须自主决定何时倾听、何时生成,并协调视频、音频、文本输出的同步,这远超传统非流式生成模型的复杂度。 业界对此关注极高,因为级联方案已触及延迟与自然度的天花板,而统一流式模型能将响应延迟压缩至 200 ms 模型侧 + 350 ms 网络,实现亚秒级交互。

行业类比
这与自动驾驶的感知-规划-控制一体化演进类似:从独立模块各自为战,到端到端模型直接输出驾驶动作,追求更低的反应延迟和更连贯的行为。

核心洞察

  • 端到端多模态统一架构消除了级联流水线的延迟与误差累积。相比于传统系统将 VAD、ASR、NLU、TTS、动画生成等模块串联,每一环节引入处理延迟且误差层层放大,Wan-Streamer 在单个 Transformer 内联合完成感知、推理、生成与响应时机管理,整体延迟大幅降低至约 200 ms(模型侧),同时避免了跨模块接口的数据转换损失。这种一体化设计使得模型能直接学习音视频信号间的细粒度时间关系,为低延迟交互提供了坚实基础。
  • 块因果注意力与极短流式单元设计使模型具备自然实时全双工交互能力。论文重新设计整个计算栈支持流式处理,采用因果编码器、因果解码器和低延迟多模态 token 调度,将流式片段缩短至 160 ms(25 fps),并配合 block-causal attention 实现增量解码。这让模型能像人类一样连续观察、随时响应,而无需等待完整输入结束,突破现有视频生成模型只能离线批处理的限制,首次在统一框架内达到亚秒级双工音视频通信,为实时数字人、在线交互世界模型等应用打开了可能。

方法

统一序列建模与多模态输入

Wan-Streamer 将语言音频视频的输入与输出统一为交错的 token 序列,送入单一 Transformer 进行联合建模。输入 token 来自原始视频帧、音频波形和文本的流式编码,输出 token 则对应生成的人脸动画、语音和回复文本。这种设计摒弃了传统的级联 pipeline(如 VAD→ASR→NLU→TTS→动画),所有模态共享同一个表示空间,避免了模块间的误差累积。

Block-Causal Attention 与流式架构

为实现真正的低延迟流式交互,模型重新设计了注意力机制和编解码器:

  • Causal Encoders / Decoders:保证处理自回归因果性,仅依赖历史信息,支持逐帧/逐块增量计算。
  • Block-Causal Attention:在时间维度上划分固定大小的注意力块,允许输入与输出 token 跨块交互,同时将响应延迟控制在 160 ms 级别(25 fps)。
  • 低延迟多模态 Token 调度:动态协调视频、音频、文本 token 的生成顺序与速率,确保音画同步与流畅打断(全双工)。

端到端训练与推理

模型通过海量多模态对话数据联合学习感知、推理、生成、对话状态追踪、响应时机选择,无需外部模块。训练时采用下一 token 预测目标,引入流式掩码模拟实时场景。推理时,输入流被切分为 160 ms 片段,模型连续接收并输出,模型侧响应延迟约 200 ms,总交互延迟约 550 ms(含 350 ms 网络),支持亚秒级全双工沟通。

与同类方法的差异:Wan-Streamer 完全抛弃了符号化中间表示(ASR 文本、音频特征等分步处理),直接在原始视听流上实现端到端生成,将交互响应压缩至接近人类对话的时延水平。

实验

实验设计

Wan-Streamer 在统一的 Transformer 架构内,通过 block-causal attention 实现流式推理,直接处理交错的视觉、音频和文本 token。实验构建了端到端推理解码流水线,设计了 因果编码器/解码器 和低延迟多模态 token 调度策略,测试模型在最小流式单元(短至 160 ms, 25 fps)下的实时交互性能。延迟测量覆盖模型侧响应时间和包含网络的双向总延迟。

关键发现

模型侧响应延迟约 200 ms,配合 350 ms 双向网络延迟后,总交互延迟约 550 ms,实现亚秒级全双工音视频通信。这一结果验证了原生流式设计避免了传统级联系统中 VAD→ASR→语言→TTS→动画 等多模块的累计延迟和错误传播。统一的模型直接学习响应时机和跨模态同步,使交互更自然流畅。

与基线对比解读

论文未给出具体数字基线,但框架性对比指出,级联系统因串行模块和重复编码/解码,典型延迟常超过 1 秒,且模块间信息损失难以避免。Wan-Streamer 将所有子任务联合建模在单模型中,端到端优化从感知到生成的完整循环,去除了外部语言、语音或视频生成模块,从根本上减少了延迟和错误累积。这种原生流式范式为实时交互基础模型设立了新的架构基准。

行业影响

落地场景

Wan-Streamer 让实时全双工音视频交互模型成为可直接集成的单组件,适合以下场景:

  • 虚拟数字人 / 实时 AI 主播:在直播电商、内容平台中实现低延迟、多模态的观众互动,虚拟主播可同时接收弹幕、语音提问,并生成同步的语音、表情与肢体动作。
  • 在线教育 / 企业服务:AI 助教或虚拟顾问能实时“观察”学生或用户的视频画面,感知困惑或注意力变化,并立即调整讲解节奏与内容,实现更自然的远程教学或客户引导。
  • 游戏与互动娱乐:NPC 可流式理解玩家语音与操作,动态生成对话与动画,无需预设行为树。
  • 具身智能与机器人:机器人可直接以流式形式处理音视频观测并输出动作与语音,避免传统管线级联延迟。

商业价值

  • 降低延迟成本:模型端延迟约 200 ms,总交互约 550 ms,达到亚秒级双工通信。传统级联系统因模块间传输、排队和转换,常累积 1–3 秒 延迟,本模型直接砍掉了 VAD / ASR / TTS / 动画驱动 等独立模块,大幅压缩从感知到表达的端到端延迟。
  • 减少错误累积:统一模型避免了级联模块间语义或时序错位(如文本转语音的音画不同步),提升交互自然度,降低因体验差导致的用户流失。
  • 降低工程与维护成本:一个模型替代多个子系统,简化部署、监控与更新流程,尤其适合需要快速迭代的场景(如直播电商的虚拟主播)。

与现有产品 / 工作流的接口

Wan-Streamer 可作为实时交互服务接入现有架构:

  • 模型输入输出定义为交错排列的视觉、音频、文本 token,下游可直接对接 WebRTC / RTMP 等流媒体传输协议,将视频帧、音频流与文本符号打包为统一的 token 序列。
  • 推理框架上,模型采用 块因果注意力低延迟多模态 token 调度,支持 160 ms 级流式单元,便于在 GPU / 边缘设备上部署成类似 on_audio_chunk()on_video_frame() 的回调式 API,与现有微服务架构(如 K8s 推理 Pod)兼容。
  • 对于已使用 LLM / VLMS 的产品,可将 Wan-Streamer 直接替换对话与生成模块,无需再串联 ASR、TTS 和动画引擎,实现精简的端到端全双工通道

具体应用案例

  1. 直播电商虚拟主播:某平台在售直播间部署 Wan-Streamer,虚拟主播实时接收用户语音连麦与弹幕文字,同时生成带表情、口型的视频流与语音回复,模型可在用户说完半句话时即开始生成回应(使用流式编码),总交互延迟低于 600 ms,显著提升带货转化率。
  2. 在线教育 AI 导师:语言教学平台集成 Wan-Streamer,AI 导师通过摄像头观察学生口型与表情,实时纠正发音,并以逼真的口型动画和自然语音给出示范,整个交互闭环在 500 ms 内完成,达到真人教师般的即时反馈。

局限

  • **训练数据与评估范围局限**:论文未详细说明跨模态流式交互数据的规模、来源与覆盖范围,仅在方法部分提及数据构建原则,缺乏对真实场景分布(如噪声环境、口音、遮挡、多人对话)的量化评估。当前实验仅聚焦于模型延迟指标,未报告生成质量(如视频自然度、语音可懂度)的充分对比,难以判断端到端方案是否在输出质量上追赶级联系统。在工程落地上,数据多样性与质量门槛可能成为关键瓶颈。
  • **长时交互与状态持久性未充分验证**:虽然模型声称能维护持久世界状态与对话状态,但论文未展示长时多轮交互下的上下文跟踪能力,也未分析错误累积(如幻觉、模态漂移)随交互轮次增加的变化趋势。对于全双工、可插话的真实交互,有限的上下文窗口与 block-causal 的固定步长可能限制模型对长程依赖的建模,现有 160 ms 流单元也缺乏对更长时间结构(如叙事连贯性)的支持证据。
  • **可解释性与调试复杂度较高**:端到端联合学习感知、推理与生成,且使用交织的多模态令牌序列,导致当模型出现响应延迟异常、跨模态不同步或语义错误时,开发者难以定位问题根源(是编码器失真、注意力分配错误还是生成策略缺陷)。相比于模块化级联流水线可逐环节诊断、优化,Wan-Streamer 的黑箱性增加了迭代与适配成本,制约其在安全敏感场景的采用。
论文Lianghua Huang2026-06-23原文

相关内容