Wan-Streamer v0.2: 更高分辨率,相同延迟
我们提出 Wan-Streamer v0.2,这是端到端音视频交互模型的原生流式升级,在保持延迟不变的前提下提升分辨率。v0.2 继承 v0.1 的建模框架,但将交互输出流从 192x336 提升至 640x368,同时在 25 FPS 下保持约 200 ms 的模型端信号到信号延迟。更高分辨率的流支持场景锚定的中景智能体,其姿态、视线、手部、附近物体及局部场景布局在实时对话中保持清晰可见。 为了在不增加用户可见延迟的情况下支持更大的视觉流,v0.2 保留了 thinker 作为单 GPU 低延迟路径,负责流式感知、短语言/状态 Transformer 传递(构建生成缓存)与最终解码。performer 则成为多 GPU Ulysses 风格的上下文并行组,用于昂贵的下一单元潜在生成。每个 performer 排名将传入的 K/V 写入预分片的本地缓存。长的高分辨率潜在视频序列跨排名分割用于去噪,并通过 Ulysses 通信聚合;而更短的音频潜在序列则无需序列分片即可生成。在这种拆分中,thinker 的语言/状态计算仅以 K/V 调节的形式到达 performer,因此在 performer 组内无需传输单独的语言序列。 这使额外的硬件资源集中于视觉生成,同时保持紧凑的 thinker-performer 边界,在包含 350 ms 双向网络预算的情况下,总远程交互延迟约为 550 ms。
论文精读
TL;DR Wan-Streamer v0.2 在保持约200ms模型延迟的前提下,将实时视听交互的分辨率提升至640×368,通过 thinker-performer 分离与多GPU并行实现更高清晰度、场景感知的流式对话智能体。
问题
问题背景
全双工实时音视频交互正成为多模态 AI 的前沿方向,目标是实现自然的类人对话,同时融合视觉场景理解与合成。这要求模型能在流式模式下处理高分辨率视频生成,以支持清晰的肢体语言、物体交互和场景呈现。
现有方法局限
- 低分辨率瓶颈:早期原生流式模型如 Wan-Streamer v0.1 输出仅
192×336,难以满足“半身照”中姿态、注视、手部细节和局部场景的可读性要求,影响沉浸式交互。 - 非流式或高延迟方案:许多视频生成模型采用离线推理,无法实时;而高分辨率流式方案常因计算并行不足或冗余通信导致延迟超标(>200ms 模型侧延迟),破坏对话节奏。
- 架构耦合度高:部分方法试图通过扩大模型尺寸提升分辨率,但 thinker 与 performer 间依赖紧密,未有效分离感知、语言状态推理和视觉生成,导致缩放性差。
技术难点与行业重要性
实时交互要求模型侧信号到信号延迟约 200ms(含网络后整体 <550ms),而高分辨率视频的分块去噪需在多 GPU 上高效并行。关键挑战在于:
- 如何分配计算:视觉生成序列长、音频短,需要非对称并行策略。
- 如何避免额外通信:语言/状态序列若在生成组内共享,会引入冗余传输;仅传递 K/V 条件可保持 thinker-performer 边界紧凑。
- 如何缓存利用:预分片本地 K/V 缓存减少重复计算。 这一问题直接关系数字人、虚拟助理等场景的用户体验,低延迟高画质是商业落地的硬性要求。
行业类比
这类似于云实时渲染应用中对画质与延迟的严苛平衡,任何一方的妥协都会让交互变得不可接受。
核心洞察
- 非对称并行策略在实时交互场景中实现分辨率提升且不增延迟。Wan-Streamer v0.2 将感知与语言状态路由(thinker)保留在单 GPU 低延迟路径,仅将计算密集的视觉生成(performer)通过 Ulysses 式上下文并行扩展到多 GPU,且 performer 只接收 K/V 条件而非完整语言序列。这不同于传统全模型并行或流水线并行,它针对流式音频-视觉交互中视觉部分延迟相对不敏感的特性,以最小通信代价将额外硬件精准投向瓶颈环节,工程上为实时交互系统提供了一种可复用的 scaling 范式。
- 极简的 thinker–performer 边界通过仅传递 K/V 缓存实现视觉生成的近乎零额外通信扩展。与常见的张量并行或序列并行方案需要在 worker 间传输完整激活或序列不同,v0.2 将语言状态压缩为 K/V 条件注入 performer,performer 内部仅需对高分辨率视频潜变量进行序列分片与 Ulysses all-to-all 通信,音频潜变量因序列短则无需切分。这种设计消除了 performer 组内同步语言序列的通信开销,使得多 GPU 生成高分辨率视频就像单 GPU 解码低分辨率视频一样简洁,为流式音视频生成系统的部署提供了可直接借鉴的架构模式。
方法
架构总览
Wan-Streamer v0.2 延续 v0.1 的 thinker-performer 两阶段设计,但将视觉输出分辨率从 192×336 提升至 640×368,同时保持 ~200 ms 模型端到端延迟(25 FPS)。thinker 仍为单 GPU 路径,负责流式感知、短上下文语言/状态 Transformer 推理、生成缓存构建与最终解码。performer 负责昂贵的下一单元潜在生成,v0.2 将其扩展为 多 GPU Ulysses 风格上下文并行组,使高分辨率视频潜在序列的生成不再受单卡显存与算力限制。
延迟保持策略:Ulysses 上下文并行与 K/V 预分片
为实现分辨率的量级提升而不引入额外延迟,performer 将传入的 K/V 缓存写入每个 rank 的 预分片本地缓存。长高分辨率视频潜在序列沿序列维度拆分至各 rank 进行并行去噪,去噪结果通过 Ulysses 通信原语汇聚;较短的音频潜在序列则不做序列分片,避免不必要的通信开销。thinker 的语言/状态计算仅以 K/V 条件形式送入 performer,performer 组内无需再传输单独的语言序列。这一设计将额外硬件资源集中用于视觉生成,同时维持了紧凑的 thinker-performer 边界,总远程交互延迟约 550 ms(含 350 ms 双向网络预算)。
与同类工作的差异
相比传统时序分片或流水线并行方案,Ulysses 上下文并行对长序列去噪的通信效率更高,且通过 K/V 预分片减少了 performer 内部的冗余传输,使得更高分辨率的流式生成延迟几乎不变,避免了对实时交互体验的破坏。
实验
实验设计
该工作未提供传统数据集评测,而是聚焦系统级延迟度量与分辨率提升验证。实验在真实流式对话场景下记录 信号到信号延迟(音频输入到视觉输出)和 总交互延迟(含网络往返),并定性评估中景代理的姿态、手部等细节的可辨识度。
关键发现
- 分辨率大幅提升:从 192×336 增至 640×368,像素量增加约 3.5 倍,但模型端到端延迟仍保持在 ~200 ms(25 FPS)。
- 架构并行有效:将视觉生成拆分为多 GPU Ulysses 风格上下文并行,仅将 thinker 的 K/V 条件传入 performer,避免了语言序列的额外通信,使得扩展 GPU 资源时延迟不增。
- 总交互延迟可控:包含 350 ms 双向网络开销后,总延迟 ~550 ms,满足实时对话需求。
与 v0.1 的对比
v0.2 在完全兼容 v0.1 建模公式的前提下,实现了视觉流升级。关键设计是 thinker-performer 边界 的紧凑 K/V 条件传递,使得新增 GPU 只用于视觉去噪,不影响思考路径的单 GPU 低延迟。这为后续更高分辨率的实时交互提供了可扩展范式。
行业影响
落地场景
Wan-Streamer v0.2 的高分辨率、低延迟流式音视频交互能力,直接适用于需要实时生成数字人视频的产品。典型场景包括:
- 实时虚拟助手与客服:在金融、政务、企业服务中,高帧率数字人可即时响应语音/文本输入,清晰的姿势、手势、面部表情提升服务自然度。
- 电商直播与内容创作:虚拟主播或导购实时根据弹幕、观众行为生成音视频回复,640×368 分辨率让手部展示、场景细节可读,增强带货说服力。
- 在线教育与远程培训:虚拟教师或教练实时对话,可配合教材演示手势、教具操作,保障教学互动质量。
- 游戏与元宇宙:高分辨率流式生成 NPC 对话,带来更逼真的实时角色互动,减少预渲染资源消耗。
商业价值
- 体验升级驱动转化与留存:在电商直播中,清晰的手势和表情能显著提升用户信任与购买意愿;在在线教育中,低延迟对话减少等待感,提升完课率。
- 硬件效率提升降本:通过思维器-执行器分离与 Ulysses 式上下文并行,v0.2 仅将昂贵视频生成多 GPU 并行,其余逻辑单 GPU 处理,在不增加用户感知延迟的前提下提高分辨率,推理硬件总成本低于纯全序列并行方案。
- 开放生态加速集成:作为端到端流式模型,可替代传统 ASR-LLM-TTS 管道与视频合成拼接方案,减少模块间延迟与错误累积,降低集成维护成本。
与现有产品/工作流的接口
v0.2 可视为一个高分辨率、低延迟的音视频流生成引擎,易于嵌入现有交互系统:
- 上游对接:直接接受多模态编码(语音、文本、当前场景状态)作为输入,思维器内部完成感知与语言/状态理解,无需外部 ASR/NLU 串联。
- 下游输出:生成音视频潜变量流,可用标准化解码器(如 VAE 解码器)渲染为视频帧和音频波形,通过 WebRTC/SRT 等协议推送至客户端。
- 与 LLM Agent 集成:思维器中的语言/状态 Transformer 本身可替换或微调,兼容现有 LLM 框架(如 HuggingFace、vLLM),执行器仅需 K/V 缓存作为条件,方便嵌入已有 Agent 工作流。
具体落地用例
- 跨境电商虚拟试戴/试用直播:用户通过摄像头或语音询问商品细节,数字导购实时展示产品并做手势操作(如旋转手表、涂口红),v0.2 的 200ms 模型延迟使交互更接近真人对话,高分辨率让商品纹理、标签清晰可辨。
- 远程医疗问诊数字人:患者通过移动端描述症状,虚拟医生实时生成安抚表情与手势,并可指引患者展示患部,640×368 分辨率足以看清局部细节,辅助预诊分诊,降低医生视频轮询压力。
局限
- **分辨率与场景局限**:v0.2 将输出流提升至 640×368,虽较 v0.1 的 192×336 有显著进步,但仍属中低分辨率。该分辨率对中景镜头中的人体姿态、手部及局部物体可保持可读性,但针对全身交互、复杂背景或需要面部细节的近距离场景,信息损失可能影响沉浸感。论文未展示在高动态、大范围移动或多人场景下的视频质量与延迟稳定性,亦未与更高分辨率(如 720p)方案进行系统对比,因此在实际应用中可能存在边界。
- **系统扩展性与工程成本**:为维持低延迟,v0.2 将 Performer 扩展为多 GPU Ulysses 式上下文并行组,这引入了跨 GPU 的 K/V 缓存分片与 All-to-All 通信。虽然避免了语言序列在多 GPU 间的冗余通信,但该方法依赖高速互联(如 NVLink),且论文未讨论不同 GPU 拓扑或数量下的延迟抖动与吞吐退化。对于资源受限或非均匀集群,部署复杂度与成本较高,而单 GPU Thinker 仍可能成为感知瓶颈,限制了从低端到高端的平滑扩展。