论文

Vidu S2:实时交互、可编辑与空间视频生成

Vidu S2:实时交互、可编辑与空间视频生成

我们提出 Vidu S2,它包含两个模型:Vidu S2-Avatar,一个实时交互式数字人模型;以及 Vidu S2-Editing,一个实时视频编辑模型。此外,我们还探索了在 Vidu S2-Avatar 与 Vidu S2-Editing 上实现实时空间视频生成的可行性。 相比 Vidu S1,各模块能力显著提升: - Vidu S2-Avatar 支持实时 720p 视频生成、支持可随时更新的动态参考,并具备更强的指令跟随能力,例如跳舞。 - Vidu S2-Editing 支持对视频流进行实时编辑,包括风格渲染、服装替换、角色替换与背景替换。 实验表明,Vidu S2 优于所有基线方法。可交互的在线 demo 见 https://vidu.com/vidu-stream。

论文精读

TL;DR Vidu S2 提出实时交互数字人模型 Vidu S2-Avatar 与实时视频编辑模型 Vidu S2-Editing,支持 720p 动态参考更新和空间视频生成,在多个基准上优于现有方案。

问题

问题背景

当前视频生成领域正从离线、单向生成转向 实时交互式生成 与 可编辑空间视频,以满足虚拟数字人、直播、实时内容创作等场景对低延迟、高指令跟随、动态条件更新的需求。

现有方法局限

以 Vidu S1 为代表的早期模型通常只能离线生成较低分辨率视频,且参考图像固定,无法在生成过程中动态替换人物外观或服装;指令跟随较弱,难以处理“跳舞”等复杂动作序列。视频编辑模型大多面向已录制视频的后期处理,不支持对实时视频流进行风格渲染、换装、换人、换背景等编辑;空间视频生成往往需要离线多视角重建,无法实时输出。此外,已有工作往往在实时性、分辨率、编辑保真度之间难以平衡,缺乏统一框架。

为什么难/重要

实时交互视频生成的核心挑战在于:生成式扩散模型推理成本高,要在 720p 分辨率下维持实时帧率,需要高效注意力、量化线性层、算子融合与多 GPU 并行等系统级优化;动态参考更新要求模型能即时注入新参考图像并保持身份一致性;复杂指令跟随需要更强的语义对齐。空间视频进一步增加多视角/深度一致性约束。业界对可实时操控的数字人和流式视频编辑需求强烈,这直接关系到下一代人机交互形态。

行业类比

类似 实时语音对话模型(如 GPT-4o 语音模式)从“生成完整音频”转向流式、可打断、可实时交互,视频生成也正在经历从离线渲染到实时交互的范式迁移,Vidu S2 是这一方向的代表性尝试。

核心洞察

  • Vidu S2-Avatar 的核心突破是支持生成过程中动态更新参考图像,这要求模型具备双向参考-视频映射能力,而非传统的单向条件生成。与固定参考外观的数字人模型相比,该模型通过双向图像与参考到视频训练,学会在任意时刻接受新参考并保持时间连贯性,直接解决了交互式场景中用户更换服装、配饰或角色的需求。现有基线如 Vidu S1 或常规 Talking Head 模型需重新推理才能更换参考,无法满足实时交互,而动态参考更新为实时个性化虚拟形象提供了新范式。
  • 实时视频编辑的关键在于将编辑任务建模为因果流式生成,而非全局条件重建。Vidu S2-Editing 通过因果流式训练使模型能在视频流到达时即时输出编辑帧,避免等待完整视频。这不同于现有视频编辑模型(如基于扩散的离线编辑器)需要一次性输入整段视频,从而显著降低交互延迟,为实时风格渲染、人物替换、背景替换等应用提供了工程可行性。该训练范式还支持空间视频编辑的流式处理,拓宽了实时视频编辑在 AR/VR 场景的适用边界。

方法

输入与整体架构

Vidu S2 包含两个实时模型:Vidu S2-Avatar(数字人交互)与 Vidu S2-Editing(视频编辑)。Avatar 输入为用户指令和可动态更新的参考图像,输出 720p 实时视频流;Editing 输入为视频流与编辑指令,输出实时编辑后的视频。

Vidu S2-Avatar 关键模块

  • 双向图像-参考到视频训练 同时学习图像到视频和参考到视频的映射,使模型能利用参考图驱动角色外观与动作。
  • Hybrid Teacher and Diffusion Forcing 结合教师强制与扩散强制,Self-Replay Forcing 通过自回放采样缓解误差累积,提升长序列稳定性。
  • Preference Optimization 对齐人类偏好,Super-Resolution Refiner 将输出提升至 720p。
  • 推理侧使用 高效注意力、量化线性层加速、核融合 与 多 GPU 并行 保证实时性。
  • Agentic System 负责提示生成、视觉反馈、参考图像管理,支持穿戴/摘取配饰等交互。

Vidu S2-Editing 关键模块

  • 双向视频编辑训练 同时学习正向编辑和反向恢复,增强编辑一致性。
  • 因果流式训练 以流式方式处理视频帧,降低实时编辑延迟。

实时空间视频生成

对 Avatar 和 Editing 均探索了实时空间视频生成与编辑 pipeline,赋予输出空间深度感。

与同类方法相比,Vidu S2 通过双向训练与混合扩散强制,在单一框架内统一了实时交互、可编辑性与空间生成能力。

实验

实验设计

Vidu S2 分别针对数字人模型 Vidu S2-Avatar 和视频编辑模型 Vidu S2-Editing 设计评估。在公共基准上,数字人生成使用 StreamAV-Bench;视频编辑使用 Sparkle-Bench、OpenVE、RefVIE 和 ViViD Test Set 四套数据集,覆盖风格渲染、换装、角色替换、背景替换等任务。除自动指标外,还进行补充的人类偏好评估和定性案例研究,并展示空间视频生成结果。

关键发现

论文摘要声称 Vidu S2 在所有基线之上表现更优,但提供的摘录未包含具体数值,因此无法给出定量对比。定性上,Vidu S2-Avatar 支持实时 720p 生成、动态参考更新和更强的指令跟随(如跳舞);Vidu S2-Editing 支持实时视频流编辑,并探索了实时空间视频生成。

基线对比解读

由于缺乏指标数据,只能从任务覆盖度分析:Vidu S2 将实时交互、可编辑性和空间视频生成整合到一个框架,而多数基线只针对单一任务。工程上,这类统一模型可能减少多模型部署的复杂度,但实时性对推理优化(如量化、核融合)要求更高。

行业影响

落地场景

Vidu S2 包含两个模型:Vidu S2-Avatar(实时交互数字人)和 Vidu S2-Editing(实时视频编辑),可直接应用于:

  • 电商直播:虚拟主播实时讲解,动态更换服装/背景,降低真人成本
  • 在线教育:AI 教师实时生成,根据学生反馈调整表情动作
  • 内容平台:实时风格化、角色替换,加速二次创作
  • 企业服务:客服数字人、虚拟会议形象

商业价值

  • 降本:替代真人直播、减少拍摄与后期,720p 实时推流降低带宽与计算成本
  • 增收:强交互性提升用户停留与转化,如虚拟试衣、个性化广告
  • 体验提升:动态引用更新 + 指令跟随使数字人更灵活;实时编辑让普通用户也能获得专业级视频处理能力

集成接口

模型提供在线 Demo 和开源代码(Vidu-S),可通过 API 嵌入现有流媒体工作流:

  • 直播平台:将实时流送入 Vidu S2-Editing 做风格/背景替换,再回推流
  • 内容生产:批处理管线中作为实时滤镜或特效模块
  • 数字人系统:用 Vidu S2-Avatar 替代传统 CGI 或动捕,降低动作驱动门槛

具体场景举例

  • 电商直播:输入商品图,Vidu S2-Avatar 生成多语言虚拟主播,实时讲解并展示服装上身效果(动态换装),减少多语言主播团队投入
  • 影视预演:概念预演阶段,用 Vidu S2-Editing 对预渲染序列实时替换角色外观与背景环境,加速创意迭代

局限

  • **空间视频生成仍处探索阶段**。论文将实时空间视频生成定位为“可行性探索”,但未提供多视角一致性、深度真实性等定量评估指标,难以证明其空间效果达到实用水平。同时,编辑类型(风格、换装、换人、背景)虽然常见但有限,未覆盖结构变形、运动重定向等更复杂编辑,且在遮挡、光照剧烈变化等条件下的鲁棒性缺乏系统验证。
  • **推理基础设施依赖强,可复现性受限**。实时 720p 生成依赖量化、核融合、多 GPU 并行等深度优化,这些技术高度绑定特定 GPU 架构,在消费级硬件上的延迟表现与可部署性不明确。动态引用更新虽然“随时”支持,但论文未给出更新频率上限或引用切换时的过渡一致性分析,可能影响长时间交互的流畅性与稳定性。
  • **缺少真实场景压力测试与专用模型对比**。实验主要基于公开基准和人类偏好评估,缺乏在真实交互场景(如长时间对话、极端表情或快速运动)下的稳定性验证。空间视频生成部分未与基于 NeRF 或 3DGS 的实时专用方法进行对比,其在视角一致性和几何真实性方面的竞争力有待进一步检验。
论文Jintao Zhang2026-09-10原文

相关内容