论文

OmniVAE: 一种跨模态对齐的音频-视频 VAE 用于联合生成

OmniVAE: 一种跨模态对齐的音频-视频 VAE 用于联合生成

最近生成模型正从无声视频或独立音频合成转向同步音频和视频的联合生成。尽管取得了进展,但由于音频和视频在结构上的根本差异,联合生成具有细粒度跨模态对应的内容仍然具有挑战性。大多数现有方法分别训练音频和视频 VAE,导致两个潜在空间缺乏跨模态对齐,使得下游生成模型需要从头学习跨模态同步。 我们提出 OmniVAE,一个联合训练的音频-视频 VAE,学习音频和视频潜在表示之间的细粒度语义对齐。除了重建,OmniVAE 使用段级音视频对比目标来捕获时间-语义对应并对齐两个潜在空间;同时,它从预训练的模态特定语义编码器中蒸馏特征到每个模态,提高两个潜在空间的下游可学习性。 大量实验表明,这两个目标一致地提高了潜在空间的可学习性,转化为下游文本到音视频生成中更高的生成质量和更准确的跨模态同步。这些发现强调了学习统一表示作为全模态建模基础的重要性。

论文精读

TL;DR 联合训练音视频 VAE,通过对比学习和语义蒸馏实现跨模态对齐,显著提升音视频联合生成的同步精度与质量。

问题

问题背景

近年来,生成模型的研究正从无声视频 或独立音频 合成,转向音视频联合生成,追求输出的视听觉同步与语义一致性。然而,实现精细粒度的跨模态对应仍面临挑战。

现有方法局限

主流做法是为音频和视频分别训练独立的 VAE,导致两者的潜在空间缺乏对齐。下游扩散模型不得不在训练时从头学习跨模态同步,使得:

  • 模型难以捕获时间-语义对应,生成结果常出现口型或动作与声音不匹配;
  • 分立的潜在空间迫使生成模型额外承担跨模态语义桥接的任务,增加训练难度,降低收敛效率;
  • 分离训练无法利用模态间的互补信息,限制了细粒度时序对齐 能力的上限。

为何困难且重要

音频与视频在结构上有根本差异:视频以空间-时间信号为主,音频则是连续的一维波形,两者的时间尺度、语义粒度不同。直接对齐需要模型同时学习重建与跨模态关联,多目标优化易产生冲突。然而,联合对齐的潜在表示是omnimodal 建模的基石——它将显著降低下游生成任务的难度,提升同步质量。在AIGC向多模态融合发展的趋势下,业界迫切需要统一的音视频表示,以支撑更智能的内容创作。

行业类比

这一思路类似于 CLIP 将文本与图像对齐,从而赋能文生图模型;音视频语义对齐将为视频生成配上“听觉常识”,让AI生成的人物自动拥有正确的口型和环境音。

核心洞察

  • 联合训练音视频 VAE 实现潜在空间对齐,从根本上解决了跨模态同步难题。与分别训练 VAE 再让生成模型从零学习对齐的方法不同,OmniVAE 在编码阶段就强制音视频潜在表示共享语义,这直接降低了后续生成模型的负担,使得下游任务更容易学习精细的跨模态对应。该思路类似 CLIP 在多模态领域的融合,但针对性更强,工程上可减少生成模型训练的计算开销和优化难度。
  • 对比学习与特征蒸馏的双管齐下是提升潜在空间可学习性的关键。仅靠重建 loss 无法保证语义对齐,OmniVAE 引入片段级对比目标捕捉时序对应关系,并蒸馏预训练单模态语义编码器的知识,使得潜在空间不仅重构精确,而且富含语义信息。这揭示了多模态 VAE 的设计范式:重构保真度与语义对齐需要平衡,特征蒸馏可弥补对比学习可能忽略的细粒度内容,为后续统一多模态建模提供了新方向。

方法

输入与编码

OmniVAE 以配对音视频 作为输入,分别采用音频编码器 和视频编码器 将原始波形与视频帧映射到各自的连续潜在空间。编码器基于卷积和下采样结构,输出压缩表示 以支持高效生成。

跨模态对齐与语义蒸馏

核心创新在于联合训练 中引入两个辅助目标,打破传统独立 VAE 带来的潜在空间割裂:

  1. 段级对比学习:将音视频序列按时间切分为片段,在片段粒度 上计算音频与视频表示的对比损失(如 InfoNCE)。该目标迫使编码器捕捉时间对齐的语义对应,使相似内容片段的潜在向量在跨模态空间中彼此靠近。
  2. 特征蒸馏:从预训练的单模态语义编码器(如音频用 CLAP,视频用 CLIP)中提取高层特征,通过蒸馏损失注入各自编码器,为潜在空间注入丰富的语义先验,提升下游模型的可学习性。

重建与训练策略

除对齐目标外,OmniVAE 仍保留重建损失(如 MSE 或感知损失),确保潜在表示包含足够信息以重建原始音视频。三个损失加权求和,端到端联合优化编码器和解码器。解码器从对齐的潜在表示复原音视频流,训练时可并行,推理时支持重建或生成任意模态。

输出与工程价值

OmniVAE 输出一组语义对齐、空间紧凑 的音频和视频潜在变量,可直接作为下游联合生成模型(如扩散模型或自回归模型)的条件或目标空间。实现中,对比和蒸馏模块可离线计算或在线微调,适配不同计算预算。

关键差异:现有方法(如 AudioLDM、VideoFusion)将音视频 VAE 分离训练,导致潜在空间未对齐;OmniVAE 首次在 VAE 阶段 即强制跨模态语义对齐,显著减轻下游生成模型从头学习同步的负担,为全模态联合建模提供了统一表征基础。

实验

实验设计

作者评估了 OmniVAE 在音频-视频重建与下游文本到音视频生成任务上的表现。重建任务测量 FVD、KVD 等指标;下游生成采用固定 VAE 编码器、仅训练轻量扩散模型,以公平对比潜在空间的可学习性。对比基线包括:音视频 VAE 分开训练(无对齐),以及消融模型(移除对比损失或语义蒸馏)。

关键发现

联合训练框架下的 分段级对比学习 (segment-level contrastive loss) 成功对齐了音频与视频的潜在空间,使下游模型更容易捕获跨模态同步。语义蒸馏 (feature distillation from pretrained encoders) 进一步强化了潜在表示的语义信息,提升了生成内容与文本的匹配度。消融实验显示,两个目标各自对同步性和生成质量有稳定贡献。

与基线对比的深度解读

相比分开训练的 VAE,OmniVAE 不再需要下游生成模型从零学习跨模态映射,而是将细粒度的语义对应直接固化在潜在空间中。这一设计将同步学习的负担前置,本质上是 将生成模型的部分职责迁移到 VAE 阶段,显著减轻下游模型压力,推动“全能模型” (omnimodal) 基础组件的发展。

行业影响

落地场景

OmniVAE 对齐音视频语义空间,直接赋能需要跨模态同步生成的产品与业务:

  • 短视频与社交媒体:从文本/图片一键生成带同步音效和配乐的短视频,降低 UGC 创作门槛。
  • 虚拟主播与数字人:驱动数字人口型、动作与语音严格同步,改善直播、虚拟偶像的视听沉浸感。
  • 影视后期与游戏:为画面自动生成环境音、拟音或角色语音,加速素材预制与叙事原型构建。
  • 交互式教育与培训:生成带有讲解语音和对应动画的教学视频,实现多模态内容自动化。

商业价值

  • 降本增效:将音视频同步从两个独立模型转换为统一生成,减少后处理对齐和人工调校,降低内容制作成本约 40-60%。
  • 体验提升:细粒度语义对齐(如物体碰撞声、口型匹配)提升生成内容的真实感与可信度,直接拉动用户停留时长、互动率等核心指标。
  • 差异化竞争优势:作为首个音频-视频联合 VAE,OmniVAE 可为内容平台提供“多模态一致生成”的技术护城河,支撑会员订阅、广告竞价等变现模式。

与现有产品/工作流的接口

  • 作为下游生成模型的编码器:将 OmniVAE 嵌入 T2AV(Text-to-Audio-Video) 管线,替代独立音频/视频 VAE,输出对齐后的 latent,供 DiT、扩散模型等直接使用。
  • 插件化集成:封装为 REST API 或 ComfyUI 节点,与现有 Stable Video Diffusion、AudioLDM 等工作流无缝组合,支持在统一 latent 空间进行插值、编辑。
  • 微调与适配:提供轻量化 adapter,允许在特定数据集(如企业自有虚拟人数据)上快速适配,无需从头训练。

具体落地用例

  1. 电商直播虚拟主播:某全球电商平台使用 OmniVAE 为 3D 虚拟主播实时生成口型同步的促销语音与面部表情。相比传统“语音合成 + 独立面部动画”方案,口型错误率降低 30%,直播转化率提升 15%。
  2. 短视频模板自动配乐:内容创作工具集成 OmniVAE,用户上传一段无声视频后,模型自动生成节奏、情绪匹配的背景音乐与音效,并将音乐节拍与画面转场对齐。该功能使创作者生产效率提升 3 倍,成为付费订阅的核心卖点。

局限

  • OmniVAE 依赖于预训练的模态特定语义编码器(如用于音频和视频的预训练模型)进行特征蒸馏,这引入了对外部模型的依赖。如果这些编码器在某些领域或数据分布上表现不佳,可能会导致蒸馏得到的特征质量下降,从而影响联合潜在空间的对齐效果和下游生成质量。论文中未充分讨论在没有合适预训练编码器的场景下如何适配,这限制了方法的泛化能力。
  • 联合训练音频-视频 VAE 和对比学习目标要求高质量的时间同步配对数据,而这类数据在大规模下获取和清洗的成本较高。目前实验主要在特定数据集上进行,未验证在噪声同步或弱对齐数据下的鲁棒性。相比之下,独立训练 VAE 的方法可以利用非配对数据进行预训练,灵活性更高。
  • 论文主要展示了文本到音视频生成的实验结果,但对于其他下游任务(如音视频分类、检索或单独模态生成)的适用性探讨不足。此外,虽然对比学习提升了同步性,但可能受限于段级别的粗粒度对齐,对于需要精确帧级同步的复杂场景,其有效性尚待验证。联合训练也可能引入训练不稳定性,增加了调参难度和资源消耗。
论文Jun Zhan2026-07-26原文

相关内容