论文

AVTok: 用于整体音视频生成的一维统一分词

AVTok: 用于整体音视频生成的一维统一分词

音视频生成近期受到前所未有的研究关注,旨在合成高质量有声视频内容,实现听觉和视觉组件之间的细粒度同步和语义对齐。现有方法主要采用双分支设计,为每个模态配备单独的分词和生成模块,忽视了表示间隙,同时需要大量计算资源进行恰当训练。受一维视觉分词最新进展的启发,我们提出 AVTok,一种面向整体音视频生成的新型统一分词器。 AVTok 采用基于双流 Transformer 的架构,具有共享编码器-解码器 和模态特定可学习查询,以高效地将音视频对编码为紧凑的一维潜在表示,并使用统一码本。为应对异质信息不平衡阻碍 AVTok 利用对齐音视频信息的问题,我们设计了一种层次化训练策略,逐步实现每个模态的重建能力。 大量实验表明,AVTok 在音视频重建以及集成到下游流水线(如音频到视频、视频到音频和类条件联合音视频生成)中均表现优异。AVTok 为联合音视频分词挑战铺平了道路,并为构建用于音视频生成的统一多模态大模型提供了潜在方向。

论文精读

TL;DR AVTok 首次实现音视频统一一维标记化,用双流 transformer 与模态专属查询将音视频压缩为紧凑一维潜码,大幅减少计算开销并提升同步性,助力联合音视频生成大模型。

问题

问题背景

音视频联合生成(audio-video generation)旨在合成视觉与听觉高度同步、语义一致的高质量有声视频,近年来在数字内容创作、虚拟现实、多模态交互等领域受到广泛关注。其核心挑战在于同时建模跨模态的时空对齐与内容一致性。

现有方法局限

当前主流方案普遍采用 双分支架构,即为音频和视频分别设计独立的 tokenizer 与生成模块。这种设计带来多个技术缺陷:

  • 模态间隙(representation gap) 被忽视:独立 tokenizer 学到的离散表示缺乏跨模态对齐,导致生成结果在细粒度同步(如口型匹配、物体撞击声)上表现不佳。
  • 计算资源浪费:两套参数独立的编码器-解码器与码本使得训练开销倍增,且难以扩展至统一的生成先验。
  • 信息融合滞后:仅在生成阶段进行跨模态交互,未能从底层表示层面利用音视频的天然共现关系,限制了生成质量上限。

为什么这个问题难且重要

音视频联合 tokenization 的难度源于 异构信息的不平衡性(heterogeneous information imbalance):视频包含丰富的纹理与运动信息,而音频主要体现节奏和语义事件,二者在时间尺度、特征维度上差异显著。训练时若强行联合编码,模型易偏向视频信号而忽视音频,导致音频重建质量下降。此外,同步建模(synchronization modeling) 要求 tokenizer 能捕捉毫秒级的跨模态对应,这对架构设计和训练策略都是极大挑战。

从工业界看,统一的音视频 tokenizer 是构建 大型多模态基础模型 的关键基础设施,可支撑从文本到音视频生成、跨模态检索、理解-生成一体化等广泛下游任务。因此,该方向的突破将显著降低多模态生成系统的复杂度与训练成本,成为音频-视觉大模型的核心使能技术。

行业类比

类似于 NLP 中 SentencePiece 或 BPE tokenizer 通过统一文本子词表示极大简化了多语言模型的训练,AVTok 试图为音视频生成提供一种通用的一维离散表示,有望成为多模态生成模型的“标准 tokenizer”。

核心洞察

  • 统一码本与共享编码器-解码器架构消除模态表征鸿沟:现有音视频生成方法大多采用独立 tokenizer 和生成模型,导致模态间表征不对齐和冗余计算。AVTok 通过一个联合的 1D tokenization 框架,将音视频映射到统一的潜在空间和码本,从根本上保证了语义对齐和紧凑性,大幅降低下游生成模型的复杂度。这为构建统一的音视频大模型提供了关键的 tokenizer 基础,简化了训练流程和计算资源。
  • 视频优先、音频随后的分层训练策略有效应对异构信息不平衡:音视频数据中视觉信息远多于听觉信息,若直接联合训练容易使音频被淹没。AVTok 提出先训练视频重构(借助成熟视频 tokenizer 初始化),再逐步引入音频重构,并通过表征对齐损失拉近模态距离。这种课程式的训练范式确保了两种模态都能被充分学习,避免了性能倾斜,是一种通用且可行的多模态联合训练方案。

方法

输入与预处理

AVTok 的输入是成对的 音频-视频对 (audio-video pair)。首先通过 Patchify 将视频帧和音频频谱分别分割为不重叠的块 (patch),形成序列化 token,作为 双流 Transformer 的输入。

核心架构:双流 Transformer 与统一 Tokenization

  • 共享编码器-解码器: 视觉和听觉两个模态共享同一个 Transformer 主干,以降低参数量和促进跨模态信息交互。
  • 模态特定可学习查询 (modal-specific learnable queries): 在编码器输出端,引入一组针对视频和音频的独立可学习查询向量,通过交叉注意力将不同模态的信息压缩为一维紧凑的潜在表示。
  • 统一码本 (unified codebook): 两个模态的潜在表示通过向量量化 (VQ) 映射到同一个码本中的离散索引,实现真正的联合 tokenization,消弭了传统双分支架构中的表示鸿沟。
  • 重建目标: 解码器从量化后的潜在码重建原始音视频,损失函数包含重建损失 (如 L1/L2)、感知损失 (LPIPS) 和判别器损失 (GAN),确保视听质量与同步性。

训练策略:分层渐进式学习

由于音频和视频的信息密度与学习难度差异显著,AVTok 采用 三阶段分层训练

  1. 视频先行 (Video-First-Audio-Later, VFAL): 先单独训练视频重建能力,稳定视觉表示。
  2. 表示对齐学习: 冻结视频分支,加入音频重建,通过额外对齐损失强制视听潜在空间一致。
  3. 跨模态自回归生成先验: 在统一 tokenization 基础上,训练一个交叉注意力 自回归 Transformer 作为生成先验,支持音频到视频、视频到音频及联合生成等下游任务。

输出与下游应用

AVTok 输出重建的音视频对,其离散潜在码可直接作为 自回归生成模型 的 token,用于条件或无条件生成。实验表明,该统一 tokenizer 在重建质量与生成任务中均优于分离式方法,且能无缝集成到多模态大模型中。

与同类工作的核心差异: 以往方案普遍采用每模态独立 tokenization + 独立生成模块的双分支设计,不仅计算昂贵,更忽略了跨模态表征对齐;AVTok 首次通过单一统一码本共用编解码器实现紧耦合的音视频 tokenization,从底层表示层面解决了视听同步与语义对齐难题。

实验

实验设计

AVTok 的实验围绕两大板块:重建评估生成评估。重建部分对比不同 tokenizer 在音视频输入上的重建保真度,基线包括传统的双分支独立 tokenization 方案。生成评估则将 AVTok 编码后的码本送入自回归生成先验(AR prior),执行三类交叉任务:

  1. 音频→视频 (A2V)
  2. 视频→音频 (V2A)
  3. 类别条件联合音视频生成 实验旨在验证统一 tokenizer 在下游生成中的有效性和跨模态对齐能力。

关键发现

  • 统一 1D 表示高度有效:AVTok 获得的紧凑潜空间在重建质量上超过基线,证明双流 Transformer + 统一码本能够同步保留音视频细节。
  • 层级训练策略 (VFAL) 通过先训练视频分支、后融入音频的方式,显著缓解了异构模态的信息不平衡,避免了训练初期音频占优导致的视频质量塌陷。
  • 生成任务中同步性明显提升:集成到 AR 生成器后,A2V 和 V2A 生成结果展现出更自然的跨模态同步,相较于独立 tokenization + 后期融合的方法,语义错位和时序偏移更少。

对比基线深度解读

基线方法通常采用双分支编码器-解码器,每个模态独立 tokenizer 并分别优化,这带来了较高的计算开销潜在的表示空间不对齐。AVTok 通过共享的编解码器骨干和模态特定可学习查询,在单一前向过程中完成音视频压缩,训练参数量大幅降低。同时,统一码本强制两种模态共享离散词汇,为下游生成模型提供了天然对齐的符号序列。相比基线,这种设计避免了后验对齐步骤(如对比学习、时间重同步),使得生成 pipeline 更简洁高效,尤其适合资源受限或实时应用场景。实验表明,即使使用相同的生成先验架构,AVTok 相比双分支方案在生成帧的清晰度与声音匹配度上均有可感知的优势,验证了统一 tokenization 在大模态模型中的潜力。

行业影响

落地场景

AVTok 为音视频生成提供了统一的 tokenization 方案,可落地于:

  • 短视频与社交媒体:自动化配乐、视频转音频、音频生成视频,加速内容创意工坊的生产效率。
  • 虚拟数字人与实时交互:在虚拟主播、在线教育或客服场景中,同步生成唇形匹配的语音与面部动画。
  • 影视后期与游戏开发:根据对话或环境音快速生成匹配的口型动画、背景画面,减少人工对齐成本。
  • 电商与广告:从商品描述音频直接生成展示视频,或为商品视频自动添加风格化配乐,提升转化率。

商业价值

  • 降本:统一 tokenizer 替代传统“音频 + 视频”双分支方案,训练算力与推理耗时显著降低,同时减少了双模块间的适配工程开销。
  • 增收:更高的音视频同步质量和语义一致性直接提升内容平台用户时长与广告收益;电商场景中富有感染力的音视频素材可提高购买转化。
  • 体验提升:紧凑的 1D 表示使移动端/边缘设备上的实时生成成为可能,满足低延迟交互需求,增强产品竞争力。

与现有工作流的接口

AVTok 可作为预训练 tokenizer 无缝集成到现有生成管线:

  • 替代分立 tokenizer:将原有的音频 tokenizer(如 EnCodec)与视频 tokenizer(如 VQVAE)统一替换,输入音视频 pair 直接输出联合潜在码。
  • 对接自回归生成模型:其统一码本和 1D 表示可直接馈入 GPTLlama 风格的自回归生成器,实现跨模态生成。
  • 与扩散模型协同:在 latent diffusion 框架中,可将联合潜在表示作为 condition 或输入,用于可控生成。

具体落地用例

  1. 全球短视频平台:用户上传一段无声视频,系统调用 AVTok 分析视觉内容后生成同步环境音与背景音乐,AR 生成器 基于统一 token 序列预测音频 token,端到端生成带音视频的成品,耗时从分钟级降至秒级。
  2. 在线教育平台:讲师仅提供语音课件,平台可根据语音内容实时生成匹配的虚拟教师手势、板书动画和表情,AVTok 确保嘴型与语音同步,实现低成本的多媒体课程自动化。

局限

  • **数据规模与场景覆盖有限**:当前实验主要在现有学术数据集上进行,尽管覆盖了多种类别,但数据总量和场景多样性仍显不足。这可能导致学到的统一令牌化在复杂背景、多声源、长序列等真实场景下泛化能力下降,生成内容的视觉保真度和听觉自然度可能受限。
  • **训练资源消耗大、工程门槛高**:双流 Transformer 架构与分层训练策略(VFAL + 表征对齐)显著增加了计算开销,尤其端到端联合训练尚不可行,目前采用两阶段流程(令牌器预训练 + 生成先验训练),带来额外的工程复杂度。这限制了资源受限团队的快速复现与迭代。
  • **跨模态同步建模仍待精细优化**:虽然统一令牌化试图弥补表示鸿沟,但模型未显式建模时序对齐或引入同步损失,仅靠共享码本和分层策略隐式学习关联。在唇形同步、乐器演奏等需要帧/毫秒级对齐的任务中,可能产生不匹配,生成质量有进一步提升空间。
论文Kien T. Pham2026-06-29原文

相关内容