论文

Lip Forcing: 少步自回归扩散用于实时唇同步

Lip Forcing: 少步自回归扩散用于实时唇同步

基于扩散的唇同步模型在视觉质量和音视频对齐上表现优异,但全序列双向注意力机制和大量去噪步骤使其难以实现实时推理。我们提出 Lip Forcing——据我们所知首个用于视频到视频(V2V)唇同步的自回归扩散方法。该方法将 14B 参数的音频条件双向视频扩散教师模型蒸馏为因果学生模型。推理时,学生模型仅需两步去噪即可生成每个块,且无需推理时的 CFG,从而实现实时唇同步。 对唇同步特有的教师轨迹分析揭示了 CFG 的保真度-同步性权衡:无 CFG 的预测偏向参考保真度,而 CFG 引导的预测则偏向轨迹中段带内的同步性。Lip Forcing 将此发现转化为三个分析驱动的组件:Sync-Window DMD、两步推理调度和基于 SyncNet 的奖励。我们在两个学生规模上验证了 Lip Forcing,均从 14B 教师模型蒸馏得到。 - 1.3B 学生模型以 31 FPS 实现实时流式处理,比同等规模的双向模型快 17.6 倍。 - 14B 学生模型是 V2V 唇同步中报告的最大扩散模型,在可比参考保真度下运行速度比其教师模型快 39.8 倍。 两种规模的首帧延迟均低于亚毫秒,远低于所有扩散基线。

论文精读

TL;DR Lip Forcing 首次将自回归扩散用于视频唇形同步,通过蒸馏和定制调度实现仅需两步去噪的实时推理,速度比双向模型快数十倍。

问题

音频驱动的唇形同步旨在生成与输入语音高度对齐的说话人脸视频,在数字人、虚拟会议等应用中需求强烈。扩散模型因其生成质量成为主流,但现有方法面临实时性挑战。

现有扩散模型采用 全序列双向注意力 与数十步去噪,推理时还需搭配 CFG,导致计算开销巨大,无法实现流式处理。直接减少步骤或使用因果注意力会严重损害 音画同步身份保真度 的平衡。

实现实时唇形同步的难点在于:蒸馏出的 因果学生模型 必须在仅两步去噪且无 CFG 的条件下,保持高同步与高保真,同时满足 sub-millisecond 首帧延迟 和 30+ FPS 的吞吐。论文分析发现,教师模型去噪轨迹中期存在 CFG 引导的“保真度-同步”权衡带,即无 CFG 预测偏重保真但牺牲同步,强 CFG 则反之。这要求蒸馏策略必须精细设计 轨迹分段蒸馏(Sync-Window DMD)推理调度,技术挑战突出。业界对低延迟、低计算量的唇形同步方案有迫切需求,尤其适用于实时音视频流场景。

类似将 LLM 蒸馏为小模型实现本地实时推理,该工作通过分析教师轨迹,设计针对性的蒸馏方案,将双向扩散模型压缩为因果学生,解决全局依赖与流式处理的冲突。

核心洞察

  • 将双向扩散模型转化为自回归因果学生,仅需两步去噪且无需分类器自由引导(CFG),首次在视频到视频唇同步任务上实现 31 FPS 实时流式推理,首帧延迟亚毫秒,比同尺度双向模型快 17.6 倍。这突破了过往扩散方法因全序列注意力和多步采样而无法实时应用的瓶颈,为实时音视频同步流水线提供了轻量、可流式部署的新范式。
  • 通过分析教师模型去噪轨迹,发现无 CFG 预测保真度高但同步差,CFG 预测在轨迹中段同步增强而保真度下降,由此提出 Sync-Window DMD 与两步推理调度,将蒸馏目标精准锁定在同步最优的轨迹窗口内。与常规蒸馏直接模仿输出不同,该方法利用扩散过程的阶段性特征定向强化同步能力,在极少步数下实现保真度与同步的稳定平衡。

方法

教师模型与输入

Lip Forcing 将唇形同步建模为视频到视频(V2V)生成任务:输入参考视频帧(提供身份信息)和目标音频,输出与音频对齐且保持身份保真度的视频。首先训练一个 14B 参数的双向扩散教师模型,它接收带噪视频和音频条件,通过全序列双向注意力多步去噪生成高质量唇形视频。

教师轨迹分析与关键模块

对教师反向扩散轨迹的分析发现 CFG 保真度-同步权衡:无 CFG 预测倾向保持参考身份保真度,而 CFG 引导预测在轨迹中期区间更有利于音频-视觉同步。基于此洞察,方法引入三个分析驱动的组件:

  • Sync-Window DMD(同步窗口分布匹配蒸馏):在蒸馏过程中,学生仅学习教师轨迹中对应 CFG 优势的窗口区域,使得少数步骤即可同时保留保真度和同步性。
  • 两步推理调度:每个视频块(chunk)仅需 2 次去噪步骤,且无需推理时 CFG。通过自回归方式生成块序列,支持流式实时推理。
  • SyncNet 奖励:引入基于 SyncNet 的奖励信号,在训练中直接优化音频-视觉对齐程度,进一步提升口型同步精度。

学生模型与推理

通过教师-学生蒸馏,分别得到 1.3B 和 14B 参数的因果学生模型。学生采用自回归架构,仅依赖过去的帧和当前音频块生成当前块,天然适配流式场景。推理时,每个块只进行 2 步去噪,无需 CFG,极大降低计算量。1.3B 学生达到 31 FPS,首次实现实时流式唇形同步;14B 学生在与教师相当的保真度下快 39.8 倍,且首帧延迟均低于 1 毫秒,远超已有扩散基线。

差异点

与现有扩散唇同步方法(依赖双向注意力、多次去噪和推理时 CFG)不同,Lip Forcing 是首个将自回归扩散蒸馏引入 V2V 唇同步的工作,通过同步窗口蒸馏和两步调度彻底规避推理时 CFG,在保持质量的同时实现实时性能和极低首帧延迟。

实验

实验设计

  • 蒸馏方案:从 14B 参数的 OmniAvatar-LS(双向音频条件视频扩散教师)蒸馏出两种因果学生模型(1.3B14B),用于自回归生成。
  • 创新成分:Sync-Window DMD(基于教师轨迹分析设计的蒸馏损失)、两步推理调度(将去噪步数压缩到 2 步)、SyncNet 奖励(直接优化同步质量),三者均源于对教师扩散轨迹中 CFG fidelity-sync tradeoff 的发现。
  • 评估维度:推理速度(FPS)、加速比、首帧延迟,以及参考保真度与同步质量的权衡。

关键发现

  • 实时性能突破:1.3B 学生实现 31 FPS 流式推理,比同规模双向模型快 17.6 倍;14B 学生比其教师快 39.8 倍,同时保持相当的参考保真度。两次规模的首帧时间均低于 1 ms,远超所有扩散基线。
  • 去掉 CFG 不影响同步:通过教师轨迹分析发现,在去噪中段 no-CFG 预测有利于参考保真度,而 CFG 在同时段有助于同步。Lip Forcing 利用这一波段设计了 Sync-Window DMD,使学生无需推理时 CFG 即可获得高质量同步。
  • 两步即收敛:学生仅用 2 步去噪 就能生成每段视频块,验证了基于轨迹蒸馏的调度有效性。

与基线对比的深度解读

  • 传统双向扩散模型受限于全序列注意力与大量去噪步数,无法实时运行。Lip Forcing 通过因果自回归生成解耦了全局依赖性,使每块独立生成成为可能,是架构层面的关键转变。
  • 与普通蒸馏方法不同,本文的分析与设计高度结合:不是盲目减少步数,而是从教师轨迹中选出对同步最有益的区间,并用 SyncNet 奖励强化,从而实现速度与质量的双赢。
  • 从工程角度看,该工作证明了大模型轻量化部署的可行路径:14B 教师的知识可以压缩到两个体量学生中,并直接在普通硬件上实现实时流式推理,为实时视频 AI 应用(如虚拟主播、实时对话系统)提供了新范式。

行业影响

落地场景

Lip Forcing 将扩散唇同步推至实时,使其从离线后期制作走向在线交互。主要场景包括:

  • 数字人直播与视频会议:虚拟主播、AI 客服、远程呈现中,唇形与语音延迟低于人眼感知阈值,实现自然对话。
  • 影视与游戏配音:后期合成可批量加速,且质量不降,节省大量渲染时间。
  • 在线教育与培训:AI 讲师的唇形与多语言语音实时匹配,提升教学临场感。
  • 社交媒体与 UGC 内容:短视频平台的虚拟形象或重绘唇形工具,支持实时预览与生成。

商业价值

  • 降本:用 1.3B 学生模型替代 14B 双向教师,推理速度提升 17.6 倍,相同硬件可支撑更高并发,大幅降低实时数字人服务的 GPU 成本。
  • 体验提升:亚毫秒级首帧延迟与 31 FPS 流式生成,消除对话中的唇音不同步感,提升用户信任与互动时长。
  • 增收:实时能力使数字人可介入需即时响应的场景(如直播带货、实时客服),直接转化商业收益。

与现有产品/工作流的接口

Lip Forcing 的学生模型本质是一个因果、逐块生成的自回归网络,可轻松集成到现有视频推理框架:

  • ONNX/TensorRT 部署为实时推理服务,输入音频与参考帧,输出唇形视频。
  • 直播 SDK、WebRTC 等流媒体管线结合,可在视频帧进入编码器前插入唇同步处理。
  • 在影视后期工具(如 DaVinci Resolve、After Effects 插件)中作为加速渲染器,替代传统基于扩散的慢速方法。

具体落地用例

  • 电商直播数字人:品牌方使用 AI 主播时,Lip Forcing 驱动唇形与促销语音实时匹配,无需人工驱动或预渲染,支持 24×7 直播,大幅降低运营成本。数字人可即时响应观众提问,唇同步零延迟,增强购物体验。
  • 跨国企业多语言视频会议:员工使用母语发言,系统实时将语音翻译并合成对应唇形视频,使参会者看到与翻译语音同步的嘴型,消除多语言会议中的视听割裂感。Lip Forcing 的实时性保障对话流畅,首帧延迟低于 1ms,不影响会议节奏。

该工作的核心启示:两步扩散自回归Sync-Window DMD 的联合设计,使得重型的视频扩散模型首次达到实时流式推理,为其他生成式 AI 任务(如实时视频翻译、虚拟人生成)提供了可行的加速蒸馏范式。

局限

  • **教师依赖性**:学生模型的质量与推理加速效果完全依赖于 14B 参数的**双向教师模型**。教师训练流程复杂(需在 OmniAvatar 基础上进行唇同步微调),数据要求高,且蒸馏过程本身计算开销大。若教师模型在某些场景(如极端头部姿态、口音变化)存在缺陷,学生会继承这些偏差,且当前蒸馏框架并未提供脱离教师的持续自优化机制。
  • **长视频自回归漂移**:尽管通过 **SyncNet 奖励** 与流式分块生成缓解了自回归误差积累,但因果注意力机制本质上无法利用未来上下文,长时间生成仍可能出现唇音错位逐渐增大的问题。论文在长视频测试中的表现虽优于基线,但未量化超过数分钟级别的误差增长趋势,缺乏理论上的误差界分析。
  • **生成内容可控性有限**:方法专注于唇部区域与音频的同步,对**整体面部表情、头部姿态和背景的一致性**依赖参考帧和 teacher 的隐式先验。当输入视频包含显著非中性表情或大范围运动时,学生模型可能产生不自然的唇部变形,且缺乏显式的表情/身份解耦控制,限制了在高度表现力虚拟人场景中的适用性。
论文Paul Hyunbin Cho2026-06-09原文

相关内容