论文

一个模型,多种延迟:面向多样化实时应用的通用语音增强

一个模型,多种延迟:面向多样化实时应用的通用语音增强

不同实时语音应用对延迟预算有不同要求,通常需要为每个场景单独训练增强模型。本文提出一种通用实时语音增强模型,可同时控制算法延迟和计算延迟。 算法延迟通过可配置的前瞻帧灵活调整。为避免不同填充配置导致的学习效率低下,我们引入并行卷积层,对应不同前瞻设置。计算延迟通过早退机制控制,允许在不同网络深度进行推理。为缩小专用模型与灵活模型的性能差距,提出两阶段训练策略,包含共享到多解码器的过渡。 总体而言,该框架使单个模型能够部署在多种延迟预算下,无需为不同场景重新训练。

论文精读

TL;DR 一个实时通用语音增强模型,通过可配置的 look-ahead 帧和 early-exit 机制灵活控制算法与计算延迟,使单一模型适配多种实时延迟预算,免去为不同场景分别训练的负担。

问题

问题背景

实时语音增强(SE)正从单任务模型走向统一语音增强(Universal Speech Enhancement, USE),旨在跨多样退化条件提升可懂度与感知质量,同时保留说话人身份等属性。但现有 USE 模型(如 Miipher-2、RE-USE)采用非因果架构,不适用于对延迟敏感的应用。

现有方法局限

  • 固定延迟预算:当前实时 SE 模型需为每种延迟需求单独训练,算法延迟(由 STFT 窗口、前瞻帧数决定)和计算延迟(推理时间)无法灵活调整,部署成本高。
  • 多延迟训练低效:尝试用一个模型覆盖多种前瞻值会导致不同的填充(padding)配置,卷积层难以共享,训练收敛慢且性能下降明显。
  • 计算延迟无显式控制:仅靠网络剪枝或量化无法动态平衡计算与效果,缺少运行时按需选择网络深度的机制。

为什么这个问题难/重要

  • 技术挑战:算法延迟与计算延迟相互耦合,可控性设计需避免网络结构大幅膨胀;不同前瞻帧对应的特征维度对齐困难,并行卷积层的引入会增加参数量,如何高效训练是一大难点。
  • 性能与灵活性的折中:通用模型常牺牲性能,尤其在不同延迟配置下,早期退出(early-exit)机制在 SE 任务中缺乏成熟训练方案,容易造成品质骤降。
  • 业界关注度:实时通信(VoIP)、助听设备、人机交互终端对端到端延迟有硬性要求(如 <20ms 或 <40ms),单模型适配多场景可大幅降低工程维护与算力成本,是产业落地的迫切需求。

行业类比

类似于 Whisper 等统一语音识别模型通过调整解码步数来切换实时与离线模式,实时语音增强也需要一个模型内嵌不同前瞻和退出点,使“一键部署”覆盖从超低延迟通话到离线高质量修复的所有场景。

核心洞察

  • 通过并行卷积层和早期退出机制,在单一模型中同时显式控制算法延迟(look-ahead frames)与计算延迟(推理深度),使一个模型覆盖从低延迟到高质量的所有实时语音增强需求,避免了为不同延迟场景独立训练和维护多个模型的工程开销。与现有统一模型只关注多种退化条件而忽略延迟约束不同,这项工作首次将延迟作为可操控维度纳入通用语音增强框架。
  • 两阶段训练从共享解码器过渡到多分支解码器,解决了不同早期退出点因共享参数而产生的优化冲突,让浅层分支也能获得高质量输出,从而缩小通用延迟可控模型与专用单延迟模型之间的性能差距。这一策略比简单添加辅助损失或分支权重更有效地平衡了不同延迟档位的增强质量,为实时模型的柔性部署提供了可复用的训练范式。

方法

模型架构

输入语音经 STFT 得到频谱,送入共享编码器。为支持灵活的算法延迟,编码器前端采用并行卷积层:针对每个候选的前瞻帧数 (look-ahead frames),独立设置一个初始卷积层,以适配不同的填充 (padding) 配置。这避免了不同前瞻设定下共享参数导致的学习冲突;各分支后续的编码器网络主体则参数共享。

算法与计算延迟联合控制

  • 算法延迟通过选择前瞻帧数直接调节,对应激活某一个并行卷积分支。
  • 计算延迟早退机制 (early-exit) 控制。解码器在多个网络深度设置输出出口。浅层出口所需的计算量小、延迟低;深层出口的增强质量更高。部署时可根据延迟预算动态选择退出层,无需更换模型。

两阶段训练策略

为缩小灵活多出口模型与固定延迟专用模型之间的性能差距,训练分为两阶段:

  1. 第一阶段:所有出口共享同一个解码器,强制编码器学习适合各深度的通用表示。
  2. 第二阶段:转换为多个独立解码器,各自负责对应出口的精细化增强。这种共享到多解码器转换 (shared-to-multiple decoder transition) 有效提升了各延迟档位的增强质量。

损失函数结合频谱幅度损失与感知指标(如 SI-SDR、PESQ),在多任务框架下联合优化。最终,增强频谱通过逆 STFT 恢复为时域信号。

与同类方法的差异:现有方案通常需为每个延迟预算单独训练模型,而本方法通过并行卷积与早退机制在单一模型中实现灵活可配的延迟控制,且两阶段训练保证了不同延迟下的稳定性能,避免了模型冗余与重复训练。

实验

实验设计

模型在 non-Blind URGENT 2025 Test Set 上评估,覆盖多种 算法延迟(通过可配置的 look-ahead frames 实现)和 计算延迟(通过 early-exit 在不同网络深度终止推理)。训练采用两阶段策略:

  1. stage 1:所有延迟分支共享编码器与中间层,训练共享表示;
  2. stage 2:转换至多个独立解码器头,各自适配不同的 early-exit 分支,减少灵活性与专有模型间的性能差距。 对比对象包括需要为每种延迟预算单独训练的 专有模型(specialized models),以及其他实时语音增强基线。

关键发现

  • 单一模型适配多样延迟:通过并行卷积处理不同 look-ahead 设置的 padding 差异,模型避免了对每种配置单独训练的冗余,在多个延迟目标下均保持稳定增强效果。
  • 两阶段训练缩小性能差距:共享解码器预训练再转为多解码器分支,使灵活模型在多数延迟设定下接近专有模型的客观指标(如 PESQ、STOI),避免了早期多分支训练的不稳定性。
  • 计算延迟显式控制:early-exit 机制允许在运行时平衡资源消耗与输出质量,为边缘部署提供了更多调度可能性。

与基线对比

相比于传统 每延迟一模型 的做法,RE-USE 的通用方案显著降低了开发、存储和部署成本。尽管与完全非因果的离线模型(如 Miipher-2)仍存在一定性能差距,但其因果/近似因果架构和灵活的延迟控制使其成为实时应用的首选。与同样面向实时的其他模型相比,RE-USE 在跨延迟场景下的泛化能力和部署便利性上具有明显优势,证明通过架构设计而非独立训练可以同时满足多种实时约束。

行业影响

落地场景

RE-USE 统一模型可在视频会议 (如 Zoom / Teams)、语音助手 (车载 / 智能音箱)、直播平台在线教育远程医疗助听器 / TWS 耳机等场景直接落地。其核心价值在于:一个模型覆盖从超低延迟的边缘设备到高延迟高算力的云端推理,无需为不同产品线分别训练与部署专用模型。

商业价值

  • 研发与运维降本:不再为每个延迟预算维护独立模型,减少训练、版本管理、A/B 测试开销。
  • 体验提升:动态调整延迟与算力,在弱网或低端设备上自动切换轻量推理,保证语音清晰度的连续性。
  • 服务化变现:作为音频处理 API 或 SDK 按调用量计费,尤其适合接入已有实时通信 (RTC) PaaS 产品。

与现有工作流的接口

模型以带噪音频波形为输入,输出增强后波形,可直接插入 WebRTC 媒体管线或移动端音频处理框架 (如 Android AudioEffect / iOS AVAudioEngine)。对外暴露两个控制参数:look-ahead frames (算法延迟) 与 early-exit layer index (计算延迟)。工程集成时,RTC 客户端在 session 建立时根据终端算力与网络 RTT 预设参数,或在运行中按丢包率自适应切换。

具体落地用例

  1. 远程医疗问诊:医生端使用工作站,患者端可能是低端手机。模型根据患者设备算力自动降低计算延迟 (早期退出),同时保留必要的 look-ahead 以保证降噪效果,确保问诊对话清晰可懂。
  2. 在线教育大班课:教师侧部署高质量增强 (长 look-ahead + 全深度),学生侧根据自身设备动态匹配轻量配置。平台只需分发一个模型权重包,极大简化了客户端版本适配。

模型权重已开源于 Hugging Face,可直接集成进现有实时语音处理栈。

局限

  • **通用性验证有限**:论文仅在 **URGENT 2025** 测试集上评估,该数据集主要覆盖特定合成噪声与失真类型,未涉及真实场景下高度非平稳噪声、混响或不同语言,也未与最新的通用语音增强基准全面比较,方法的跨领域泛化能力尚需更严格的实验支撑。
  • **模型容量与部署权衡分析不足**:引入的**并行卷积层**为每个 **look-ahead** 设置独立分支,虽实现延迟灵活但显著增加参数量,在存储和计算资源受限的边缘设备上可能不适用;**早期退出**机制的性能‐效率 **Pareto** 前沿未量化,各深度出口在极端低延迟下的退化程度缺乏详细消融,实际部署的性价比不够透明。
  • **训练流程复杂度较高**:**两阶段训练**从共享解码器切换到多解码器,需精心设计阶段切换策略与学习率调度,训练成本和超参敏感性高于端到端的多条件训练方案;论文未与直接训练多个独立模型的总成本进行系统性对比,使得“单模型多延迟”的工程收益不够明确。
论文Szu-Wei Fu2026-06-24原文

相关内容