VibeVoice-ASR-Streaming 技术报告
传统说话人属性语音识别系统 将语音识别与说话人分离视为两个独立任务。近期,VibeVoice-ASR 等端到端模型通过单一模型统一了这两项任务,但现有统一模型仍主要支持离线识别,难以满足实时语音助手和智能体对低延迟的要求。 为应对此问题,我们提出 VibeVoice-ASR-Streaming,这是首批基于 LLM 的流式端到端说话人属性语音识别方案之一。该方法交替输入固定大小的音频块、小量 lookahead 音频以及历史文本,从而在语音到达时即可产出“谁在何时说了什么”,无需独立的分割阶段。 在识别准确率方面,7B 模型 在五个评测集上实现了平均 WER/CER 最低;在说话人属性准确率方面,它在 13 个评测设置中的 12 项中达到最佳或并列最佳。我们同时开源了 1.5B 与 7B 模型权重 及推理代码。
论文精读
TL;DR VibeVoice-ASR-Streaming 是首个 LLM 端到端流式说话人标注 ASR,交错音频块与少量前瞻音频,实时输出“谁说了什么”,省去独立 diarization,7B 模型多项评测达最佳 WER/CER 与说话人归属精度。
问题
问题背景
多说话人语音识别领域正从级联系统向端到端统一模型演进,同时实时流式处理需求日益凸显,如语音助手、会议转写和 AI 代理等场景要求低延迟输出“谁说了什么”。
现有方法局限
传统分离式系统先执行 ASR 再进行说话人分离,存在级联误差和单向信息损失,且无法在说话人切换时实时标注,必须等到整段音频结束。统一模型如 VibeVoice-ASR 虽然将 ASR 与说话人归属集成到一个模型,但主要面向离线识别,依赖完整音频上下文,导致输出延迟高,无法直接用于流式场景。此外,流式处理需要有限的历史上下文和增量解码策略,现有统一模型缺乏相应的训练和推理设计。
为什么这个问题难/重要
技术挑战在于:流式要求极低的首字延迟,模型必须在固定大小的音频块到达时即时完成转录和说话人标签预测;说话人归属依赖跨时间段的声纹一致性建模,而流式限制了可用的未来信息,仅能使用少量 lookahead audio;LLM 处理连续音频的推理计算成本高,需要优化 Real-Time Factor 以匹配硬件能力。业界对实时多说话人 ASR 的关注度持续上升,因为这是构建自然交互式语音代理和实时协作工具的核心能力。
行业类比
这类似于实时字幕生成中同步标注说话人身份的挑战,需在字幕延迟和标注准确性之间取得平衡。
核心洞察
- **流式说话人归属 ASR 的关键是交错式输入设计与小量前瞻音频的结合**。与常见的分离式 ASR + 说话人日志或者非流式统一模型不同,该工作将固定大小的音频块、少量未来帧和之前文本序列交错输入,使模型在每块到来时即可输出带说话人标签的文本,无需等待整段语音结束。这种设计打破了全局 diarization 的依赖,将延迟压缩到 chunk 级别,同时保留了跨块的说话人一致性。工程上需要仔细权衡 lookahead 深度与实时性:更长的前瞻能提升边界处的识别准确度,但会增加输出延迟。相比独立系统,该设计减少了流水线误差传播。
- **三阶段训练路径能将非流式模型的强大表征迁移到流式场景,降低性能损失**。作者先进行非流式训练,然后流式预训练,最后流式微调。这类似于课程学习,逐步引入流式约束(如固定块大小和有限上下文),使模型从全局注意力平稳过渡到局部注意力,避免直接训练流式模型导致的不稳定或性能大幅下降。相比从零训练流式模型,这种路线可复用已有的非流式语料和模型权重,节省大量算力,同时保持转录和说话人归属的高准确率。工程上,对于希望将离线模型改造成在线服务的团队,这是一种可行的路线图。
方法
输入与流式建模
模型接收固定尺寸音频块(如每块 1 秒级),并额外引入少量 lookahead 音频(未来几十毫秒到上百毫秒)。这些音频块与先前已生成的文本 token 交错排列,构成自回归输入序列。流式过程中,每个 step 只处理当前块 + lookahead 块,历史文本作为上下文参与解码。
关键模块
- 音频编码器:将当前音频块与 lookahead 块分别提取为连续特征,供 LLM 主干消费。
- LLM 主干:1.5B / 7B 参数的自回归语言模型,统一建模语音识别与说话人归因。
- 特殊输出 token:文本序列中插入说话人标记(如
<spk:0>、<spk:1>),使每个词附带说话人 ID,避免额外 diarization 模块。
训练路线
- Stage 1:非流式训练——用完整音频训练端到端说话人归因 ASR,建立基础能力。
- Stage 2:流式预训练——引入分块 + lookahead 机制,模拟流式输入分布,让模型适应不完整上下文。
- Stage 3:流式微调——针对低延迟场景优化,平衡准确率与响应速度。
输出与工程取舍
模型逐块输出带说话人标签的文本,达到“谁说谁话”的实时归因。lookahead 深度直接影响延迟与准确率:更深的 lookahead 提升对语音边界的判断,但增加首字延迟;固定块大小则决定计算粒度与实时因子。
与同类统一模型(如离线版 VibeVoice-ASR)的差异在于:本工作通过分块交错输入 + lookahead 音频,在 LLM 架构内实现真正的流式说话人归因,而非先离线转写再后处理。
实验
实验设计
在五个评估集上对 VibeVoice-ASR-Streaming 的 1.5B 和 7B 版本进行转录与说话人归因评估。评估指标包括 WER/CER 和说话人归因准确率,对照基线包括传统分离式 ASR + 说话人分割系统和现有端到端统一模型。同时分析 chunk size、lookahead depth、模型规模等对延迟与精度的影响。
关键发现
7B 模型在五个评估集上取得最低平均 WER/CER,说话人归因在 13 个评估设置中 12 个最佳或并列最佳。模型以固定 audio chunk 加少量 lookahead 的流式输入,无需独立分割阶段即可输出“谁在何时说了什么”,显著降低端到端延迟,同时保持了竞争性的识别精度。
与基线对比
相比分离式系统,统一模型消除了 ASR 与说话人分割之间的级联错误;相比非流式统一模型,本工作首次在 LLM-based 端到端框架下实现流式输出,且性能接近甚至超越离线模型。1.5B 版本为资源受限场景提供了可选的轻量方案,7B 版本则面向高精度需求。
行业影响
落地场景
实时会议与客服分析:模型可嵌入会议记录工具、呼叫中心质检等低延迟场景,流式输出 speaker: text,无需离线批量处理。具体用例:
- 企业会议转录:在 Zoom / Teams 等会议插件中实时标注发言人,供会后摘要、搜索与知识库构建。
- 金融合规电话:实时区分坐席与客户语音,对敏感词触发告警,降低合规风险。
商业价值
- 降本:取代传统 ASR + 说话人日志级联系统,减少推理 pipeline 与运维开销;7B 模型最优 WER/CER 可降低人工校对成本。
- 体验提升:低延迟“谁说了什么”增强实时交互,提升付费会议、客服产品的用户粘性与转化率。
- 增收:模型权重开源(1.5B / 7B),可部署为私有 API 服务,按并发或小时计费,面向企业服务市场。
与现有工作流接口
- 输入固定大小音频 chunk + 少量 lookahead,输出带 speaker 标签的文本,可直接替换现有 ASR 模块。
- 集成方式:通过 WebSocket / gRPC 接收流式音频,后端接 LLM 做摘要或意图分析;推理代码开源,便于容器化部署到 GPU 集群。
- 支持微调:领域数据可继续训练,适配垂直场景(如医疗会诊、教育录播)的口音与术语。
局限
- **流式处理引入固有延迟**:模型需要固定大小的 audio chunk 和少量 lookahead audio,lookahead 深度直接影响延迟与 speaker attribution 精度的权衡。论文虽然展示了不同 lookahead 深度的实验结果,但在极低延迟场景(如 <100ms)下,精度可能明显下降。固定 chunk 大小对长静音段或突发语音的适应性也未充分讨论,可能造成计算浪费或上下文断裂。
- **模型规模与部署成本较高**:发布权重为 1.5B 和 7B,其中 7B 模型在通用 GPU 上可以实时推理,但在 CPU 或边缘设备上实时因子(RTF)可能无法满足要求。这限制了在端侧、车载或物联网设备等资源受限场景的部署,与当前语音助手普遍追求轻量化端侧模型的趋势存在差距。
- **评估场景覆盖有限**:实验主要在标准英文数据集上进行,未展示多语言、强噪声、远场麦克风阵列或多人高度重叠语音下的表现。与商业系统的对比只有 Azure CT 和 Google STT 两个基线,缺乏更广泛的学术界 SOTA 系统(如 NeMo、ESPnet 等)的横向比较,泛化性存疑。