论文

SwanVoice: 富有表现力的长形式零样本语音合成,适用于独白和对话

SwanVoice: 富有表现力的长形式零样本语音合成,适用于独白和对话

零样本文本转语音(TTS)在单说话人合成方面有了显著改进,但富有表现力的长形式多说话人对话仍然困难。一种常见的解决方法是使用独白TTS模型合成每一轮对话,然后将输出拼接起来。这增加了推理成本,并且经常破坏跨轮的声学一致性、对话连贯性和情感连续性。最近的对话TTS系统已开始解决这一问题,但它们仍难以同时保持富有表现力的连贯性、可控的说话人切换和独白质量。 我们提出了 SwanData-Speech 和 SwanVoice。SwanData-Speech 从野外音频构建独白和对话语料库,使用 Swan Forced Aligner 进行停顿感知的词级对齐,以及 RobustMegaTTS3 处理发音困难的情况。基于这些数据,SwanVoice 是一个零样本 TTS 模型,支持1-4个说话人,结合了25 Hz VAE、带有停顿感知符号和拼音替换的原始文本条件,以及带有说话人切换条件的流匹配 DiT。训练从独白语音开始,经过混合和真实对话数据,然后使用 DiffusionNFT 进行后训练,并加入音素级和说话人相似度奖励。 在 SwanBench-Speech 上,SwanVoice 在独白和对话设置中均获得了比所有评估的开源基线更高的丰富性和层次性分数,而内容准确性仍然是主要限制。音频演示见 https://swanaigc.github.io//swanvoice。

论文精读

TL;DR SwanVoice 是一个零样本长文本多说话人语音合成模型,通过 VAE、流匹配 DiT 和扩散后训练,首次在独白与对话中同时实现高表现力及声学一致性,显著优于现有开源方案。

问题

问题背景

零样本文本到语音(zero-shot TTS)在单人独白合成上已取得显著进展,但表达力丰富的长文本多说话人对话合成仍是一个开放难题。业界对于能够同时处理不同声线、情感起伏与自然话轮切换的语音合成需求日益迫切。

现有方法局限

当前普遍采用的方案是先利用独白 TTS 模型逐句合成每个说话人的语音,再机械拼接成一个对话音频。这种做法存在明显缺陷:

  • 每句话独立推理,推理开销线性增长,且缺少跨话轮的上下文约束,导致声学特征(音色、风格)不一致
  • 对话的情感连续性语义连贯性被破坏,听起来像是多个不相关的语音片段;
  • 近期虽出现专门的对话 TTS 系统,但它们往往难以同时满足表达一致性可控说话人切换以及保持独白场景的合成质量,三者存在冲突。

为什么这个问题难/重要

多说话人对话合成的核心挑战在于:模型必须同时建模说话人身份副语言表达(情感、语气)话轮边界上下文韵律衔接,而这些维度高度耦合。对长文本而言,还需要维持全局对话风格的稳定,而现有流匹配或扩散模型在捕捉长程依赖上仍有不足。此外,可泛化的零样本能力要求模型在未见过的说话人上也能精确控制其声学特征与表达,这增加了数据构造与模型设计的复杂度。解决该问题将直接推动虚拟助理、有声书、影视配音、多人播客自动生成等应用从“能用”走向“好用”,是对话式交互体验升级的关键一环。

行业类比

这好比从单张图片生成(单人独白)升级到视频序列生成(多人对话)——不仅要确保每一帧(每句语音)自身质量,还要保证帧间(话轮间)的过渡自然、角色一致性以及叙事节奏,是一个更高维度的序列生成与一致性控制问题。

核心洞察

  • 通过课程学习与扩散后训练实现对话合成中的情感连续与说话人切换可控:不同于多数系统将独白模型直接拼接,SwanVoice 从独白数据预训练,逐步引入混合对话与真实对话,再以 DiffusionNFT 进行音素级和说话人相似度奖励的后训练。这一策略同时提升了情感表达的连贯性、说话人切换的可控性以及独白质量,突破了现有对话 TTS 在保持多维度一致性上的瓶颈。
  • 基于停顿感知对齐与原始文本条件化的鲁棒文本前端:SwanVoice 利用自研 Swan Forced Aligner 实现停顿感知的词级对齐,并引入停顿感知符号与拼音替换来处理发音不确定场景,直接在原始文本上条件化生成语音。相比传统强制对齐或固定音素转换,该设计更好地保留了自然对话中的韵律变化和口语化特征,为零样本多说话人合成提供了更灵活的文本-声学桥梁。

方法

输入与数据流

SwanVoice 接收原始文本参考语音,文本经 Swan Forced Aligner 进行停顿感知(pause-aware)的词级对齐,并针对发音困难词引入拼音替换(pinyin substitution),最终形成带停顿符号的文本条件。同时,多说话人场景下显式注入说话人转向标记(speaker-turn conditioning)。

核心模型架构

系统由三个关键模块串联:

  • VAE(25 Hz):将语音压缩为低帧率(25 Hz)的连续潜在表示,保留韵律与音色信息,同时降低建模维度。
  • Text Tokenizer:将增强后的文本序列转换为离散或连续 token,作为声学生成的语义约束。
  • Flow-based DiT:基于流匹配(flow matching)的扩散 Transformer,以 VAE 潜在变量为生成目标,条件为文本 token 与说话人转向标记,通过常微分方程(ODE)采样还原高保真语音。

训练策略

采用课程学习:先在海量独白数据上预训练基础合成能力,再逐步引入混合会话与真实对话数据,使模型适应话轮切换与情感连贯性。最后通过 DiffusionNFT 后训练,利用音素级(phone-level)和说话人相似度(speaker-similarity)奖励优化策略梯度,进一步提升表达一致性与零样本声纹复刻精度。

与同类方法的差异

SwanVoice 通过原生融合独白与对话训练、流匹配扩散解码器以及奖励驱动的微调,在统一框架下同时保持长对话的情感连贯性与可控的多说话人切换,避免了传统分句拼接带来的声学割裂。

实验

实验设计

SwanVoice 在自建的 SwanBench-Speech 基准上评估,覆盖独白对话两种长文本场景。训练采用课程学习:先在海量独白语音上预训练,再逐步引入混合数据与真实对话数据,最后通过 DiffusionNFT 进行带奖励模型的后训练,奖励信号来自音素级准确性与说话人相似度。评估指标包含声学自然度内容准确性以及专门针对长文本的表达丰富度(richness)层次结构(hierarchy)。对比基线包括多个开源零样本 TTS 系统。

关键发现

SwanVoice 在丰富度与层次结构指标上全面超越所有参评的开源基线,无论是独白还是多说话人对话设定。这主要归功于说话人轮次条件停顿感知符号拼音替换共同带来的跨轮连贯性提升,避免了传统拼接方案中常见的声学断裂和情感不连贯。然而,**内容准确性(content accuracy)**仍是主要瓶颈,在部分发音复杂或长文本场景下可能出现错误,表明原始文本到语音的精细对齐仍有优化空间。

基线对比解读

逐轮生成再拼接的独白 TTS 方案相比,SwanVoice 直接建模整段对话,从根本上解决了跨轮声学一致性问题。相较于其他对话 TTS 系统,它在可控说话人切换单说话人音质保持上取得了更好平衡,但内容准确度不及部分依赖更强音素约束的基线。这反映出当前零样本方法在处理生僻发音和不规范文本时的固有挑战。DiffusionNFT 后训练显著强化了韵律风格的一致性,但未直接惩罚内容错误,未来可考虑引入多目标奖励或将内容准确性作为约束目标。

行业影响

落地场景

SwanVoice 能直接用于需要长对白生成的产品:

  • 虚拟人/数字人对话:直播带货、虚拟客服、虚拟主播等多角色实时或离线对话场景,可一次生成连贯的多轮对话语音,取代逐句拼接的旧方案。
  • 有声内容创作:有声书、广播剧、播客中多角色对话合成,能保持角色音色一致性和情感延续,减少后期人工对齐。
  • 互动叙事与游戏:根据对话系统(如 NPC 对话)生成带情感的语音,提升沉浸感。

商业价值

  • 降本:传统多角色 TTS 需逐个角色生成后拼接,人工修正耗时长;SwanVoice 一次推理输出完整对话,减少后处理环节,降低制作成本。
  • 体验提升:长对白场景下,声学一致性、情感连贯性显著优于拼接方案,能提升用户粘性(如虚拟人直播的观看时长)和内容消费体验。
  • 量产加速:从零样本生成多说话人对白,无需为每个角色单独训练声学模型,大幅缩短上线周期。

与现有工作流的接口

SwanVoice 的输出为多说话人标注的语音波形,便于集成到现有 TTS 管线:

  • 输入侧:接受带说话人标记的纯文本(可增加 [SPK] 等 token),可与现有对话管理模块(如 LLM 生成的对话脚本)直连。
  • 对齐工具:项目提供的 Swan Forced Aligner 可替换现有 MFA 等,在带噪声的野生音频上提供更准确的词级对齐,尤其对含停顿的长语音有利。
  • 后训练:使用 RL 风格的 DiffusionNFT 微调方案可复用奖励模型,将新数据不断注入以优化声学自然度,适合持续迭代的产线。

具体落地用例

  1. 电商直播虚拟人:一场直播中需主播、助播、观众等多角色实时互动,传统方案只能逐句合成,容易出现声线漂移和情感断裂。SwanVoice 可直接按对话脚本生成带情绪变化的多轮语音,降低运维成本并提高互动真实感。
  2. 在线教育 AI 讲师:在模拟课堂中,AI 讲师与学生需进行问答互动,使用 SwanVoice 可合成连贯对话,且利用零样本能力快速切换不同讲师音色(如专家访谈形式),提升课程吸引力。

局限

  • **内容准确性仍是主要瓶颈**:论文在摘要中明确指出 content accuracy 为主要限制,在表达力提升的同时,合成语音的语义准确度、罕见词或专有名词的发音正确率尚未达到实用水平,推测是由于 raw-text 条件建模对 ASR 转录质量的依赖,以及 pinyin 替换在未登录词场景下覆盖不全导致。实际部署时可能需要额外的校验或后编辑步骤。
  • **说话人数量与泛化性受限**:模型设计仅支持 1–4 个说话人的零样本合成,对于更复杂的多人对话(如会议、群聊)不具备直接扩展能力。同时,训练数据虽来自 in‑the‑wild 音频,但数据过滤和增强流程可能偏向常见口音与录音条件,对极端声学环境或低声量、重口音说话人的泛化能力缺乏实验支撑。
  • **推理效率与多阶段依赖**:系统包含 VAE、流匹配 DiT 以及 DiffusionNFT 后训练,多阶段级联会增加推理延迟与计算开销,相比端到端模型在低资源场景下不够友好。此外,课程学习策略和强制对齐器的质量对最终效果影响很大,整个 pipeline 的调优和部署复杂度较高,可能限制其在快速原型开发中的应用。
论文Ruiqi Li2026-05-29原文

相关内容