Accent Analogy Guidance:在跨语言语音克隆中同等口音下实现更高的说话人相似度
在跨语言零样本 text-to-speech 中,参考音频的口音会泄漏到合成语音里。我们提出 Accent Analogy Guidance(AAG):一种免训练的采样项,它先估出一个「口音方向」——用模型自身对同一合成音色在两种语言下的预测结果相减,使音色相消、只留下口音——再从采样结果中减去该方向。 在真实配音数据上,我们用盲测 LLM 口音评委 进行评估,发现在 reference 与 text 之间重新加权 classifier-free guidance 及其各变体,都停留在同一条 identity-accent 权衡曲线上。因此我们用 ΔSIM 给方法打分:在同等口音 下,说话人相似度高出该曲线的幅度。 实验显示,在四个开源 TTS 模型上 AAG 都位于曲线之上: - OmniVoice:三个测试集上 ΔSIM 为 +0.11 到 +0.27(口音 3.51 至 4.28,1-5 分制;说话人相似度 0.29,而 reweighting 仅 0.02); - MaskGCT 与 CosyVoice 2 同样高于各自曲线; - F5-TTS 上比任何 reweighting 设置都更 native。 一个无需 LLM 的 language-ID 指标与 12 人听测小组的结论一致。此外,前提检验 与模型自身曲线的可达范围能事先判断 AAG 是否有效、大致能带来多少增益,并成功预测出唯一毫无增益的模型 X-Voice。
论文精读
TL;DR 跨语言零样本 TTS 任务中,参考语音口音会泄漏到目标语音;AAG 通过对比模型对同一声音两种语言的预测估计口音方向并减去,在多个开源模型上实现同等口音下更高说话人相似度。
问题
问题背景
跨语言零样本 TTS 是自动配音和多语言内容生成的关键技术。给定一段源语言参考音频,模型需克隆说话人音色并生成目标语言语音。当前领域关注的核心挑战是:参考音频的口音 会泄漏到目标语言中,导致合成语音听起来带有源语言口音,降低母语者听感。
现有方法局限
现有推理时方案以分类器自由引导 (CFG) 重加权 为主,包括对 reference 与 text 使用不同权重、跨步切换权重、残差分解等。这些方法均通过重新缩放同一参考证据来改变口音与音色,因此口音减弱时说话人相似度同步下降,二者沿一条固定的身份-口音 trade-off 曲线 滑动。训练时方案(如语言 ID 解耦、独立口音表示、CosyVoice 2 的跨语言模式)虽能改善解耦,但需要重新训练模型,无法直接应用于已部署的零样本 TTS 系统。此外,现有文献通常报告单一操作点,缺少不同权衡区间的系统扫描,导致身份损失被忽略。
为什么这个问题难/重要
口音与说话人身份在参考音频中高度耦合,尤其是在零样本、未见说话人的条件下,模型无法通过标注数据学习解耦。发音选择受参考语言影响,这属于表征层面的纠缠,仅靠推理时缩放系数难以突破。工业界对自动配音、多语言语音助手等场景有强烈需求:既要高说话人相似度保证用户认同,又要低口音保证内容自然度。二者不可兼得时,任何单点优化都可能带来隐性代价。因此,业界需要一种无需训练、能沿 trade-off 曲线向上偏移(即在同等口音下获得更高相似度)的推理时方法。
行业类比
这类似于可控图像生成 中通过对比同一生成器的条件预测来提取属性方向(如年龄、表情)并做潜变量编辑,本文则将该思想迁移到跨语言 TTS 的口音解耦上。
核心洞察
- AAG 的核心创新在于通过类比方式估计 accent 方向:让同一个合成语音分别在源语言和目标语言中生成,相减得到 accent 方向,然后在采样时减去该方向。这不同于所有现有 inference-time 方法(如 CFG reweighting),后者只是重新缩放 reference 和 text 的证据,导致 accent 和 speaker 相似度同步变化;AAG 保持 speaker 特征不变,只移除 accent 成分,从而在相同 accent 水平下显著提升 speaker similarity。
- 论文提出 trade-off curve 与 ΔSIM 的评估框架,取代常见的单一操作点报告。在 identity-accent trade-off curve 上,不同方法处于不同位置;ΔSIM 衡量同一 accent 水平下 speaker similarity 的超出量。该框架揭示了降低 accent 的真实成本,并通过 premise test 和曲线 reach 预判 AAG 能否为特定模型带来收益,对实际部署中的模型选择具有直接指导价值。
方法
输入与目标
在 cross-lingual zero-shot TTS 中,输入为源语言参考语音(reference speech)与目标语言文本。模型需要生成目标语言语音,同时保留参考说话人音色;但现有模型往往同时复制参考语音的口音,导致生成语音带外国口音。
关键模块:accent analogy guidance
- 代理声音构造:选取一个合成代理声音(proxy voice),该声音可被同一 TTS 模型分别以源语言和目标语言渲染,得到两个预测语音。
- 口音方向估计:计算这两个预测的差异向量。由于代理声音的身份固定不变,差异向量中身份成分相互抵消,剩余成分即为该语音的口音方向(accent direction),对应“模型认为该声音在这两种语言下的发音差异”。
- 采样引导:在目标语音的采样过程中,从当前模型条件预测中减去估计出的口音方向(乘以可调强度系数),从而在生成时抑制参考口音泄漏。该过程为训练无关(training-free),不修改模型参数。
输出
输出为目标语言语音,其口音更接近目标语言母语者,同时说话人相似度高于传统重加权 classifier-free guidance 方法在同等口音水平下的表现。
与同类方法差异
不同于重加权 classifier-free guidance 沿 identity–accent trade-off 曲线移动(口音与说话人身份同步变化),AAG 通过显式估计并减去口音方向,将口音与身份解耦,可在同等口音水平下获得更高的 speaker similarity(ΔSIM)。
行业影响
落地场景
AAG 直接赋能 自动配音、跨语言语音克隆 等场景。流媒体平台可为同一视频快速生成多语言音轨,同时保持原说话人音色但消除外语口音;游戏与虚拟助手可用单一参考语音输出多语言且口音自然;有声内容平台可低成本扩展多语言版本。无需重新训练模型,适合已部署零样本 TTS 的产品快速启用。
商业价值
- 降本:减少人工配音与后期修音成本,尤其海量长尾内容本地化。
- 增收:加速内容多语言上线,覆盖更广用户群体,提升用户留存与付费转化。
- 体验提升:消除口音提升听感自然度,同时保持说话人相似度,增强品牌声音一致性。
接口与集成
AAG 作为训练无关的采样引导项,可无缝插入现有 TTS 推理流程,无需重训。实现为在每次采样时减去从合成语音自身估计的 accent 方向,可与 CFG 重加权 等方法叠加或替代。已提供 GitHub 实现,兼容 OmniVoice、MaskGCT 等模型。
具体 use case:
- 全球流媒体配音:某平台为原创剧集生成多语言版本,使用 AAG 后角色声音与原声一致,但目标语言口音自然,用户跳出率下降。
- 跨境电商视频:商品介绍视频自动生成多语言配音,保持品牌代言人声音,无需为每种语言单独录制。
局限
- **方法有效性依赖模型特性**:AAG 在 X-Voice 上没有任何增益,论文仅通过预测试预测了这一点,但未深入分析失败原因。可能与该模型的内部表征、跨语言对齐机制或 CFG 实现方式有关。这说明 AAG 并非通用插件,实际应用前需要先判断模型是否具备可分离的口音方向。此外,AAG 需要构造代理语音对(同一合成声音在两种语言下渲染),增加了额外推理步骤,计算开销高于简单的 reweighting 方法,且代理语音的设计(如 prompt 选择)可能影响估计质量。
- **评估指标体系尚不完善**:依赖盲 LLM 口音评判器(1–5 分)和 12 人听力测试,主观性强且样本量较小。虽然使用真实配音数据作为参考,但这些数据本身可能带有源语言口音,难以完全代表目标口音。此外,ΔSIM 指标基于 identity–accent trade-off curve 的拟合,曲线本身由 reweighting 等方法构成,可能不是最优前沿,导致 ΔSIM 的绝对意义有限。LLM-free 的语言 ID 测量虽然客观,但只能判断口音存在与否,无法衡量口音强度。
- **实验覆盖范围有限**:仅在四个开源 TTS 模型(OmniVoice、MaskGCT、CosyVoice 2、F5-TTS)上验证,且未明确说明跨语言对的具体组合(如英语到哪些语言)。对于不同语系、不同口音差异程度的场景,AAG 的表现可能不同。此外,论文未与训练时补救方法(如 CosyVoice 2 的 cross-lingual mode 或 separate accent representation)进行直接对比,难以判断 AAG 相较于重新训练方案的相对价值。