从合成语音构建与评估固定音色泰语 TTS
在低资源场景下,部署 TTS 通常需要在两种方案间权衡:推理成本高昂的大型 voice-cloning 模型,或需要特定说话人语料的紧凑型 fixed-voice 系统。我们研究了第三条路径:将大型 voice-cloning 模型作为可编程数据源,用一段短语音参考(如 15 秒)生成合成语音,再据此训练一个紧凑的 fixed-voice 学生模型。这一设定使流程设计变得至关重要:教师的错误会成为训练目标,而过滤失败生成又会降低对困难文本的覆盖。 泰语还带来额外挑战,包括词边界歧义、词调、人名与外来词、数字口语化,以及泰英 code-switching。我们系统研究了文本准备、合成生成、质量过滤、rejection sampling 与前端选择如何影响学生模型,以及教师的局限在何处残留。评估指标包括 CER、Challenge-Set Keyword Accuracy、Prosody Pause Accuracy、说话人相似度与语速。 最终得到的 82M 参数模型 Wayu-Paxa-TTS-Edge 无需参考音频即可在设备端运行泰语 TTS:Challenge-Set Keyword Accuracy 达 68.2%(为 Gemini 3.1 的 85.5%),暂停精确率 91.4%,超过其 OmniVoice 教师(89.9%),达到 Gemini 3.1 的 94.8%。 在三套系统中,它还取得最低的暂停位置错误率与词内暂停率,泰语和英语 CER 分别为 3.7% 与 1.1%。我们开源了该模型与评估框架,以推动泰语 TTS 研究。
论文精读
TL;DR 用大模型克隆语音作数据源,蒸馏出仅由合成语音训练的 82M 参数泰语固定音色 TTS,无需参考音频即可端侧部署,在挑战集关键词准确率与停顿精度上超越教师模型。
问题
问题背景
低资源语言的 TTS 部署长期面临两难:大型 zero-shot 语音克隆模型 可灵活克隆任意参考音色,但推理开销大,难以在边缘设备实时运行;紧凑固定声音模型 推理高效,却需要高质量的单说话人语料,低资源语言往往难以获得足够的录音数据。
现有方法局限
- 语音克隆模型:需在线调用或高算力硬件,且对输入参考音频敏感,不适合离线、低延迟场景。
- 固定声音系统:依赖人工采集的 speaker-specific 语料,采集成本高、周期长,在泰语等低资源语言中尤其稀缺;同时只能合成预设音色,无法快速适应新说话人。
- 直接使用合成数据蒸馏:把大型教师模型生成的音频当作训练目标,存在两个陷阱:教师自身的发音或韵律错误会被学生忠实学习;过滤掉错误样本又可能丢失困难文本的覆盖,导致学生学习不到稀有词、数字、代码切换等关键场景。
为什么这个问题难/重要
泰语本身的语言特性加剧了挑战:无空格分词 导致词边界模糊,五种声调 和 人名/外来词 的发音规则复杂,数字读法 和 泰英代码切换 需要前端正确处理,否则合成结果会严重失真。传统 CER 指标无法反映声调错误、错误停顿等问题,需要构建专门的 Challenge-Set Keyword Accuracy 和 Prosody Pause Accuracy 来评估真实可用性。业界对设备端低资源语言 TTS 的需求持续上升,如何在极少参考音频(如 15 秒)下训练出高性能、低参数量模型,是工程落地的关键。
行业类比
这类似于用 LLM 生成合成数据 微调小模型做指令跟随,但如果数据生成策略和过滤机制设计不当,小模型反而会继承并放大教师模型的短板,最终在真实场景中暴露出盲区。
核心洞察
- 在合成语音蒸馏中,教师模型的错误会直接成为训练目标,而质量过滤与文本覆盖之间存在不可调和的权衡。这与传统数据清洗不同,因为低资源语言中困难文本(如数字、人名、代码切换)正是需要覆盖的,但教师在这些场景也最易出错,过滤掉错误样本会同时移除关键训练信号,迫使设计者在“学错”和“学不到”之间做选择。
- 对泰语等具有词边界模糊、声调和代码切换的语言,CER 会系统性低估发音错误,必须引入关键词级和韵律级评估。与英语等空格分词语言不同,泰语连续书写导致错字对齐可能掩盖真实发音错误;同时停顿错误(词内停顿)严重影响自然度但 CER 不敏感。论文中提出 Challenge-Set Keyword Accuracy 和 Prosody Pause Accuracy,并以 Gemini 3.1 和教师模型为参照,揭示了 CER 无法反映的差异。
- 在固定语音学生模型中,前端模块的音素化规则决定了文本到语音映射的质量,尤其影响外来词和代码切换的发音。论文发现将单语前端替换为双语前端后,无需重训即可提升泰英混合文本的表现,说明前端错误会直接传导给学生模型,且前端可作为独立组件迭代,降低整体系统更新成本。
方法
输入与整体流程
输入为 15 秒参考语音 与大规模泰语文本语料。流程分三步:文本准备 → 合成语音生成 → 质量过滤与拒绝采样,得到仅含合成语音的训练集;再用该训练集蒸馏一个紧凑的固定语音学生模型,最终实现在设备端无需参考音频的泰语 TTS。
关键模块:文本准备
- 处理泰语特有难点:模糊词边界、词汇声调、人名/外来词、数字 verbalization、泰英 code-switching。
- 通过单语/双语 phoneme frontend 对文本规范化,确保 teacher 输入正确。
关键模块:合成生成与质量控制
- 用大型 voice-cloning teacher 作为可编程数据源,对每条文本生成合成语音。
- 由于 teacher 错误会成为训练目标,需引入 质量过滤 与 拒绝采样:对发音正确性、韵律和时长正确性进行自动评估;不合格样本多次重采样,避免直接丢弃困难文本导致覆盖度下降。
- 该设计权衡:过滤失败生成会减少困难文本覆盖,而拒绝采样可部分恢复。
学生模型与训练
- 学生模型为
82M参数的紧凑固定语音模型,输入音素序列,输出目标说话人声学特征。 - 训练时可选用预训练参数初始化,并可在不重新训练的情况下通过替换前端提升性能(如双语前端改进泰英混读)。
该方法把零样本 voice-cloning teacher 当作“可编程数据源”,将短参考语音蒸馏为固定语音学生,避免大模型高成本推理,同时避免收集说话人专属语料。
差异点:与直接使用 voice-cloning 大模型或训练固定语音系统不同,本方法以合成语音为唯一训练数据,通过 拒绝采样 而非简单过滤来平衡 teacher 噪声与文本覆盖。
实验
实验设计
本文探索用 语音克隆教师模型 (如 OmniVoice) 合成大量语音,训练紧凑固定音色学生模型 Wayu-Paxa-TTS-Edge (82M 参数)。管线包括:
- 文本准备(泰语词边界、数字读法、泰英混码)
- 合成生成与质量过滤 / 拒绝采样
- 前端选择(单语 vs 双语音素前端) 评估维度除 CER 外,增加 Challenge-Set Keyword Accuracy、Prosody Pause Accuracy、说话人相似度与语速,并测试 15 秒参考音适配 Isan 方言。
关键发现
- 82M 模型可在设备端运行,无需参考音频。
- Challenge-Set Keyword Accuracy 达 68.2%,为 Gemini 3.1 的 85.5%。
- Pause Precision 达 91.4%,超越教师 OmniVoice (89.9%),达 Gemini 3.1 的 94.8%。
- 泰语 CER 3.7%,英语 CER 1.1%;停顿放置错误与词内停顿率为三系统中最低。
与基线对比的深度解读
相较于大型闭源 Gemini 3.1,轻量学生模型仍有差距,但在边缘端 TTS 中已接近可用;尤其 停顿精确率 超越教师,说明过滤与拒绝采样可剔除教师噪声,得到更干净的音素-时长映射。但教师错误仍会传播,过滤会降低困难文本覆盖,是蒸馏上限。工程启示:固定音色小模型的性能瓶颈常不在参数规模,而在合成数据管线设计与前端质量。
行业影响
落地场景
该工作展示了用大型 voice-cloning 模型作为可编程数据源,仅凭 15 秒参考音色合成训练语料,蒸馏出 82M 参数的固定语音 Thai TTS。可直接落地于:
- 电商 / 内容平台:东南亚电商自动生成商品描述语音、短视频配音,无需为每种音色采集大量录音。
- 教育 / 语言学习:App 离线提供标准泰语发音示例,降低云推理延迟与成本。
- 智能硬件:智能音箱、车载语音助手在无网络时保持高质量本地合成。
商业价值
- 降本:合成数据路径避免每位说话人单独采集语料,数据生产成本大幅下降;学生模型参数量小,推理可完全在端侧完成,削减 GPU 云服务开支。
- 体验提升:离线可用、低延迟,且
pause precision达 91.4%,优于 teacher,减少机械感;对品牌语音定制有吸引力。 - 可迁移性:方法面向低资源语言,可复制到其他东南亚语言或方言,扩大市场覆盖。
与现有产品 / 工作流集成
- 现有 zero-shot TTS 平台(如 Gemini、OmniVoice)可作为 teacher,直接输出合成语音并经
quality filtering与rejection sampling生成训练集。 - 学生模型可导出为 ONNX 或 TFLite,嵌入移动 App、IoT 固件;前端支持泰英 code-switching,适合多语言产品。
- 论文开源评估框架(CER、Challenge-Set Keyword Accuracy、Prosody Pause Accuracy)可接入 ML pipeline 的回归测试,保障后续迭代质量。
典型场景:某跨境电商平台希望在泰国市场提供泰语语音导购,但不愿承担云 TTS 的每次调用成本与网络依赖。该方案可让平台仅用一段 15 秒品牌音色参考,自动生成训练数据,部署固定语音模型到 App 内,实现离线、低成本的商品介绍与客服语音。另一场景是语言学习应用提供泰语听力材料,利用前端对数字、姓名、借贷词的正确化,提升发音准确率,增强学习效果。
局限
- **教师模型在困难文本上的残余错误**:论文在 teacher analysis 章节承认,即使通过重复采样和拒绝采样,教师 OmniVoice 对泰英代码切换、罕见人名/借词、复杂数字朗读等仍存在系统性错误,这些错误会作为训练目标传递给学生。过滤失败样本会进一步降低困难文本的覆盖,导致学生模型在这些场景下性能受限,挑战集关键词准确率仅为 Gemini 3.1 的 85.5%,仍有明显差距。
- **固定语音学生的固有约束与数据构建成本**:模型仅支持单一说话人,无法像零样本教师那样即时克隆新声音;而从短参考音频构建合成语料需要多次采样、质量过滤和拒绝采样,计算开销较大,且前端对泰语分词、数字规范化、泰英混合的依赖引入了额外错误源,可能限制低资源环境下的快速部署。
- **评估范围与泛化性有限**:论文聚焦泰语,开源的评估框架和挑战集对泰语特性(声调、分词、停顿)针对性较强,但未在其他低资源语言或方言(仅初步探索 Isan 方言)上验证管道可迁移性;且与大型通用模型相比,在说话人相似度和长文本韵律一致性上未做充分对比,通用性有待进一步检验。