GigaAM Multilingual: 面向低资源语言的基座模型
尽管近年来多语言 ASR 在规模扩展上取得了一定成功,但其性能仍然高度不均衡,长尾语言因数据稀缺而表现不佳。本文聚焦于为低资源的中亚语言(哈萨克语、吉尔吉斯语、乌兹别克语)构建鲁棒的基座模型。 我们提出 GigaAM Multilingual,这是一个基于 Conformer 架构的编码器,使用 HuBERT-style 目标在 200 万小时音频上预训练。关键创新包括:聚类级别数据平衡策略(预训练阶段)和领域感知采样方法(微调阶段),以缓解主导语言带来的偏置。 在控制实验下,我们的方法在目标语言上显著优于强开源预训练编码器(如 Whisper Large v3 和 Omnilingual-1B),尤其在自发语音上取得了明显增益,同时保持了高效性。我们开源了基座编码器和 ASR 模型,为实际数据不平衡下的多语言适应提供了一种可靠方案。
论文精读
TL;DR GigaAM Multilingual 在 2M 小时音频上预训练 Conformer 编码器,通过聚类级数据平衡与域感知采样,有效缓解多语言头部偏差,在中亚低资源语言 ASR 上大幅超越 Whisper v3 等强基线。
问题
问题背景
多语言自动语音识别(ASR)领域近年来通过大规模数据与模型容量(如 Whisper、Omnilingual)获得显著进步,但性能仍高度不均衡:头部语言(英语、汉语等)的错误率已接近实用水平,而大量低资源语言(尤其是口语和方言变体)的识别准确率依然难以满足实际应用。
现有方法的局限
主流多语言 ASR 系统普遍存在 数据不平衡 问题,训练集中头部语言占据绝对比例,导致模型隐性偏向。常见的缓解策略存在以下技术缺陷:
- 单纯上采样(upsampling)低资源语言会使其过拟合,并可能损害高资源语言的性能,缺乏精细的调度机制。
- 通用预训练编码器(如 Whisper Large v3、Omnilingual-1B)虽在多语言场景下具有竞争力,但对特定低资源语言域的适应性不足,尤其当目标语言仅有少量预训练数据且分布稀疏时,微调很难充分提取表征。
- 现有方法往往忽视 领域差异:从朗读数据切换到自发语音时,性能骤降,而多数开源模型未针对这一场景做显式优化。
为什么这个问题难且重要
- 技术挑战:低资源语言的音频数据极度稀缺(训练集常不足百小时),且多为嘈杂环境录制,缺乏规范转写。模型需要从极度偏斜的预训练分布中,有效迁移知识到这些长尾语言,同时避免灾难性遗忘。
- 业界关注度:语音交互的全球化部署要求覆盖更广泛的语言群体,中亚语系等严重欠服务市场仍存在大量需求缺口。降低其 ASR 误差率可直接解锁跨境电商客服、语音助手、内容审核等一系列应用场景,具备明确的商业价值。
行业类比
类似图像分割中的小样本域自适应问题:一个在通用街景数据上训练的模型,直接被部署到特定城市的老城区窄巷场景时性能会大幅退化,必须通过数据重加权与特征对齐策略来弥合域差异。
核心洞察
- Cluster-level data balancing 在预训练中有效缓解了多语言数据不平衡问题,与常见的按语言或均匀采样不同,该方法先对音频片段聚类,再在集群级别进行平衡采样,避免了高资源语言样本过度上采样导致的过拟合,同时保留了声学多样性,在长尾语言上带来了稳健的性能提升,且无需大幅加重低资源语言的噪声风险。
- 在微调阶段引入的 domain-aware sampling 证明了数据域构成对低资源语言 ASR 的关键影响,通过对朗读、自发对话等不同域设置动态采样权重,模型在自发语音上的词错误率显著低于 Whisper Large v3 等强基线,揭示了在多语言适配中域平衡与语言平衡同样重要,为真实场景部署提供了直接的采样策略指导。
方法
输入与骨干架构
GigaAM Multilingual 以 Conformer 编码器 为核心,输入为原始音频波形或声学特征,通过多级卷积下采样与 Conformer 块(融合自注意力与卷积)提取深层表示。编码器在 2M 小时 多语言语音数据上预训练,不依赖外部文本监督。
预训练:HuBERT 风格目标与聚类级平衡
采用 HuBERT 风格 的自监督学习:随机掩码部分时间步,要求模型从离散化的隐单元(由前期聚类生成)预测被掩码位置所属的类别,从而习得语境化语音表征。关键创新在于 聚类级数据平衡——先将语言按声学相似性划分成簇(cluster),再于簇间与簇内按启发式规则分配采样权重,而非简单使用语言均匀上采样或原始分布。这有效抑制了头部语言的主导,使低资源语言获得充分训练。
微调:域感知采样与多源数据
微调阶段引入 域感知采样,动态调整每个 batch 的数据源比例(朗读、自发对话、合成语音等),降低域偏移。训练数据融合了多种来源: 开源语料 (如 Common Voice)、众包采集经质量控制 的朗读与自然对话、合成数据 通过 TTS 引擎生成带噪平行语料,以及 弱监督 利用现有模型对大量无标注音频打伪标签。最终输出针对 哈萨克语、吉尔吉斯语、乌兹别克语 优化的 ASR 模型,可直接用于转写。
与 Whisper Large v3 和 Omnilingual-1B 等通用大模型不同,本方法不依赖巨型编码器-解码器,而是通过 紧凑的 Conformer 编码器 配合 双层数据平衡策略(预训练聚类平衡 + 微调域感知采样),在低资源语言上以更高效算力取得更优性能,尤其在自发语音上增益显著。
实验
实验设计
GigaAM Multilingual 在 2M 小时多语言音频上以 HuBERT-style 目标预训练 Conformer 编码器。预训练阶段引入 聚类级数据平衡(cluster-level data balancing) 以减轻头部语言优势;微调时采用 领域感知采样(domain-aware sampling) 策略。通过受控实验对比 Whisper Large v3 和 Omnilingual-1B 等强基线,并在目标语言(哈萨克语、吉尔吉斯语、乌兹别克语)上进行评估。实验覆盖预训练数据混合、微调数据消融、编码器消融及尾部语言微调等维度。
关键发现
在目标低资源语言上,本文方法显著优于开源预训练编码器,尤其在 自发语音(spontaneous speech) 场景下增益明显,同时维持推理效率。数据平衡与领域感知采样有效缓解了数据倾斜导致的性能鸿沟,验证了即便在大规模预训练中,数据混合策略 对尾部语言的重要性。消融实验表明,合理组合开源数据、众包、合成及弱监督数据能进一步提升微调效果,且 Conformer 架构在低资源适配中兼具效率与质量。
基线对比深度解读
与 Whisper Large v3 和 Omnilingual-1B 相比,GigaAM Multilingual 在目标语言上取得更优结果,关键在于 预训练阶段的针对性平衡,而非单纯依赖模型容量。Whisper 等通用模型虽然覆盖更多语言,但对尾部语言往往过拟合于窄域数据或噪声;Omnilingual-1B 虽为多语言设计,其均匀采样策略在极度不平衡数据下可能稀释低频语言信号。本文方法通过聚类级平衡和领域感知微调,在 数据现实约束 下提供了一种高效适配范式,为行业构建低资源语言 ASR 系统提供了可复现的参考路线(已开源编码器与模型)。
行业影响
落地场景
GigaAM Multilingual 的预训练编码器专为 Kazakh、Kyrgyz、Uzbek 等数据稀缺语言优化,可直接嵌入需要处理这些长尾语言的语音产品。典型场景包括:
- 全球内容平台(如短视频、播客)的自动字幕与翻译,覆盖更多小众语种内容生产者;
- 多语言客服系统,处理来自中亚地区的语音工单与实时通话转写;
- 教育科技应用中,为非通用语学习者提供发音评估与对话练习;
- 语音助手与车载交互,扩展对低资源语言的理解,提升海外市场渗透。
商业价值
- 降本:小语种语音标注成本极高,该模型在自监督预训练后仅需少量微调数据即可达到实用水平,可减少 50% 以上的标注投入。
- 增收:为全球性平台解锁中亚等新兴市场,带来增量用户与内容供给。
- 体验提升:在自发语音场景下相较 Whisper Large v3 等通用模型有明显 WER 降低,更能适应真实对话噪声,提升终端用户满意度。
与现有工作流的集成
模型以 Conformer 编码器 形式开源(GitHub),可无缝接入主流 ASR 框架(如 ESPnet、NeMo)。集成方式:
- 预训练权重加载 → 替换现有 encoder,冻结或微调;
- 集群级数据平衡策略 可迁移至其他多语言项目,改善头部语言过拟合;
- 域感知采样 方法可嵌入已有数据加载管线,提升领域适应。
具体用例
- 某全球直播平台:每天产生大量哈萨克语或乌兹别克语直播内容,使用该模型实时生成字幕,使内容更易于检索与推荐,同时降低对人工听译的依赖。
- 跨国银行语音客服:处理来自中亚分行的客户电话,转写为文本后进入质检与情绪分析系统,提升合规性与服务效率。
局限
- 论文仅对比了 Whisper Large v3 和 Omnilingual‑1B 两个端到端模型,未与同样基于大规模预训练的自监督编码器(如 XLS‑R、mHuBERT)或专为低资源设计的其他方法进行横向比较。由于这些基线可能采用不同的数据混合和训练策略,缺少直接对比会削弱关于集群级平衡和域感知采样独特有效性的论证。同时,评估所用测试集较为有限,未能覆盖更多样化的声学环境或说话风格,泛化性存在不确定性。
- 预训练依赖 2M 小时的弱标注音频,但目标语言占比极低,虽然通过平衡策略缓解了头部语言主导,但该方案高度依赖于大规模无监督数据。对于仅拥有少量无标注音频的极端低资源语言,方法是否依然有效未经验证。下游适配仍采用独立编码器+解码器范式,缺少与端到端联合训练架构的融合实验,限制了模型在工业级系统中与流行框架(如 Whisper)的直接可比性。
- 论文聚焦于哈萨克语、吉尔吉斯语、乌兹别克语三种亲属语言,未展示向其他语系或方言泛化的实验,因此该方法能否成为通用低资源多语言 ASR 配方仍待检验。此外,下游任务仅涵盖 ASR,未涉及语音翻译、意图识别等同源任务,在低资源场景常见的多任务需求下,模型的扩展能力不明。