Multilingual GSM-Symbolic:什么决定了跨语言的能力迁移?
我们对能力如何在语言间迁移及其决定因素知之甚少:现有评估依赖不可比、易饱和的数据集,且很少联合考察各因素。识别出预测迁移的关键因素,可避免穷举所有语言对,也让开发者能针对低资源语言的性能瓶颈下手。 为此我们提出 Multilingual GSM-Symbolic,一个可扩展的多语言数学数据集,覆盖 30,000 组条目对齐的问答对,横跨 15 种语言。它利用符号模板 防止过拟合并保证泛化,可从单个样本生成数百万个高质量变体。 基于该数据集,我们量化出能力最主要的决定因素:模型规模(β=1.77)、语言资源水平(β=0.77)、推理能力(β=0.67)与类型学距离(β=-0.25)。联合估计使这些因素可相互换算:32B 模型在 Marathi 上的表现相当于 10B 模型在 English 上的表现。模型规模与推理能缩小低资源与高资源语言间的差距(β=-0.27 与 β=-0.20),但对类型学上相距较远的语言收效甚微。 整体而言,我们的分析框架解释了 92% 的语言间差异,但仅解释 23% 的模型×语言差异,对未见语言的性能预测误差在 6.0pp 以内(r=.96)。仅加入目标语言的 10 个模板即可将误差降至 4.19pp,从而在几乎不需要下游数据集的情况下给出合理估计。
论文精读
TL;DR 构建可扩展的多语言数学基准,系统量化模型规模、语言资源、推理与类型距离对跨语言迁移的影响,发现规模与推理可缩小高低资源差距但类型距离难解,预测未见语言误差仅 6pp。
问题
问题背景
多语言大语言模型(LLM)的跨语言能力迁移已成为当前关注焦点,尤其是在数学推理等复杂任务上,模型在一种语言中习得的能力能否泛化到其他语言仍缺乏量化理解。
现有方法局限
- 数据集不可比:常用评估基准(如 MGSM)不同语言版本题目不同、难度不一致,导致跨语言性能无法直接比较;部分数据集存在饱和问题,高资源语言上模型性能接近天花板,掩盖真实差异。
- 决定因素未联合检验:已有工作往往单独考察模型规模、语言资源水平或类型距离等单一因素,未在同一框架下联合建模,难以判断各因素相对贡献及交互作用。
- 缺乏可迁移性预测:现有方法无法根据已知语言表现预测模型在新语言上的性能,导致开发者需对所有语言对进行穷举评估,成本高昂。
为什么这个问题难且重要
- 技术挑战:跨语言能力迁移受多重因素交织影响——模型参数规模、目标语言的资源丰富度、推理能力、语言类型学距离等,且这些因素可能存在非线性交互;同时,低资源语言评估数据稀缺,难以稳定估计。
- 业界关注度:若能量化预测迁移,开发者可直接定位低资源语言的性能瓶颈(如扩大模型规模或增强推理),避免为每种语言重复构建评估集;准确预测未见语言性能可大幅降低部署多语言 LLM 的评估成本。
行业类比
这类似于多语言客服机器人上线前,需要快速预估模型在未曾训练的低资源语言上的回复质量,以决定是否需要额外收集数据或调整模型架构,而非对每种语言都做一轮完整评估。
核心洞察
- 联合估计揭示模型规模是跨语言能力迁移的第一决定因素,并可将不同语言间的性能差距换算为等效模型规模。与以往单因素分析或饱和数据集不同,该研究在统一符号模板上同时估计模型大小、语言资源、推理和类型距离的系数,并给出可互相换算的表达式(如 32B 模型在 Marathi 约等于 10B 模型在 English),为开发者提供了直观的资源配置基准,避免在海量语言对上进行穷举测试。
- 基于符号模板的少样本预测框架能以目标语言 10 个模板达到 4.19pp 误差,实现低成本跨语言泛化评估。不同于传统全量数据集评估,该工作利用符号模板的可扩展性和 GLMM 建模,将模型-语言变异分解,验证仅需 10 个模板即可预测未见语言的性能,显著降低对下游数据集的需求,为多语言模型发布前的快速能力评估提供了工程化方法。
方法
数据集构建
Multilingual GSM-Symbolic 从 GSM8K 的数学应用题模板出发,将题目中的数值替换为符号变量,生成可复用的 符号模板。每个模板可通过随机赋值产生大量变体,避免模型记忆固定答案。随后,模板被翻译为 15 种语言(覆盖不同资源水平与类型学距离),得到 30,000 个条目匹配的问答对,保证跨语言可比性。
特征提取
对每个模型在每种语言上的表现,提取四类特征:
- 模型大小:参数量取对数,反映规模效应。
- 语言资源水平:基于预训练语料中该语言的占比,衡量低资源程度。
- 推理:是否使用 Chain-of-Thought 提示,区分直接答案与逐步推理。
- 类型学距离:语言与英语的谱系距离(如语系、句法特征差异)。
建模与评估
采用 广义线性混合模型(GLMM)联合估计各特征对数学推理准确率的影响,输出标准化回归系数(β)。模型同时量化特征间的交互作用,例如 模型大小 × 语言资源水平 的负交互系数(β = -0.27),表明增大模型可缩小高低资源语言间的性能差距;而 模型大小 × 类型学距离 的交互不显著,说明规模效应对类型学距离远的语言帮助有限。
预测能力
框架可解释 92% 的 语言间变异,但仅解释 23% 的 模型-语言变异,表明模型-语言的特定偏差仍占主导。在 留一语言预测 中,仅用模型大小、资源水平和类型学距离即可预测未见语言的性能,误差在 6.0pp 以内(r = .96);若额外加入目标语言上 10 个模板的实测性能,误差降至 4.19pp,可用于低成本性能预估。
与同类方法的差异
不同于以往单独考察某一因素或依赖饱和数据集的评估,本方法首次在统一框架下 联合估计 模型规模、资源水平、推理策略和类型学距离的贡献与交互,并利用符号模板保证跨语言可比较性,将迁移能力的决定因素量化到可互换的尺度(如 32B 模型在马拉地语约等于 10B 模型在英语)。
实验
实验设计
构建 Multilingual GSM-Symbolic 数据集,覆盖 15 种语言、30,000 条 item-matched 问答对。使用 symbolic templates 防止数据污染,可生成数百万变体。评估多个预训练模型,并采用 GLMM 联合估计模型大小、语言资源水平、推理能力、类型距离等特征对性能的影响。执行 leave-one-language-out 预测以检验泛化。
关键发现
模型大小(β=1.77)、语言资源水平(β=0.77)、推理(β=0.67)是主要正向决定因素;类型距离(β=-0.25)为负向。模型大小和推理能显著缩小低资源与高资源语言差距(β=-0.27 和 β=-0.20),但对类型距离远的语言效果有限。框架解释 92% 语言间变异,仅 23% 模型×语言变异;预测未见语言性能误差 6.0pp,用 10 个目标语言模板可降至 4.19pp。
与基线对比解读
现有评估依赖饱和、不可比数据集,无法揭示迁移机制。本工作通过联合估计,避免逐一评估所有语言对,并将决定因素互相换算(32B 模型在 Marathi 相当于 10B 模型在英语)。为开发者提供靶向:在低资源语言上优先扩大模型和推理能力;在类型距离远的语言上需探索其他方法。预测模型可在少量目标语言样本下估算性能,降低评估成本。
行业影响
落地场景
多语言数学推理能力直接影响教育科技、智能客服、内容审核等产品。例如全球在线教育平台的自动解题助手,需支持多语言数学题解答;跨境电商平台的智能客服需处理多语言询价、优惠计算等;金融科技中的多语言报表解读也可受益。该工作提供 Multilingual GSM-Symbolic 数据集和预测框架,可用于快速评估模型在未见语言上的数学推理表现。
商业价值
主要降低成本:模型开发团队可避免对全部语言对进行穷举评测,利用该框架仅需少量目标语言模板(10 个)即可估算性能,误差 <5pp。这显著降低多语言模型的评估与迭代成本。同时,揭示模型规模与推理训练是缩小高低资源语言差距的有效杠杆,指导资源投入优先级,提升低资源语言用户体验,带来潜在市场拓展收益。对于类型学距离较远的语言,单纯加大模型或推理训练收益有限,需其他策略,避免无效投入。
与现有工作流接口
该框架可作为多语言模型开发流水线中的 评估预筛层。在模型训练前,利用已有语言特征(语言资源水平、类型学距离等)预测目标语言性能,决定是否需要收集更多数据或调整训练策略。集成方式:在 CI/CD 中调用预测 API,输出语言级性能估计;将 10 个模板的快速评测作为回归测试的一部分。可结合现有模型评估工具(如 lm-evaluation-harness)作为插件,提供跨语言能力转移预测。
局限
- 本文的分析框架虽然解释了 92% 的语言间变异,但仅解释了 23% 的**模型×语言交互变异**,表明仍有大量影响跨语言迁移的因素未被捕捉。例如,模型训练数据的语言分布、指令微调策略、多语言对齐方式等未纳入特征集,可能导致预测误差。在未见语言上预测误差为 6.0pp,即使使用 10 个目标语言模板也仅降至 4.19pp,对于要求高精度的部署场景仍可能不够。
- 数据集基于 **GSM-Symbolic** 模板构造,虽能防止过拟合,但题目类型局限于小学数学符号推理,无法反映更复杂的数学能力(如代数、证明、多步抽象推理)。符号变体的难度变化被论文承认是“非系统的”,这削弱了使用单一难度指标进行跨语言比较的有效性。此外,15 种语言中低资源语言数量有限,**类型距离** 的估计可能受限于语言样本的分布。
- 评估集中在开源模型,未充分覆盖闭源商业模型(如 **GPT-4**、**Claude** 等),而后者在实际部署中占重要地位。模型的参数规模范围(如最大 32B)可能不足以揭示更大规模模型下的趋势,论文中 size effect 是否在更大模型上持续尚有疑问。与同类工作(如 **MGSM**、**XQuAD**)相比,本文的贡献更多在于分析框架而非数据集本身,数据集规模(30k 题)对于训练或微调可能偏小。