论文

LLMs Get Smarter from Targeted Synthetic Multilingual Data

LLMs Get Smarter from Targeted Synthetic Multilingual Data

语言特定能力(LSC) 是指语言模型根据提示语言的不同而表现更好或更差的现象。换言之,对同一语义查询,模型在不同语言下可能输出不同甚至错误的回答。先前研究将其归因于跨语言的语义表示内部错位。目前文献中主要有两种应对 LSC 的方法:(1) 将所有查询路由至英语,虽能提升性能但限制了语言表达性;(2) 在语言均衡数据上训练,虽能均衡跨语言性能但会降低整体性能。 本工作从数据视角出发,提出 HOTFIXR(Hardness Optimized Training data For Improving X-Lingual Reasoning)——一个数据生成框架,利用模型探测并学习学生模型的多语言弱点,进而生成针对性数据以缓解这些弱点。HOTFIXR 能生成多语言合成训练数据,从而提升多语言性能。我们在三个分布内任务、三个分布外任务及四种分布外语言上进行评估。平均而言,HOTFIXR:(1) 分布内性能提升 6.2%;(2) 降低微调导致的灾难性遗忘(分布外任务) 3.7%;(3) 分布外语言性能提升 7.1%。 总体而言,由于现实应用对多语言 LLM 的需求日益增长,本工作为提升 LLM 的多语言熟练度做出了贡献。代码将在论文接收后发布。

论文精读

TL;DR HOTFIXR 是一个数据生成框架,通过探测模型的多语言弱点并生成针对性合成训练数据,提升多语言推理性能,同时缓解微调带来的灾难性遗忘。

问题

问题背景

多语言 LLM 面临 语言特定能力(LSC) 问题:同一语义查询用不同语言提问,模型可能给出不同甚至错误的回答,根源是跨语言语义表征错位。

现有方法局限

目前主流方案有两种,但各有明显缺陷:

  • 英文路由:把所有 query 翻译或映射到英文再推理,能提升性能,但牺牲非英语语言的表达力,且依赖翻译质量,低资源语言损耗严重。
  • 语言平衡数据训练:在各语言上等量采样,追求语言间性能均衡,却会拉低整体性能——因为稀缺的多语言数据无法覆盖原有英文能力所需信号,导致模型在常见语言上反而退化。

两者都缺乏对模型多语言薄弱环节的精准定位,数据补强不够有针对性。

为什么这个问题难/重要

技术挑战在于:模型内部跨语言语义表征的对齐程度难以直接观测,需要一种可度量的“语言缺陷”信号来指导数据生成。同时,微调多语言数据容易引起 灾难性遗忘,损害模型在原有任务上的表现,因此要在提升多语言性能与保持整体能力之间取得平衡实属不易。业界对多语言 LLM 的需求持续上升,真实业务要求可靠的非英语对话与推理,这一矛盾在工程落地中尤为突出。

行业类比

类似多语种语音助手中的意图识别:同一句“打开空调”用不同语言或口音表达,系统都必须正确执行,而不是只对某一种输入格式可靠。

核心洞察

  • HOTFIXR 的核心在于将语言能力差距量化为可优化的信号,并据此生成针对性合成数据,而不是采用语言平衡或翻译等均匀策略。与现有语言平衡数据训练(以损失整体性能为代价)或英文路由(牺牲语言表达力)不同,HOTFIXR 通过 lingual deficit score 定位学生模型在特定语言与任务组合上的薄弱点,利用教师模型生成高难度样本,实现面向弱点的数据增强。这种数据高效的定向补强既提升多语言推理,又避免对英语能力的大幅损害,为多语言 LLM 的持续微调提供了新思路。
  • HOTFIXR 同时缓解了微调带来的灾难性遗忘,并在 OOD 任务和语言上取得一致增益,表明针对性数据生成可以兼顾泛化与稳定性。之前的多语言训练方法往往只关注跨语言对齐或平衡,导致模型在原始任务或英语上性能下降;HOTFIXR 在三个 ID 任务上平均提升 6.2%,同时在 OOD 任务上减少遗忘 3.7%,在 OOD 语言上提升 7.1%。这一结果表明,通过探测模型弱点来生成数据,能够把学习信号集中在最需要的分布外区域,对实际部署中持续扩展语言能力尤为重要。

方法

输入

给定一个预训练多语言 LLM(学生模型)、一组评估任务(如推理问答)以及目标语言集合。框架首先在多个语言上评测学生模型,得到每个语言-任务组合的性能得分。

关键模块:Lingual Deficit 测量与数据生成

HOTFIXR 的核心是量化 Lingual Deficit(语言缺陷分数):对每个语言 L 和任务 T,计算学生模型在语言 L 上的性能与最高性能语言(通常为英语)的性能差距,该分数反映语义表征跨语言错位的严重程度。

随后,框架利用教师模型(或学生模型自身)以 硬度优化 方式生成合成训练数据:优先针对高缺陷语言-任务组合,生成语义等价的平行样本或特定语言提示。生成过程中可能采用难度采样策略,确保数据包含学生模型易错的模式。

训练与输出

将生成的合成数据与学生模型原有训练数据混合,对新模型进行微调(或持续学习),并引入正则化以缓解灾难性遗忘。输出为微调后的多语言模型,在保持英语性能的同时,显著提升低资源语言推理能力。

与同类方法的差异

相较于将所有查询路由到英语(损失语言表达力)或语言平衡数据训练(平均化但降低整体性能),HOTFIXR 通过针对性硬度优化数据生成,仅补强模型短板,实现多语言性能与整体能力兼得。

实验

实验设计

HOTFIXR 采用数据为中心的策略:利用教师模型探测学生模型的多语言推理弱点,并生成针对性合成数据。评估覆盖 3 个 in-distribution (ID) 任务、3 个 out-of-distribution (OOD) 任务和 4 种 OOD 语言。对比基线包括 英文路由(所有查询先翻译成英文)和 语言平衡训练(非英语数据均匀采样)。

关键发现

  • 在 3 个 ID 任务上平均提升 6.2%,说明针对性合成数据能有效缓解语言特定能力(LSC)问题。
  • 微调引入的 OOD 任务灾难性遗忘减少 3.7%,表明生成数据兼顾了稳定性。
  • 在 4 种 OOD 语言上平均提升 7.1%,验证跨语言泛化能力。
  • 摘要指出该方法不会像语言平衡训练那样降低整体性能。

对比解读

与英文路由相比,HOTFIXR 保留非英语表达,避免限制语言表达力;与语言平衡数据相比,HOTFIXR 不追求语言平均,而是针对弱点补强,因此既提升多语言性能又不牺牲总体能力。该数据生成框架可推广至真实业务中需要可靠多语言对话的 LLM。

行业影响

落地场景

HOTFIXR 适合多语言客服、跨语言内容审核与多语言知识库产品。例如,电商平台的全球客服机器人可用它优化非英语语言的复杂推理(如退货政策、订单追踪逻辑),避免“先译成英语再回答”损害语言自然度;企业服务中的多语言工单系统能稳定处理本地化技术问题,不因语言切换产生错误答案。

商业价值

降本:减少为每种语言单独维护模型或人工翻译成本;增收:提升非英语用户体验,提高转化率与留存;体验:降低语言切换导致的错误回答,增强品牌信任。尤其对 OOD 语言 7.1% 的性能提升,可覆盖长尾市场,无需大规模人工标注。

与现有工作流接口

HOTFIXR 作为数据生成框架,可嵌入现有 LLM fine-tuning pipeline:先用学生模型在目标任务上探测各语言的 lingual deficit,再生成针对性训练样本,最后混合原始数据与合成数据继续微调。兼容 RLHF/DPO 和知识蒸馏,不改变推理架构;可作为持续学习模块定期更新,缓解灾难性遗忘。具体落地:在多语言电商客服 bot 中,针对西班牙语和印尼语的退款流程图生成训练数据,在保持英语性能的同时提升这两种语言的准确率。

局限

  • **合成数据的可靠性受教师模型限制**:HOTFIXR 依赖教师模型生成合成训练数据,但教师模型本身可能存在跨语言偏差或幻觉,导致生成数据包含错误监督信号。论文附录 A 中提到的 reward hacking 现象说明,若缺乏约束,生成过程可能“投机取巧”产生低质量但高评分的样本,影响训练效果。实际部署时需要额外的质量过滤与人工审核,增加工程复杂度。与简单的语言平衡数据混合相比,该方法对教师模型质量高度敏感,若教师模型在目标语言上能力不足,则提升有限。
  • **评估范围与泛化性局限**:实验仅在三个 in-distribution 任务、三个 out-of-distribution 任务和四种 OOD 语言上进行,且任务类型偏向推理(如数学、常识推理),对开放式生成、对话、翻译等更广泛的实际业务场景覆盖不足。OOD 语言数量有限(仅四种),无法证明对低资源语言或语言类型差异较大的语言的鲁棒性。此外,论文未与最新的多语言预训练模型(如 XGLM、BLOOM)进行系统对比,仅基于有限基座模型,其在现代大规模多语言模型上的增益尚不明确,限制了结论的普适性。
  • **计算开销与流程复杂度较高**:HOTFIXR 需要迭代地探测学生模型薄弱点并生成针对性数据,涉及多次前向传播、弱点度量计算以及额外生成模型的训练或调用,训练时间与显存开销显著高于英文路由或语言平衡数据方法。对于资源受限的团队或需要快速迭代的场景,落地成本较高。同时,方法涉及硬度阈值、数据生成比例等多个超参数,调优复杂,论文未提供系统的超参数敏感性分析,工程复现可能存在不确定性。
论文Ishika Agarwal2026-08-16原文

相关内容