构建多语言桥梁:数据混合作为语言内推理泛化的支柱
推理语言模型在多种复杂任务上取得了显著进展,但其能力仍高度以英语为中心:无论提示使用何种语言,模型基本都用英语进行推理。这既对非英语用户不友好,也可能丢失原始问题的意图,并弃用在目标语言中更易表达的知识。 本文推进 L2 reasoning,即模型始终以用户提示语言进行推理的能力,从而在提示与答案之间搭建一座语言内桥梁。作者从 data-centric 的视角切入,研究如何在 SFT 中优化数据配比与调度,以提升推理泛化能力。 在 3.35B 规模上构建 Tiny Aya L2-Thinker,在涵盖数学、常识推理、指令遵循、开放式生成与文化推理的 6 个 benchmark 与 60 种语言 上取得超过 93% 的 L2 reasoning 比例,同时保持强劲的总体性能。 研究表明,将 L2 reasoning 泛化到未见语言,路径在于三点: - 更广泛的语言覆盖; - 易于获取的多语言非推理数据; - 足够强的英语推理主干。 这说明推理是一种与语言无关的行为,可通过精心设计的数据混合,在类型多样的语言之间迁移,而无需在每种目标语言中提供推理监督。作者开源了模型权重与多语言推理数据,以支持可及的语言内推理研究。
论文精读
TL;DR 用精心混合的多语言非推理数据与英语推理数据做SFT,3.35B模型即可在60种语言上实现93%+的L2推理率,证明推理是语言无关行为、可通过数据配比迁移。
问题
问题背景
推理语言模型在数学、常识推理等复杂任务上能力快速提升,但模型内部推理过程高度英语化:即使用户提示为非英语,模型仍倾向用英语思考并生成中间步骤,导致非英语用户体验割裂、原始意图丢失,以及目标语言特有知识被忽略。
现有方法局限
- 推理时强制切换语言(如通过 prompt 要求“用目标语言推理”)不可靠,常导致性能下降或推理中途回退英语,无法稳定实现 L2 推理(论文 4.1 节确认强迫语言不能替代训练)。
- 翻译英语推理训练数据到目标语言依赖大规模高质量翻译和每门语言的推理标注,低资源语言覆盖不足、成本极高,且翻译引入的偏差会阻碍推理行为的原生迁移。
- 现有多语言 SFT 的数据混合策略缺少系统性研究:简单合并不同类型数据易造成推理行为不一致,而顺序适应(先英语后多语言)会破坏英语推理骨干的准确性或导致灾难性遗忘。
为什么难/重要
推理行为本质上语言无关,但预训练数据中英语占绝对主导,将推理能力迁移到类型多样的语言(如黏着语、分析语)需要跨语言泛化,而非简单词汇替换。同时,模型必须在保持数学/常识推理准确率的前提下,在 60+ 语言中一致输出目标语言推理步骤,这对数据组成和训练调度提出强约束。业界需要可访问、合规的本地化推理服务,但为每门语言单独标注推理数据不可规模化,因此数据混合成为核心杠杆。
行业类比
类似多语言智能客服:若内部决策链始终用英语,即使最终翻译成用户语言,也会丢失文化语境与意图理解,直接影响服务质量和合规性。
核心洞察
- 联合数据混合(joint data mixing)而非序列课程学习,是实现 L2 reasoning 稳定泛化的关键。与常见的先英语后多语言或领域自适应策略不同,该工作将英语推理数据、多语言非推理数据和少量翻译推理数据同时混合训练,避免了灾难性遗忘,并让英语推理骨干与多语言语言能力形成协同。结果证明联合混合在准确率与 L2 推理率之间取得最佳折衷,而序列适配或模型合并均无法匹配其表现,为低成本扩展多语言推理提供了直接工程路径。
- L2 reasoning 并不要求每个目标语言都具备推理监督数据,推理行为可通过语言覆盖广度与通用多语言数据进行迁移。该视角区别于以往依赖逐语言推理标注或大规模翻译的工作:仅需一个足够强的英语推理骨干,配合覆盖广泛的多语言非推理语料和少量翻译推理样本,即可在 60 种语言上实现 93% 以上的 L2 推理率。这表明推理能力本身具有语言无关属性,非推理数据的作用不止于提升语言流畅度,更在于触发模型在目标语言内维持推理链,大幅降低多语言推理模型的构建成本。
方法
输入数据构建
- 英文推理数据 作为复杂推理能力的骨干,覆盖数学等结构化任务。
- 通过翻译增强将英文推理轨迹扩展到多语言,生成对齐的 L2 推理样本;同时引入现成的多语言非推理数据,提供广泛语言覆盖与通用指令跟随能力。
关键模块:联合数据混合 SFT
- 将英文推理数据、翻译推理数据、多语言非推理数据按比例混合,进行单阶段多任务监督微调(SFT),目标为 next-token prediction 损失。
- 数据调度采用
joint mixing,让模型在同一优化轨迹中同时习得推理行为迁移与目标语言表达,避免顺序适应或事后模型合并。 - 关键设计是不为每个目标语言分别标注推理过程,也不依赖推理时显式语言控制。
输出
- 得到 Tiny Aya L2-Thinker(3.35B),在 60 种语言、6 个基准上实现超过 93% 的 L2 reasoning rate,同时保持较强任务精度。
- 该模型可将推理行为泛化到训练中未见的 held-out 语言。
与同类方法的差异:本工作通过数据混合与调度在单次 SFT 中实现跨语言推理泛化,而非推理时强制语言提示或逐语言适配。
实验
实验设计
基于 3.35B 的 Tiny Aya L2-Thinker,数据混合三类:translated reasoning data(翻译推理数据)、multilingual non-reasoning data(多语言非推理数据)、English reasoning data(英语推理骨干)。通过 SFT 多任务后训练,评估 6 个基准(数学、常识推理、指令遵循、开放生成、文化推理)上 60 种语言的 L2 推理率与准确率。
关键发现
- L2 推理率 >93%,跨 60 语言 6 基准,说明语言一致推理行为可迁移。
- 分析表明:更广语言覆盖、少量非推理数据、充足英语推理骨干是泛化关键;长轨迹与 doomlooping 相关而非深度推理。
- 数据混合优于顺序自适应和模型合并(§5.4),联合混合提供最佳准确率-L2 权衡。
与基线对比解读
与仅强制推理语言(inference-time forcing)相比,训练数据混合是必要条件(§4.1)。顺序自适应或合并方法在低资源语言上表现不稳定,联合数据混合在 accuracy–L2 trade-off 上更优,且对未见过语言有正向迁移。
行业影响
落地场景
多语言客服与虚拟助手、跨语言内容生成与审核、教育辅助(多语言解题与解释)、电商产品描述与多语言问答、医疗/金融领域多语言文档分析与咨询。L2 reasoning 模型可在用户语言内完成推理,避免英语中间步骤造成语义漂移,适合需精准理解原意的场景。
商业价值
- 降本:无需为每种目标语言单独收集推理监督数据或部署翻译管道,可通过数据混合迁移推理能力。
- 增收:覆盖更广泛非英语用户,提升产品可及性与市场渗透。
- 体验提升:模型以用户母语给出推理过程和答案,增强信任与交互自然度;在多语言基准上保持准确率,不牺牲性能。
与现有工作流接口
可直接使用开源权重 Tiny Aya L2-Thinker 作为推理引擎,或将其数据混合配方(英语推理数据 + 多语言非推理数据 + 翻译推理数据)融入现有 SFT 流程。部署层可集成到多语言 API 服务、RAG 检索增强生成管道、Agent 框架中;无需改变现有推理栈,仅替换/微调模型即可获得 L2 能力。工程上重点关注数据覆盖率与比例调度,而非模型架构改动。
具体落地 use case:电商平台的多语言客服机器人可识别用户问题语言,直接以该语言进行逻辑推理并给出解答,无需内部翻译;教育平台的多语言数学解题助手可对非英语题目输出同语言的详细步骤,提升学习效果。
局限
- **模型规模与训练范式受限**:仅在 3.35B 参数的小模型上验证,未在更大规模模型(如 7B、13B)上复现;且只使用 SFT,未探索 RL 或其他对齐方法对推理语言一致性的影响。这意味着所提数据混合策略在大模型上是否同样有效、是否需要调整比例尚未可知,工程落地时需谨慎外推。
- **数据依赖翻译质量与覆盖不均衡**:多语言推理数据主要靠翻译生成,翻译错误或风格偏移会直接注入训练噪声;非推理多语言数据的选取比例依赖启发式,缺乏理论指导。对低资源语言,翻译资源本身稀缺,可能导致 L2 reasoning 率虽高但语义保真度不足,需额外人工评估。
- **评估指标与对比基线局限**:L2 reasoning rate 只检测显式推理语言,无法捕捉模型是否真正理解原问题意图或是否存在隐性跨语言推理;基准虽覆盖 60 种语言,但单语言样本量可能不足,统计显著性未报告。与推理时控制语言的方法(如 prompt 约束)对比不够系统,无法清晰定位数据端优势的边界条件。