在低资源语言中思考:SFT 构建了什么,RL 修复了什么,准确率看不到什么
我们选取三个前沿混合专家模型(Alibaba、OpenAI、NVIDIA,各 3.6-4.0B 激活参数),微调它们用低资源语言进行推理。在准确率基准上几乎没有任何变化,而且该基准在此规模下本身就是噪声:仅改变随机种子就会使分数波动 7.7 分,超过我们测量的所有数据和配方效应。这个“零结果”是我们的第一个发现。 真正的变化发生在准确率看不到的地方。基座模型从不使用希腊语思考:在 1000 条推理轨迹中为 0(即使问题是希腊语),因此模型虽然回答正确,却以用户无法阅读、审计或纠正的形式进行推理。经过监督微调(SFT)后,所有发布的检查点在大约 98% 的条目上使用问题语言推理,其中一个系列节省了 3 倍 token;人工评分的语法性在全部四个模型上都有提升,通用能力与基座相差仅几分:没有遗忘,却获得了流畅性。 我们提出六个行为维度使这类变化可测量,每个维度都经过门控以拒绝任何与输出长度相关的指标,并报告了我们自己的工具如何“撒谎”:六次失败,每次都被对照实验捕获。SFT 无法修复自身的缺陷:四分之一的回答跳过要求的格式,答案泄露到推理通道,且显式的“用英语思考”指令服从率不到一半。 基于可验证奖励的强化学习(RLVR)(训练前预注册)直接修复了前两个问题(格式回退从 24% 降至 2.5%,泄露从 3.5% 降至 0.0%,均对照平坦随机奖励控制),并改善了第三个问题(+9.1 个百分点),而希腊语推理习惯在仅基于准确率的梯度下保持不变。我们发布五个检查点。这些工具、对照和预注册方案可迁移到任何低资源语言;希腊语是让我们能够测量它们的案例。
论文精读
TL;DR 微调三个前沿 MoE 模型至希腊语推理:准确率基准几乎无变化且是噪声,但 SFT 使模型用题干语言思考,RL 修复格式与泄露;行为维度揭示了准确率看不见的真实变化。
问题
问题背景
当前大模型推理能力提升集中在高资源语言,低资源语言场景下模型“用英语思考、用低资源语言回答”,用户无法审计内部推理链。
现有方法局限
- Accuracy 单一指标盲区:论文在三个前沿 MoE 模型上微调推理语言,accuracy 几乎不变,且基准噪声高达 7.7 分(仅换随机种子),超过所有数据和配方效应。
- SFT 的缺陷:虽然 SFT 后推理链几乎全部转变为目标语言(~98%),但约四分之一答案跳过请求格式、答案内容泄漏进推理通道、显式“think in English”指令遵从率不足一半。
- RL 修复局限:纯 accuracy 梯度无法改变推理语言习惯;需要可验证奖励并预先注册才能修复格式和泄漏,但低资源语言可验证奖励设计困难。
为什么这个问题难/重要
低资源语言数据稀缺,基准翻译会引入污染;行为指标必须与输出长度解耦,否则造成假阳性。MoE 模型跨家族差异大(token 预算符号方向不同),单一家族的经验难以直接推广。业界需要可审计、可纠错的多语言推理,尤其部署在用户无法读内部推理链的场景。
行业类比
类似客服系统用低资源语言应答,但内部决策链用英语,一旦出错用户无法定位原因;本文相当于强制系统用目标语言推理并引入可验证格式约束。
核心洞察
- 精度基准在该规模下是噪声:仅改变随机种子即产生7.7分波动,超过所有数据和配方效应,accuracy视角无法区分任何改进。与其他只报精度分数的低资源语言微调不同,本文以随机种子为控制,证明null result本身即一结果,并迫使评估转向语言保真、推理预算等六个与输出长度无关的行为维度。工程启示:若指标不与长度门控勾连,就无法摆脱输出长度混淆,度量需配对照而非归一化。
- SFT将推理轨迹从默认英语(0/1000)切换到问题语言约98%,保持通用能力,但无法自修复结构缺陷——约四分之一答案跳过格式、答案泄漏进推理通道、显式“think in English”遵从率不足一半。预注册的可验证奖励RL在随机奖励对照下将fallback从24%降至2.5%、泄漏从3.5%到0.0%,指令遵从提高9.1pp,精度不受损。该设计分离SFT能力获得与RL缺陷修复,提供低资源语言可量化RL范式。
方法
方法流程
输入:三个前沿 MoE 模型(Qwen3.6-35B-A3B、Gpt-OSS-20B、NemotronH-30B-A3B,激活参数 3.6–4.0B)与低资源语言(希腊语)指令数据,包含问题与推理轨迹。
关键模块:
- 监督微调 (SFT):在匹配语言对上微调所有模型,迫使推理轨迹切换到希腊语;训练数据包含问题、答案与推理通道,并对比一般能力基准验证无灾难性遗忘。
- 行为维度指标:提出六个可测量的行为维度(语言保真度、推理预算、预算纪律等),每个指标通过输出长度门控,剔除与长度相关的伪相关;同时设计对照组检验指标本身可靠性(报告六类“仪器说谎”案例)。
- 噪声基线与控制:重复随机种子实验建立精度基准的噪声下限(7.7 分),以此判断后续配方效应是否真实;数据选择实验显示对精度无影响,证明基准噪声主导。
- 强化学习 (RLVR):预注册可验证奖励训练,奖励来自格式合规、防止答案泄漏到推理通道、遵循语言指令等;对比随机奖励对照组,验证修复效果。
输出:SFT 后所有检查点在 ~98% 项目上以问题语言推理,一个模型家族 token 用量减少 3 倍,语法性提升且一般能力保持;RLVR 将格式回退从 24% 降至 2.5%,泄漏从 3.5% 降至 0.0%,并提升对“用英语思考”指令的服从度(+9.1pp)。最终发布五个检查点。
与同类工作差异:本研究不依赖精度基准的微弱信号,而是通过行为维度和预注册对照揭示 SFT/RL 在低资源语言推理中的真实影响,强调输出长度门控与噪声下限控制。
实验
实验设计
论文在三个前沿 mixture-of-experts 模型(Alibaba、OpenAI、NVIDIA,各 3.6–4.0B active 参数)上执行两阶段实验:先用 supervised fine-tuning (SFT) 让模型在希腊语低资源语言上推理;随后用预先注册的 reinforcement learning with verifiable rewards 修复 SFT 无法解决的格式与泄漏缺陷。所有变化均通过六个与输出长度无关的行为维度测量,每个维度都配有控制实验以排除伪相关。
关键发现
- 精度基准上的零结果:切换随机种子即可造成 7.7 分波动,超过所有数据和配方效应,说明该规模下 accuracy 本身是噪声。
- SFT 的真正效果在行为层:基座模型 0/1,000 条推理痕迹使用希腊语,即使问题为希腊语;SFT 后约 98% 的推理痕迹与问题语言一致,一个模型家族的 token 消耗降至 1/3,语法性提升,通用能力保持在基座几个点以内。
- SFT 无法自修复缺陷:24% 的答案跳过请求格式,3.5% 的答案泄漏到推理通道,显式“think in English”指令遵守率不足 50%。
- RL 的预注册修复:格式回退从 24% 降至 2.5%,泄漏从 3.5% 降至 0.0%,英文思考指令遵循 +9.1pp;同时希腊语推理习惯在只优化精度的梯度下原样保留。
与基线对比的深度解读
仅以 accuracy 为基线会完全掩盖语言保真度、格式合规与预算控制等可审计行为。论文提出的 行为维度 + 控制指标 方法,比简单的长度归一化更可靠,能够暴露指标自身的系统性偏差。SFT 负责构建目标语言推理能力,RL 则修复指令跟随与通道分离问题,二者互补:没有 RL,SFT 的格式缺陷会持续存在;没有 SFT,RL 无法凭空建立低资源语言推理习惯。
行业影响
落地场景
该工作可直接迁移到多语言智能客服(如跨境电商服务)、低资源语言内容审核、教育个性化辅导、医疗/金融可审计决策支持等场景。核心价值在于让模型用用户母语进行推理,使推理过程可被用户读写、核查和纠错。具体 use case:
- 电商客服 agent:用户用希腊语提问,模型用希腊语推理并输出答案,客服或用户能理解其逻辑,减少误答与投诉。
- 在线教育解题辅导:针对小语种学生,模型以学生语言展示逐步推理,且部分模型 token 消耗降低 3 倍,显著降低推理成本。
商业价值
- 降本:论文显示一个模型家族在语言对齐后 token 数减少 3 倍,直接降低推理成本;同时省去额外翻译管道。
- 体验提升:用户能读懂模型的思考过程,增强信任与采纳率,降低售后咨询量。
- 合规准入:在金融、医疗等受监管场景,可审计推理路径是硬性要求;低成本实现语言保真可打开原本无法服务的小语种市场。RL 阶段对格式遵从和推理泄漏的修复(fallback 24%→2.5%,leak 3.5%→0.0%)进一步降低产品故障率。
与现有产品/工作流接口
- 微调流程:可复用现有 SFT + RLHF 基础设施;论文发布的五个 checkpoint 可作为起点,采用其预注册的可验证奖励设计。
- 评估体系:引入论文提出的行为维度与输出长度门控,避免只依赖 accuracy;并加入随机种子基线作为噪声基准,防止误判改进。
- 多语言扩展:该套仪器和控制可迁移到任意低资源语言,企业可构建内部多语言推理对齐流水线。
局限
- **语言覆盖单一**:实验仅以希腊语作为低资源语言案例,虽然作者主张其评估框架与预注册方法可迁移至其他低资源语言,但未进行多语言验证。不同文字系统(如西里尔字母、阿拉伯字母)或形态复杂的语言可能带来新的挑战,例如分词器表现、语法判断器的适用性,以及语言保真度阈值的校准。因此,结论是否普遍适用于所有低资源语言仍有待检验。
- **模型规模与架构受限**:三个前沿 MoE 模型的 active 参数均在 3.6–4.0B 之间,未覆盖更大规模的稠密模型或不同 MoE 配置。论文发现仅改变随机种子即带来 7.7 分的准确率波动,但该噪声水平可能特定于该参数量级和所选基准;更大模型是否同样存在此类基准噪声、以及行为变化是否一致尚不清楚。此外,RLVR 阶段使用的可验证奖励仅针对格式与泄漏缺陷,对其他行为维度(如推理深度、事实一致性)的改善有限,未系统探索更丰富的奖励信号。
- **行为度量的完备性与对照强度**:作者提出了六个行为维度并设置输出长度门控,但维度列表可能遗漏关键推理属性(如策略合理性、中间步骤正确性),且度量本身依赖语言特定的解析器与语法判断器,跨语言扩展时需重新构建。论文虽报告了六个“仪器撒谎”案例并设置对照,但未与轻量级对齐方法(如 prompt 工程、上下文示例)进行系统性比较,无法确定 SFT/RL 带来的行为收益是否优于更简单的干预手段。此外,仅关注单一任务的推理轨迹,未评估多轮对话或真实应用场景下的稳定性。