行业新闻

苹果研究:中文推理训练与英语差距仅1.1个百分点

实验证明中文推理训练与英语差距极小,中文推理模型有条件从训练源头走独立路线。

苹果联合Hasso Plattner研究所对9个模型、11种语言做了200多组强化学习推理训练实验,发现用中文训练的推理性能与英语仅差1.1个百分点,远低于此前认为的10个百分点以上。这意味着中文推理模型不必先绕道英语,可从训练阶段就用中文,走独立路线。

正文摘录

![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimg329a26b6c6.webp) 新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimg3b253ef414-228.png) 最近,Apple 联合 Hasso Plattner 研究所发表论文,在 9 个基座模型、11 种语言上做了超过 200 组 GRPO 强化学习推理训练实验。GRPO 是一种强化学习训练方法,通过奖励信号直接优化模型的推理策略,常用于推理模型的后训练阶段。 ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimg087da785f0.webp) https://arxiv.org/pdf/2608.13698 结果显示,用中文做推理训练,与英语训练的性能差距只有 1.1 个百分点,此前同类研究报告的差距是 10 个百分点以上。 GRPO 训练有一个关键设计选择:奖励模型用英语推理,还是用提问者的母语推理。奖励模型负责给模型的输出打分,它用哪种语言推理,会直接影响模型在训练中倾向用哪种语言思考。 选英语,模型收到中文问题也会切到英语思考;选母语,模型全程用中文。 此前研究认为母语推理性能代价太大,非英语团队只能默认走英语推理路线。 这篇论文说,代价远没有那么大——对中文来说只有 1 个百分点。这直接改变了路线判断: 中文推理模型有条件从训练阶段就跳过英语,走自己的路。 对中文 AI 从业者来说,这是推理模型能否走独立路线的前置条件。 论文同时发现,跨语言迁移广泛有效,但特定模型-语言组合会触发极端性能塌方。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-08-30原文

相关内容