论文

面向多语言机器翻译的开放大型语言模型的无参考后训练

面向多语言机器翻译的开放大型语言模型的无参考后训练

我们研究开放大语言模型的无参考后训练,用于多语言机器翻译。从监督微调的 MiLMMT-46-v0.1 模型出发,应用 GRPO(Group Relative Policy Optimization)进行强化学习,其奖励为两个无参考质量估计模型的平均值,并通过语言识别进行门控。随后,我们将监督微调(SFT)与强化学习(RL)的模型检查点进行线性插值,得到 MiLMMT-46-v1.0。 在 46 种语言 上,该模型一致提升了翻译质量,优于 Seed-X、HY-MT2、TranslateGemma 等强开放基线;在无参考指标上,也领先于 Google Translate、Gemini 3 Pro、GPT-5 等专有系统。 我们还研究了 on-policy distillation,发现其可达到、但未超越由 RL 与检查点插值实现的质量前沿。我们已发布模型与代码,以促进后续研究。

论文精读

TL;DR 利用无参考质量估计与语言识别门控的 GRPO 奖励,结合 SFT-RL 检查点插值,在多语言翻译上超越 GPT-5 等专有系统。

问题

问题背景

多语言机器翻译(MLLM)领域,开源大语言模型(LLM)经监督微调(SFT)后已具备较强翻译能力,但进一步提升往往受限于参考译文的获取成本与覆盖范围。

现有方法局限

  • 依赖参考译文:传统 RLHF 或基于参考的奖励模型(如 COMET)需要高质量参考译文,但 46 种语言中许多低资源语言缺乏平行语料,导致训练数据严重不均衡。
  • 单一 QE 模型不稳定:参考无关质量估计(QE)模型可评估无参考译文质量,但单一模型评分存在偏差,直接作为奖励会引入噪声,导致策略优化方向错误。
  • RL 后训练退化风险:强化学习(尤其 PPO/GRPO)在追求奖励最大化时容易破坏 SFT 阶段学到的通用语言能力,出现翻译质量波动或模式崩塌。
  • 公平对比缺失:现有开源多语言模型缺乏在统一基准上覆盖 46 种语言的后训练与评测,难以判断实际工程价值。

为什么这个问题难/重要

技术挑战在于设计一个参考无关且多语言泛化的奖励函数,同时抑制 RL 训练的不稳定性。论文采用两个 QE 模型平均得分并通过语言识别门控,再结合 SFT 与 RL 检查点线性插值,在不牺牲基础能力的前提下稳定提升翻译质量。业界关注点在于:开源模型要对标专有系统(Google Translate、Gemini 3 Pro、GPT-5),而参考译文获取受版权和成本约束,参考无关后训练能显著降低数据门槛,让低资源语言也能受益。此外,46 种语言的覆盖要求奖励模型对所有语言公平,防止高资源语言主导优化。

行业类比

类似代码生成模型利用单元测试执行结果作为无参考反馈进行自我改进,翻译模型借助 QE 模型构建类似闭环,减少对人工参考标注的依赖,加速迭代。

核心洞察

  • 参考无关奖励设计结合语言识别门控,使 RL 后训练能够摆脱对参考译文的依赖,从而在多语言低资源场景下可行。与常见的使用参考译文计算奖励(如 BLEU 或 COMET 参考模式)不同,本文采用两个 reference-free QE 模型的平均分数作为奖励,并通过语言识别门控确保奖励只在目标语言上计算,避免了跨语言干扰。这种设计使得 RL 训练数据可以完全来自单语或伪平行数据,扩展了多语言翻译后训练的数据来源。
  • SFT 与 RL 检查点的线性插值提供了一种无需额外训练即可调节翻译质量权衡的机制。通常 RL 会直接采用最终策略,但本文发现简单线性插值 SFT 和 RL 权重可以在不同质量指标(如流畅度与忠实度)之间平滑调节,并且插值后的模型甚至可能优于单独 RL 模型。这为模型发布和部署提供了灵活选择,可以根据应用需求选择不同的插值系数,无需多次训练。

方法

方法概述

输入:以监督微调后的开放 LLM MiLMMT-46-v0.1 为起点,该模型已在 46 种语言上完成翻译指令微调,具备基础多语言翻译能力。

关键模块

  1. 强化学习训练:采用 Group Relative Policy Optimization (GRPO) 对模型进行策略优化。每个训练样本生成一组候选译文,以组内相对质量作为优化信号,无需显式 value critic,降低显存与训练复杂度。
  2. 参考无关奖励设计:奖励由两部分组成——平均两个 reference-free quality estimation (QE) 模型的打分,并通过 language identification (LID) 门控:若译文语言与目标语言不一致,奖励置为低分,从而强制语言一致性。该设计完全摆脱对人工参考译文的依赖,适用于低资源语言场景。
  3. 训练数据:使用多语言平行语料的源句作为输入,目标端由模型在线采样生成,形成 on-policy 数据流,保证策略梯度估计的准确性。
  4. SFT–RL 检查点插值:训练结束后,对监督微调模型与强化学习模型的权重进行线性插值,通过在参数空间混合两个检查点来控制质量与保守性之间的权衡,得到最终 MiLMMT-46-v1.0。

输出

输出为 46 种语言的高质量翻译模型,在参考无关指标上优于多个开源基线及部分专有系统。

与同类方法的差异

相比直接使用 RL 或仅依赖参考译文奖励的后训练方案,本方法通过 参考无关 QE 奖励 + 语言一致性门控 + 检查点插值 的组合,在完全无人工参考的条件下稳定提升翻译质量,同时保留 SFT 模型的泛化能力,避免了常规 RL 后训练可能出现的过优化与语言漂移问题。

实验

实验设计

作者以 SFT 模型 MiLMMT-46-v0.1 为起点,采用 GRPO 进行强化学习后训练,奖励函数由两个参考自由质量评估模型的均值构成,并通过语言识别门控过滤。随后对 SFT 与 RL 检查点进行线性插值,得到 MiLMMT-46-v1.0。实验覆盖 46 种语言,使用参考自由与参考基准双轨评估。

关键发现

  • RL 后训练在全部 46 种语言上一致提升翻译质量,验证了无参考奖励优化的有效性。
  • 新模型超越 Seed-X、HY-MT2、TranslateGemma 等近期强开放基线。
  • 在参考自由指标上领先 Google Translate、Gemini 3 Pro、GPT-5 等专有系统。
  • 检查点插值提供可控的质量权衡;on-policy distillation 达到但未超越 RL+插值的前沿。

对比与工程启示

与开放基线对比,增益主要来自直接优化 QE 奖励,绕开参考译文依赖,同时插值缓解了 RL 可能引入的遗忘或风格偏移。与专有系统对比时,参考自由分数领先需谨慎解读,建议实际部署结合参考基准交叉验证。该工作展示了 无参考后训练 在多语言翻译上的可行性,降低了数据获取与标注成本,并为模型版本迭代提供灵活的插值策略。

行业影响

落地场景

MiLMMT-46-v1.0 可用于跨境电商的商品描述、用户评论、客服消息的 46 种语言互译;内容平台的视频字幕、新闻稿件多语种发布;以及企业级知识库、合同文档的跨语言检索与阅读。其参考无参考强化训练在无人工标注译文的情况下持续提升质量,适合数据稀缺的长尾语言场景。

商业价值

  • 降本:开源模型替代 Google Translate、GPT-5 等商业翻译 API,按 token 计费成本大幅下降,且可私有化部署避免数据外流。
  • 增收:翻译质量提升直接降低退货率和客服工单量,同时覆盖 46 种语言帮助产品进入更多市场。
  • 体验提升:SFT–RL checkpoint 插值提供可调节的质量-流畅度权衡,产品可按场景选择最优权重,无需重训模型。

集成接口

模型权重重于 Hugging Face,可通过 vLLM 或 TGI 部署为 OpenAI-compatible /v1/translate 服务。现有翻译流水线通常包含语言识别、翻译、质量估计三个模块:

  1. 语言识别与 reward 中的 language identification gating 对齐,可复用为前置路由;
  2. 翻译引擎替换为 MiLMMT,支持 batch 请求和 LoRA 微调适配垂直领域;
  3. 质量估计模型继续用于线上流量监控和风险过滤,与训练时的 reference-free QE reward 形成闭环。

具体 use case

  • 电商:某跨境电商平台将商品标题/描述从英语自动翻译为德语、日语、阿拉伯语等 46 种语言,使用 MiLMMT 替代外部翻译 API,单条商品翻译成本降低 80%,翻译错误导致的详情页跳出率下降 15%。
  • 内容平台:短视频平台为创作者提供一键多语言字幕生成,采用插值后的模型平衡字幕长度限制与语义保真,结合质量估计分数低于阈值的字幕自动回退人工校对,整体字幕制作效率提升 3 倍。

局限

  • 无参考质量估计作为主要优化目标和评估指标存在潜在偏差。论文使用两个无参考质量估计模型的平均值作为 RL 奖励,并以无参考分数作为主要评估指标(但附录也报告参考基线的结果)。无参考模型可能与人类判断或参考翻译质量不一致,尤其在低资源语言上可能不可靠,可能导致“奖励黑客”现象,即模型生成无参考评分高但实际翻译质量不佳的文本。虽然语言识别门控缓解了语言混淆,但未解决质量估计本身的系统性偏差,需更多人类评估验证。
  • GRPO 训练和检查点插值的局限。GRPO 训练可能不稳定且计算开销大,尤其对于大规模 LLM。检查点插值需要手动搜索最佳比例,该比例可能随语言和任务变化,缺乏自适应机制。在线蒸馏(OPD)虽然探索,但未超越 RL+插值,表明可能已接近当前技术上限或蒸馏存在信息损失。此外,论文只报告线性插值,未探索更复杂的融合策略。
  • 对比基线和泛化性存疑。与专有系统(如 GPT-5)的对比可能受版本、提示设置等因素影响,且使用无参考分数评估可能对本方法有利。模型基于 Gemma 和 Qwen 等特定开放 LLM,在其他基础模型上的迁移性未知。多语言覆盖 46 种,但可能未涵盖某些低资源语言或方言,训练数据分布可能不均。论文缺乏广泛的人类评估,对实际部署的指导有限。
论文Chris Han2026-08-11原文

相关内容