论文

CroCo: 跨语言对比偏好调优于自生成文本

CroCo: 跨语言对比偏好调优于自生成文本

现有研究表明,通过奖励分数设定大语言模型自生成响应之间的受控对比性,可以改善英语中的下游偏好调优。我们将此方法扩展到多种语言,并在总共14种高资源和低资源语言上评估了两个模型,涵盖多样化的任务。我们的核心发现是,跨语言对比偏好调优于自生成文本(CroCo)无需特定语言的偏好标注即可实现迁移。基于英语偏好(在多语言基座之上)训练的奖励模型,在大多数语言中产生了有用的语言内排名,并且无论是单语言还是多语言设置,配对训练都能在大多数配置上改善模型表现,同时防止监督微调的灾难性遗忘。我们观察到,增益需要在线策略数据。离线策略响应会降低收益,而在线偏好优化未能优于离线变体。具体来说,在结构化任务上,我们的方法在 EuroLLM-9B 的 7 种语言中有 6 种达到或超过基线,在 Aya-3B 的 7 种设置中有 4 种达到或超过基线。在开放式生成任务上,两个调优模型在全部 11 种评估语言中均优于各自的基线。总体而言,我们展示了多语言偏好调优的有前景方向。

论文精读

TL;DR CroCo 提出跨语言对比偏好调优,仅用英语偏好数据与自生成响应,即可提升多语言 LLM 性能,避免监督微调的灾难性遗忘,并揭示 on-policy 数据的必要性。

问题

问题背景

多语言大语言模型(LLM)的偏好对齐已成为提升跨语言生成质量的关键环节。当前业界关注如何在不依赖大量人工标注的前提下,将单语(通常为英语)的偏好信号高效迁移到多语言场景,以节省成本并加速迭代。

现有方法局限

主流偏好优化方法(如 RLHF、DPO)在多语言扩展时面临两大瓶颈:

  • 依赖语言特定偏好标注:直接为每种目标语言收集人类偏好数据成本高昂,尤其对于低资源语言几乎不可行。
  • 有监督微调(SFT)导致灾难性遗忘:简单地在翻译数据上进行 SFT 会显著损害模型在其他任务上的通用能力;即使用奖励筛选的 SFT(Max-R)也只能部分缓解,无法根除遗忘。
  • 离线数据与在线策略的 gap:许多方法使用离线构造的偏好对,但研究发现,若数据不是模型自身生成的(on-policy),对齐增益会大幅缩水,而天真地切换到在线偏好优化又未能稳定超越离线变体。

为什么这个问题难/重要

  • 技术挑战:跨语言场景中,不同语言的语义空间、数据分布差异巨大。如何让一个仅用英语偏好训练的奖励模型在多语言生成上给出有效的相对排名,是核心难点。此外,保持对齐后的模型仍能稳健处理结构化任务(如翻译、分类)与开放式生成,避免性能坍缩,对优化策略的鲁棒性要求极高。
  • 业界关注度:全球化的产品(如虚拟助手、内容审核、多语言客服)要求 LLM 在数十种语言上产出符合人类期望且安全的回复。低资源语言的对齐缺失可能引发文化误读与安全风险,因此低成本、可扩展的多语言偏好对齐方案具有明确的实用价值。

行业类比

这类似于在不重训驾驶模型的情况下,让一辆专在高速公路(英语)训练的自动驾驶系统,通过少量规则迁移即可在城市道路(多语言)中安全行驶——核心在于找到跨场景的通用评估信号,而非为每条街道重新标定。

核心洞察

  • 跨语言偏好迁移无需语言特定标注:CroCo 证明一个仅在英语偏好上训练的奖励模型,搭配多语言基础模型,即可直接对 14 种语言的自生成回复进行有效偏好排序,并构建高质量对比对。与依赖翻译扩增或逐语言标注的现有方法不同,这种迁移性极大降低了多语言对齐的数据准备成本,并揭示了多语言模型内部已编码的跨语言一致性,为低资源语言的对齐开辟了可行路径。
  • 在策略数据是多语言 DPO 增益的关键:实验明确显示,离线重用非自生成数据会削弱 DPO 收益,甚至在线 DPO 也未能超越离线变体,只有在策略自生成响应能带来稳定提升。这颠覆了简单复用现有偏好数据集的假设,指引实际工程必须在目标模型上实时采样构建对比对,否则跨语言调优可能无效,为数据构造流程提供了明确的设计约束。
  • 跨语言对比调优可抑制监督微调的灾难性遗忘:当使用翻译数据进行监督微调时,模型在原始任务上性能显著下降,而 CroCo 的 DPO 不仅阻止了遗忘,在多数结构化任务上甚至超过基础模型,并在开放式生成中在所有评估语言上优于基模型。这提供了一种无需多任务回放或参数冻结即可稳固并提升多语言能力的实用方案,对持续微调流程有直接工程启示。

方法

方法概览

CroCo 的核心思路是跨语言自生成对比偏好调优,其训练管线为:多语言 prompt → 模型自生成响应 → 英文偏好奖励模型评分 → 构建对比偏好对 → DPO 偏好调优

关键模块

  1. 自生成数据构建
    对每个多语言 prompt,使用当前模型(即 on-policy)生成多个候选响应。随后利用一个在 multilingual base 上仅以英文偏好数据训练的奖励模型 (RM) 为每个响应打分。尽管 RM 只见过英文偏好,它仍能对多语言响应给出合理的相对排序——这是该方法能跨语言迁移的核心假设。在构建偏好对时,作者采用 "sweet-spot" 策略:不简单取最高分与最低分,而是根据奖励分布选择区分度适中的正负样本,避免信号过弱或噪声过强。

  2. 偏好调优 (DPO)
    使用构造好的偏好对进行 Direct Preference Optimization,优化目标是让模型更倾向于生成高奖励响应、远离低奖励响应。训练可在单语 (monolingual)多语 (multilingual) 配对设置下进行,二者均不引入语言特定的偏好标注。

  3. 灾难性遗忘预防
    与直接进行 SFT 相比,CroCo 的 DPO 训练能有效保留基座模型的原有能力,避免因领域偏移导致的性能退化。实验表明,仅通过 SFT 微调翻译数据会造成严重遗忘,而 CroCo 能在提升下游任务的同时,维持甚至超越基座水平。

工程洞察

  • On-policy 数据至关重要:使用 off-policy(如其他模型生成)的响应会显著降低收益,在线偏好优化(online DPO)亦未优于离线版本,说明保持生成分布与训练分布一致是发挥对比偏好调优效果的前提。
  • 奖励模型即使仅在英文偏好上训练,仍能跨语言泛化,这大幅降低了多语言对齐的数据成本。

与现有需要语言特定偏好数据的方法不同,CroCo 完全依赖英文偏好训练的 RM 进行跨语言评分,并通过自生成对比对实现多语言偏好对齐,是一种零语言标注、强泛化的多语言调优范式。

实验

实验设计

论文在两个多语言模型 EuroLLM-9BAya-3B 上验证 CroCo 方法,覆盖 14 种语言。评估分为结构化任务(EuroEval)和开放式生成(m-ArenaHard 2.1),后者使用 GPT-4o 作为裁判进行成对比较。

训练数据来自模型自身生成(on-policy),使用基于英文偏好训练的奖励模型对多种语言的自生成响应打分,然后按分差构建对比对。基线包括:原始模型、SFT 在翻译数据上微调、仅取最高奖励样本的 Max-R SFT,以及使用外部偏好数据的 Orca-1Aya-23 DPO。

关键发现

  • 结构化任务:CroCo 在 6/7 语言中匹配或胜过 EuroLLM-9B 基础模型,Aya-3B 在 4/7 设置中提升。SFT 翻译数据会导致灾难性遗忘,Max-R 能部分缓解但仍不够;加入跨语言对比的 DPO 则完全防止遗忘。
  • 开放式生成:两个模型在所有 11 种评估语言上均优于各自基础模型,并且大幅缩小了与更大模型 Gemma3 的差距。
  • 数据策略:on-policy 自生成至关重要;off-policy 响应会降低收益,在线偏好优化未能超越离线 DPO。

与基线的深度对比

与使用预收集偏好对的基线相比,CroCo 通过自生成和跨语言评分自动构建对比数据,避免了对语言特定标注的依赖。单语与多语配对方式都有效,且多语设置下模型能泛化至未见语言,证明奖励模型提取的偏好信号具有跨语言迁移性。相比依赖外部指令数据微调的 Aya-23 DPO,CroCo 仅用无标注的自生成数据即可在低资源语言上取得显著改进,显示出更好的扩展性和普适性。

行业影响

落地场景

CroCo 的核心优势在于 无需语言特定偏好标注 即可提升多语言大模型的指令跟随能力和安全性,直接适用于多语言聊天机器人、全球化内容审核、跨语言虚拟助手等产品。例如:

  • 多语言客服:跨境电商或全球性企业使用单一英文偏好数据训练的模型,即可覆盖数十种语言的客户咨询,保持各语言下回答质量一致。
  • 内容生成平台:社交媒体或新闻聚合产品需要生成多语言摘要、评论或帖子,CroCo 可确保风格和安全标准跨语言统一,且避免微调后的性能退化。

商业价值

  • 显著降本:偏好数据标注是偏好对齐中最昂贵的一环。CroCo 仅依赖 英文偏好训练的奖励模型 为所有语言生成排序信号,省去为每种低资源语言聘请标注专家的开支。
  • 体验与安全双提升:实验显示,在结构化任务和开放式生成上,CroCo 微调后的模型在多数语言上匹配或超越基线,且 防止了监督微调的灾难性遗忘,降低线上服务风险。
  • 加速全球化:团队可使用同一套对齐流程快速适配新语言市场,缩短产品上线周期,抢占多语言用户。

与现有产品/工作流的接口

可将 CroCo 作为 SFT 之后的可插拔后训练模块 集成到现有 LLM 训练pipeline 中:

  1. 数据构造:使用多语言基座模型针对下游任务 自生成候选响应(on-policy),再调用已有的英文奖励模型(如基于 Llama-3 等公开模型微调的 RM)打分。
  2. 偏好对构建:根据奖励分选择“高-低”对比对,采用论文的 sweet-spot 采样 避免噪声。
  3. DPO 训练:在标准偏好优化框架(如 TRL、Axolotl)中加入跨语言数据,保持训练超参与离线 DPO 一致。

无需额外部署多语言奖励模型或修改线上推理栈,训练好的模型可直接替换原有基础模型。

具体落地 Use Case

  • 全球电商多语言客服机器人:电商平台每天处理数十种语言的售前售后对话。利用 CroCo,只需维护一套英文偏好标准,即可让客服模型在英语、西班牙语、阿拉伯语等语言中均遵循“礼貌、准确”的回复风格,同时避免在 SFT 后丢失事实性知识。
  • 视频流媒体多语言 AIGC 审核:UGC 平台需对用户生成的多语言评论或标题进行安全过滤和风格统一。CroCo 微调后的模型可生成高质量多语言回复建议,提升社区内容质量并降低人工审核压力。

局限

  • **跨语言迁移仍受限于英文偏好标注**:CroCo 的核心假设是,在多语言基座模型上训练的英文偏好奖励模型能够泛化到其他语言,但这种泛化能力未经过严格理论论证,可能在某些语系(如低资源、非拉丁文字)上失效。论文实验虽涵盖 14 种语言,但奖励模型仅基于英文偏好数据,若目标语言与英文语法结构、文化背景差异极大,奖励排名质量可能显著下降,导致偏好优化方向偏差。此外,未探索多语言偏好标注的直接微调带来的潜在增益,难以判断跨语言迁移方案在泛化性与成本之间的真正平衡点。
  • **在线偏好优化未见收益,计算开销与数据需求成为实际障碍**:实验表明,离线 DPO 已接近甚至优于在线变体,且离线 DPO 方案需使用 on‑policy 自生成数据,off‑policy 数据会削弱性能。在线优化通常需额外采样与评估步骤,当离线方案已足够时,引入在线环节仅增加工程复杂度而无实际增益。同时,on‑policy 数据要求模型为每批训练任务重新生成响应,对大规模多语言部署而言,计算资源消耗和训练时间显著增加,限制了该方法在资源受限项目中的直接应用。
论文Mike Zhang2026-05-25原文

相关内容