论文

Lius: 基于持续指令调优的翻译模型在古邦马来语教学语言学中的应用

Lius: 基于持续指令调优的翻译模型在古邦马来语教学语言学中的应用

大型语言模型(LLMs) 为翻译任务带来新潜力,但处理低资源语言时性能常下降。针对此问题,我们提出一种面向低资源语言古邦马来语的 LLM 微调方法。 方法上,我们利用双语词典提取显式词汇与语义特征,设计一组指令,并引入持续指令调优(Continual Instruction Tuning, CIT) 训练范式,支持迭代指令训练。 实验表明,我们的模型 Lius 相比标准指令调优模型提升 4-6 分,并在多项指标上超越神经机器翻译(NMT) 与多语言 LLM 模型 10-13 分。这凸显了该方法在减少低资源语言翻译对大规模平行数据依赖方面的潜力。

论文精读

TL;DR 针对低资源语言翻译,利用双语词典构建指令并通过持续迭代式指令调优(CIT)微调大模型,在 Kupang Malay 上显著超越标准指令调优与现有 NMT、多语言 LLM,缓解对大规模平行语料的依赖。

问题

大语言模型 (LLM) 驱动的机器翻译领域,业界普遍关注如何将模型能力泛化到数据稀缺的语言,但当前主流方案对 低资源语言 的适配效果仍不理想。

现有方法的局限

  • 标准指令微调 (Instruction Tuning) 依赖大规模对齐的平行语料,而低资源语言往往只有零散的小规模词典或短语对,直接构造指令会导致模型欠拟合或产生 幻觉翻译
  • 多语言 LLM (如 mT5 / BLOOM) 虽在预训练阶段见过若干语言,但对未充分曝光的 Kupang Malay 这类变体,分词与语义表示能力明显退化,常出现语码混合或语法漂移。
  • 神经机器翻译 (NMT) 模型需要从零训练或微调,同样受限于平行数据量,且缺少 LLM 的知识迁移优势。
  • 更关键的是,现有训练范式一次性注入所有指令,无法让模型逐步吸收由简到繁的语言特征,导致对词典中结构化信息(词汇、音系、语义映射)的利用效率低。

问题的难点与重要性

低资源语言的翻译存在三重挑战:

  1. 数据层面:平行句对极少,纯文本单语数据也难以规模化,词典条目往往是唯一可依赖的强信号,如何将其转化为有效监督信号是核心难题。
  2. 语言特性层面:Kupang Malay 具有口语化、拼写不规则、与标准马来语差异显著等特点,模型必须习得音素-形态-句法的协同变化模式。
  3. 工程层面:产业界追求一个底座模型覆盖百种语言,但低资源语言频繁成为盲区,制约了全球化产品的用户体验覆盖度。

解决该问题不仅关乎技术公平性(避免语言数字鸿沟),也为 领域适应(如法律/医疗术语微调)提供了方法论参考:当标注数据极度匮乏时,如何利用词汇资源和迭代课程学习来撬动模型性能。

类比场景:类似用少量标注样本将通用视觉模型适配到罕见病医学影像诊断——你必须把有限的结构化知识(症状-病灶映射)分解为递进式训练指令,让模型先识特征、再学关联,否则直接端到端微调会严重过拟合。

核心洞察

  • 借助**双语词典**将显性的词汇、语义特征拆解为多种结构化提示(上下文、语义映射、语音、列表-分组-标签),把有限的语言知识高效注入 LLM。这与依赖大量平行数据的指令微调或直接使用多语言模型的思路不同,它展示了在极小标注资源下如何通过外部符号知识弥补统计信号的不足,为低资源语言翻译提供了一条低成本的增强路径。
  • **Continual Instruction Tuning (CIT)** 通过迭代式引入多样化指令,让模型分阶段逐步适应翻译任务,形成一条平滑的渐进学习曲线。相比一次性全量指令微调,CIT 缓解了低资源设定下灾难性遗忘和过拟合风险,且更容易在不同指令组合之间进行回溯和调试,为低资源 LLM 微调提供了一种更稳定、可操控的训练范式。

方法

Lius 方法的核心是将低资源语言的显式语言学知识注入大模型的指令微调过程,并通过持续指令调优 (CIT) 范式迭代提升翻译性能。

输入与指令设计

模型输入为 Kupang Malay 文本,利用双语词典的词汇和语义信息构建四种结构化指令模板:

  • 基于上下文的提示:用词典中提供的例句或搭配信息构造上下文,引导模型理解词义消歧。
  • 基于语义映射的提示:直接给出源词到目标词的对应关系,强化双语对齐。
  • 基于语音的提示:利用 Kupang Malay 的发音特征,辅助模型处理未登录词或拼写变体。
  • 列表-组-标签 (List-Group-Label) 提示:将词典条目按语义场分组并附加标签,促进模型归纳词间关系。

这些指令显式编码了词汇和语义特征,弥补了低资源场景下平行语料稀疏的不足。

训练范式:持续指令调优 (CIT)

与标准的一轮指令微调不同,CIT 采用迭代式训练:每一轮基于上一轮模型输出与真实译文之间的差异,动态调整指令组合与难度,逐步优化模型行为。具体步骤:

  1. 初始阶段使用全部指令模板训练基础翻译能力。
  2. 后续轮次根据上一轮的评估结果,对易错样本加大对应指令(如增多语义映射提示),并缩减已掌握任务的指令干扰。
  3. 每个迭代周期均保留历史指令集,防止灾难性遗忘。

输出与工程启示

最终得到模型 Lius,在 Kupang Malay 翻译任务上 BLEU 等指标超越标准指令微调模型 4-6 分,并超过 NMT 和多语言 LLM 基线 10-13 分。该范式不依赖大规模平行语料,仅需双语词典和少量单语数据,显著降低了低资源语言翻译系统的构建成本。

与同类方法的差异:相比于仅依赖人工编写指令或随机采样的指令微调,Lius 将语言学家习得的结构化知识(词典特征)以可迭代优化的形式融入训练循环,CIT 主动调整指令分布,而非静态使用固定指令集。

实验

实验设计

作者围绕低资源语言 Kupang Malay 构建了包含平行语料和单语语料的专用数据集,并系统设计了五类语言学驱动的指令模板:句子表示提示、上下文提示、语义映射提示、语音提示和列表-分组-标签提示。在此基础上,提出 Continual Instruction Tuning (CIT) 训练范式——使用这些提示对 LLM 进行迭代式指令微调,每一轮引入新的指令特征,逐步强化模型对低资源语言的结构与语义理解。

对比基线包括:标准指令微调(同一 LLM 骨架)、传统 神经机器翻译 (NMT) 模型(如 Transformer)以及多语言 LLM。评估涵盖自动指标、人类评分,并设计了三大鲁棒性测试(拼写错误、词删除、词乱序)和泛化实验(未见过的语言方向与翻译任务)。

关键发现

  1. CIT 显著优于标准指令微调:在多个自动评估指标上带来 4–6 分的绝对提升,显示迭代引入语言学知识比一次性微调更有效。
  2. 大幅超越 NMT 和多语言 LLM:即便在极低资源条件下,Lius 模型仍比强基线高出 10–13 分,验证了显式词典知识注入对翻译质量的决定性作用。
  3. 泛化与鲁棒性:模型对未见语言对和未见过任务展现出迁移能力,并在拼写干扰下保持性能,说明 CIT 学到的是深层语言表征而非表面统计模式。

与基线对比的深度解读

标准指令微调通常依赖通用任务描述,无法充分利用低资源语言的稀疏结构信息。CIT 将双语词典的词汇语义特征语音对应关系逐轮楔入训练,相当于用极小规模的高质量符号知识替代了大规模并行数据的缺失。相比多语言 LLM,Lius 避免了跨语言迁移中常见的负干扰,因为所有微调信号都集中在目标语言对。与 NMT 基线对比进一步表明,在平行语料极度匮乏时,LLM 的预训练语言能力结合结构化提示,比从头训练 NMT 更优,这为低资源翻译提供了一条数据高效、快速部署的新路径。

行业影响

落地场景

Lius 面向低资源语言翻译,天然适用于需要覆盖长尾语种的全球化产品。典型场景包括:

  • 电商多语言客服:将买家母语查询(如 Kupang Malay)实时翻译为运营团队通晓的语言,降低对人工翻译的依赖。
  • 内容平台用户生成内容(UGC)审核:自动翻译低资源语言的帖子、评论,实现一致的安全与质量把控。
  • 医疗援助机器人:在跨国援助场景下,把患者口述的方言症状翻译为标准诊疗语言,虽属低资源,但可通过 CIT 范式快速冷启动。

商业价值

模型显著提升了低资源翻译质量(超越 NMT 和 Multilingual LLM 10–13 点),直接转化为:

  • 降本:无需收集大规模平行语料,仅靠双语词典和少量单语数据即可迭代出可用系统,将冷门语言进入翻译服务的边际成本大幅压低。
  • 体验提升:使长尾市场用户获得接近主流语言的智能服务,减少因语言障碍导致的流失。
  • 增收:对于电商、社交平台,覆盖更多语言可直接扩大潜在用户群与交易量。

与现有产品/工作流的接口

CIT 是一种可叠加的训练范式,可嵌入已有 LLM 微调管线:

  • 模型层:以任何预训练自回归 LLM 为底座,注入 Instructional Linguistic 模板(利用词典构造语义、音系、上下文等多维提示),再通过 CIT 分批迭代。
  • 数据层:输入格式类似标准指令微调,便于与现有数据管理平台(如 Hugging Face Datasets)对接。项目已托管 模型与代码,可作为 Hugging Face Transformers 管线的一部分直接调用。
  • 评估与迭代:CIT 支持持续加入新构建的指令数据,适合在生产环境中根据线上反馈循环优化。

具体落地用例

  1. 全球化电商评论翻译:某跨境电商平台需将东南亚方言商品评价翻译为英语,用 Lius 的 CIT 方法从现有双语词典快速构建翻译模型,无需雇佣大量专业翻译人员,实现低成本上线。上线后,买家评价理解率上升,退货率因信息不对称减少而下降。
  2. 多语言客服知识库:SaaS 企业服务工具将低资源语言的知识库条目(如用户提交的故障报告)自动转译为英语,供全球支持团队复用。CIT 允许随着新语言的加入不断扩展模型能力,而不必从头重新训练整个系统。

局限

  • 该方法高度依赖针对 Kupang Malay 手工设计的双语词典特征(lexical and semantic features from a bilingual dictionary),当目标低资源语言缺乏类似结构和规模的词典时,提示模板的设计和迁移效果存疑。论文仅在 Kupang Malay 这一门语言上验证,未探索冷启动场景或跨语言泛化能力,难以推断该方法在其他语系或极度濒危语言上的适用性,限制了其作为一种通用低资源翻译解决方案的推广。
  • **Continual Instruction Tuning (CIT)** 引入迭代训练,但未讨论灾难性遗忘问题。在连续加载新的指令批次时,模型可能遗忘先前学到的翻译能力或通用语言知识。论文缺乏遗忘程度的量化分析以及缓解策略(如 replay、正则化),这在实际部署中可能导致模型性能不可预测或需要频繁重训,削弱其长期可用性。
  • 实验部分虽然展示了超越 NMT 和多语言 LLM 的显著优势,但比较对象较为基础(如标准 instruction-tuned 模型、通用 NMT 模型),未与专门为低资源场景设计的强基线(如数据增强、多任务学习或元学习的 NMT 方案)对比。此外,自动评估指标(BLEU 等)可能无法完全反映 Kupang Malay 这类形态复杂语言的翻译质量,缺少深入的错误分析和人类评估综合结论,高估了实际可用性。
论文Joanito Agili Lopo2026-06-10原文

相关内容