论文

漂移约束优化:指令模型微调中只有方向重要

漂移约束优化:指令模型微调中只有方向重要

微调 instruct 模型常能提升目标任务表现,但同时会引入相对参考模型的行为漂移(behavioral drift),进而损害模型原有能力。本文不把漂移视为优化过程的失控副产物,而是在优化前先设定一个行为漂移预算,并追问:在该预算内如何最大化目标任务性能? 局部上,行为漂移在参考模型处诱导出一种共享几何结构,漂移预算则定义了该空间中的边界。在此空间中,漂移决定了与参考模型的距离,而更新方向成为唯一剩余的自由度。因此,微调更新可以通过其方向效率进行比较,微调自然被重新表述为一个方向选择问题。这一重构给出一个明确的预测:改变可访问的方向,会定性改变微调结果。 我们在严苛的 QA-only 设定下检验该预测:强 instruct 模型仅用最终答案微调,却在推理时仍需生成多步推理。尽管存在这种错配,一个粗粒度的层选择探针扭转了 QA-only 微调的失败,并揭示出有效方向的存在——多个相邻配置在提升目标性能的同时,保留了推理与通用能力。在 Qwen3-8B 与 Qwen3-14B 上,这些方向显著提升了科学推理与多语言翻译能力。 在 100 多种语言上,所得模型匹配或超越了专用翻译系统,并为后续强化学习提供了更强的初始化。结果表明,微调的关键不只是模型改变了多少,而是这些改变被花在了哪里。代码见 https://github.com/CONE-MT/DCO,模型见 https://huggingface.co/collections/LLaMAX/dco 。

论文精读

TL;DR 本文提出微调的核心不是改变多少,而是朝哪个方向改变。在行为漂移预算下,仅通过层选择方向即可在 QA-only 监督下大幅提升科学推理与多语言翻译,匹配专用系统。

问题

问题背景

当前指令微调领域在追求目标任务性能提升的同时,越来越关注如何保持参考模型的通用行为,避免因微调导致的能力退化或行为漂移。

现有方法局限

  • 常用做法如 KL 散度正则化 或 LoRA 等低秩约束,通常将漂移视为优化中的副作用,通过惩罚项或参数限制来控制更新幅度。但这类方法缺乏对漂移预算的精确控制:KL 惩罚强度难以直接映射到可接受的漂移范围,LoRA 的秩约束也主要限制参数更新规模,并未区分更新方向。
  • 传统框架下,微调被看作在参数空间中寻找一个接近参考模型且目标性能好的点,但忽略了局部几何结构:漂移决定了距离参考模型的远近,而更新方向是剩余的自由度。现有方法大多在目标函数中隐式地混合了方向与步长,无法系统性地探索高效方向。
  • 论文中的实验表明,仅用最终答案监督微调(QA-only)会导致模型丢失多步推理能力,而简单的层选择探针却能逆转这一失败,说明方向选择比更新幅度更关键,但这一维度长期被忽视。

为什么问题难/重要

  • 漂移与目标性能在高维参数空间中存在复杂耦合:参考模型附近的行为变化并非各向同性,不同方向上的相同漂移预算可能带来截然不同的能力变化。
  • 工业界部署模型时,微调后的稳定性至关重要,不希望新任务能力提升以牺牲既有安全行为或通用推理为代价。因此,将漂移作为显式约束、将微调重新表述为方向选择问题,为可预测的模型更新提供了新范式。
  • 该问题对后续强化学习初始化也有影响:好的方向不仅提升当前性能,还能为 RL 阶段提供更优起点。

行业类比

类似于自动驾驶感知模型适配新场景:既要学会识别新障碍物,又不能破坏对原有交通标志的判断,方向选择决定了模型能力“转向”的效率,而非单纯改变多少。

核心洞察

  • 微调应被视为在参考模型局部几何中的方向选择,而非无约束的权重更新。 常规微调隐式地允许所有方向更新,导致漂移不可控;本文通过预先设定 **漂移预算**,将优化空间限制在参考模型附近的共享坐标系,使得更新方向成为唯一可控变量。这种视角将微调从损失最小化转变为方向效率最大化,揭示了方向选择对保持通用能力的决定性作用,为工程上如何安全微调 instruct 模型提供了新的设计原则。
  • 有效方向的存在与可发现性:通过粗粒度层选择性探针可以找到能够逆转 QA-only 微调失败的方向,这些方向能显著提升目标性能且保持推理和通用能力。 这一发现挑战了“弱监督微调必然损害推理能力”的假设,表明即便只有最终答案监督,只要选择正确的参数子集方向,也能引导模型保持多步推理。与依赖 KL 正则化或数据混合的方法相比,方向选择直接从几何结构入手,且方向模式跨模型迁移,为低资源场景下的微调提供了高效路径。

方法

输入与问题设定

给定参考指令模型(如 Qwen3-8B / Qwen3-14B)、仅含最终答案的 QA-only 监督数据,以及预设的行为漂移预算(以 anchored KL 散度 度量参考模型与微调模型在行为分布上的差异)。漂移预算在优化之前明确指定,构成优化约束的硬边界。

关键模块

  1. 行为坐标系构建:将参考模型附近的行为漂移映射到局部共享几何空间,该空间锚定参考模型。漂移向量的大小决定距离参考模型的远近,方向则编码更新类型。由此建立微调更新的共享表示,使不同更新可在同一坐标系下比较。

  2. 方向选择框架:在漂移预算内,目标性能提升取决于更新方向而非仅步长。定义 方向效率 为单位漂移代价带来的性能增益,将微调重新表述为方向选择问题。不直接学习标量步长,而是从参数空间中选择可访问的方向族,例如通过 层选择性调优(layer-selective tuning) 仅更新特定层或参数子集,获得结构化方向。

  3. 方向族探测:采用粗粒度层选择性探针(layer-selective probe)遍历不同层组合,验证高效方向的存在性。发现有效方向并非孤立,而是形成邻近方向族,且方向模式可跨模型迁移。层分离程度控制效率-性能权衡,方向组合方式影响最终效果。

输出

微调模型在严格漂移约束下,在 QA-only 弱监督下实现目标性能显著提升,同时保留多步推理能力与通用能力。例如在 100+ 语言翻译任务中匹配或超越专用系统。

与同类方法的差异点:传统微调通常将 KL 惩罚或正则化项加入目标函数间接限制漂移,本文则显式指定漂移预算并在几何上操作更新方向,将优化重心从“走多远”转移到“往哪走”,从而在严格约束下仍能有效提升目标性能。

实验

实验设计

在 QA-only 监督 下微调 Qwen3-8B 和 Qwen3-14B,仅使用最终答案作为损失信号,但要求模型在推理时生成多步推理。作者预先设定行为漂移预算(约束参考模型附近),将微调重新表述为 方向选择 问题;通过 coarse layer-selective probe 识别高效更新方向,并对比不同方向家族的影响。

关键发现

  • 直接 QA-only 微调会导致模型无法生成推理链,但选择有效方向(粗粒度层选择)可逆转失败,显著提升科学推理性能。
  • 在多语言翻译上,使用这些方向的模型在 100+ 种语言 上匹配或超越专用翻译系统,且为后续 RL 提供更强初始化。
  • 分析表明,在相同漂移预算下,方向选择比幅度控制更重要;有效方向并非孤立,存在邻近配置也能保持性能。

与基线对比

传统方法将漂移视为约束或正则化,而本文将漂移转化为几何边界内的方向自由度。相比 KL 正则化 或目标正则化,几何控制直接约束更新方向,在同等漂移下获得更高目标性能。实验证实 “微调不只是改变多少,而是改变花在哪里” 这一观点,为工程上高效微调提供了新视角:优先设计更新方向,而非仅调学习率或正则系数。

行业影响

落地场景

该方法适用于在保留通用能力的同时提升特定任务性能的场景,如多语言客服、内容审核翻译、医疗辅助诊断、金融文档分析。电商平台需多语言商品描述自动翻译并保持对话安全;内容平台需多语言摘要且不牺牲基础能力。DCO 通过设定行为漂移预算,在弱监督(仅 QA 对)下找到高效更新方向,避免灾难性遗忘。

商业价值

降本:单一模型覆盖 100+ 语言,替代多个专用翻译系统,减少部署运维成本;减少性能退化导致的回归测试与人工标注开销。增收:快速上线新语言市场或任务,扩大用户覆盖。体验提升:提升任务精度同时保留通用对话推理能力,减少“模型变笨”投诉,提高用户粘性。

与现有产品/工作流的接口

可集成进现有微调流水线:在 PEFT(如 LoRA)基础上增加方向选择约束,通过少量探针确定有效方向;与 MLOps 平台结合,训练中监控行为漂移(KL 散度)自动调整方向预算;作为 RL 初始化模型提升效率。用户可调用 DCO GitHub 和 Hugging Face 模型集合,无需大改训练框架。

具体用例

  • 全球电商多语言客服:用 DCO 微调 Qwen3-8B,仅用问答对提升多语言回复质量,保留安全对齐,服务多语言客户,降低本地化成本。
  • 内容平台自动字幕翻译:对视频字幕实时翻译与质量评估,DCO 模型在低资源语言上优于专用翻译系统,减少第三方 API 依赖。

局限

  • 论文承认的局限:当前方法仅在 QA-only 弱监督场景下验证,且主要实验基于 Qwen3-8B 与 Qwen3-14B 两个模型规模。虽然覆盖了科学推理和多语言翻译,但未在更广泛的指令微调任务(如代码、对话)或更大参数模型上验证,因此**方向选择**框架的普适性尚待确认。另外,层选择性探测需要额外的计算开销与超参选择(例如哪几层、何种配置),实际部署时可能需要针对不同基座模型进行调整,增加工程复杂度。
  • 可推断的局限:方法依赖参考模型附近的局部几何假设,即 drift budget 较小、行为变化在高斯近似下成立。当目标域与参考模型行为差异较大(例如从通用助手转向高度专业领域)时,局部线性假设可能失效,方向选择的效率下降。此外,论文主要比较了 objective regularization 和 layer-selective tuning,但未与 LoRA 等参数高效微调方法在相同 drift 约束下进行系统对比,因此其相对收益可能被高估。
  • 与同类工作对比的弱点:文章提出的方向选择框架目前主要提供了一种新的视角和启发式层选择策略,尚未形成可即插即用的通用算法。相比之下,LoRA 等方法提供明确的低秩参数化,便于与现有训练流程集成;而本文方法仍需要用户手动指定或搜索有效方向,门槛较高。另外,实验仅在两个 Qwen3 模型上开展,缺乏对不同基座模型(如 Llama、Mistral)的跨架构验证,结论的外推性有限。
论文Fei Yuan2026-09-12原文

相关内容