面向 LLM 偏好对齐的零阶范式
直接偏好对齐 方法因计算与内存效率高,被广泛用于将 LLM 与人类偏好对齐;但在 似然位移(likelihood displacement)下,如何从似然差较小的偏好对中提取信息值得重新思考。 本文提出并分析 ComPO(Comparison-based Preference Optimization),一种基于 比较 oracle 的零阶对齐方法:它不直接优化可微的偏好损失,而是从偏好对中提取方向性信息。我们为基本离线方案建立了收敛性保证,条件包括平滑性、梯度稀疏性,以及 oracle 与潜在目标间的兼容性。 进一步提出 在线 ComPO:保留离线比较机制,并利用未标注的策略生成做相对参考策略的 reverse-KL 控制。基于偏好微调的覆盖度视角,我们在局部覆盖与同分布成对奖励准确率下,为基本约束方案建立了性能保证。 在 Mistral、Llama、Gemma-2、Qwen3、Gemma-3 等模型上的实验显示,该方法优于现有直接对齐方法(含 长度控制胜率),成对级诊断结果也与缓解似然位移的证据一致。
论文精读
TL;DR ComPO 以比较 Oracle 实现零阶偏好对齐,仅从偏好对提取方向信息而不直接优化对数似然差,以此缓解 likelihood displacement,并在多个 LLM 上取得优于 DPO/SimPO 的长度控制胜率。
问题
问题背景:LLM 偏好对齐已成为 post-training 的核心环节,直接偏好优化(DPO)系列因免去显式奖励模型、计算与内存效率高而受到广泛采用。
现有方法局限:DPO 及其变体(如 SimPO)直接优化 chosen 与 rejected 之间的可微偏好损失,但存在 likelihood displacement:模型可能提升 chosen 似然却未能有效降低 rejected 似然,或过度依赖反向 KL 约束,导致输出长度偏差、重复等退化。当偏好对中 chosen 与 rejected 的似然边际较小时(即两者概率接近),可微损失的梯度信号弱且噪声大,难以提取可靠的方向信息;这类边际小的偏好对在实际数据中占比不低,却被现有方法低效利用甚至忽略。
为什么难/重要:偏好数据本身稀疏、噪声高,边际小的样本往往包含人类判断中的细微差异,丢弃或误用会损害对齐质量。同时,直接优化损失容易受到 likelihood displacement 的干扰,使模型在分布外表现不稳定。业界需要在保持计算效率的前提下,设计一种能利用弱偏好信号、不依赖显式奖励模型的替代机制。
行业类比:类似推荐系统中利用用户隐式点击/跳过对比信号做 pairwise ranking,不直接优化点击率,而是通过比较 oracle 提取偏好方向,从而减少偏差和过拟合。
核心洞察
- ComPO 将偏好对齐重构为零阶优化问题,通过 comparison oracle 仅利用成对比较结果(而非可微偏好损失)提取梯度方向,从而规避 likelihood displacement 现象。其独特性在于:与 DPO/SimPO 等直接优化 chosen/rejected 概率差的方法不同,ComPO 不强制增大或减小具体概率值,因此在偏好对似然边际很小(模型难以区分优劣)时,仍能稳定地从比较信号中获取方向性信息,避免因过度拟合小边际样本而损害已对齐的能力。
- 在线 ComPO 保留离线零阶比较机制,并引入未标注策略生成进行 reverse-KL 控制,使得对齐过程在扩大策略覆盖的同时限制偏离参考策略,且理论保证依赖于局部覆盖和分布内成对奖励准确性。这一设计区别于传统在线 DPO 或 PPO 类方法:不需要显式 reward model,也不直接优化可微损失,而是用 oracle 比较作为零阶信号,并通过 reverse-KL 项约束更新方向;其性能界将覆盖条件与零阶估计误差解耦,为低标注成本下的在线对齐提供了新的理论工具。
方法
核心思想
ComPO 采用 零阶优化 (zeroth-order) 范式,不直接对偏好损失求梯度,而是借助 比较预言机 (comparison oracle) 提取方向信号。
输入与关键模块
- 输入:偏好对 (chosen vs. rejected)、参考策略
π_ref、在线模式下额外使用策略自身生成的未标注样本。 - 比较预言机:接收两个策略输出,返回哪一个更符合人类偏好,输出离散偏好方向而非梯度。
- 零阶扰动估计:对当前策略参数施加随机扰动,生成多个扰动版本,让比较预言机在多对输出上给出偏好排序,聚合这些比较结果得到更新方向。
- 离线 ComPO:仅利用已有偏好对,在平滑性、梯度稀疏性以及 oracle 与潜在目标兼容的条件下保证收敛。
- 在线 ComPO:保留离线比较机制,引入策略自生成样本进行 reverse-KL 控制,防止偏离参考策略过远,并从局部覆盖和分布内成对奖励准确率角度提供性能保证。
输出与效果
输出为更新后的策略参数,提升 length-controlled win rate 等指标,并通过 pair-level 诊断缓解 likelihood displacement。
与 DPO/SimPO 等直接优化可微偏好损失的方法不同,ComPO 从比较 oracle 中提取零阶方向,避免 likelihood margin 很小时产生的梯度扭曲。
实验
实验设计
论文在 Mistral、Llama、Gemma-2、Qwen3、Gemma-3 等多模型上评估 ComPO。离线设置中,将 ComPO 用于增强 DPO 和 SimPO,并进行消融研究(扰动数量、梯度阈值、噪声对数量、效率与兼容性、成功扰动与裁剪阈值 λ)。在线设置保留离线比较机制,利用无标签策略生成做 reverse-KL 控制。
关键发现
实验报告了长度控制胜率(length-controlled win rates)的改进,配对级诊断(pair-level diagnostics)显示 ComPO 缓解了 likelihood displacement 现象。相比直接对齐方法,ComPO 提取小似然边际偏好对的方向信息,且计算/内存效率更高。
基线对比
与现有的直接偏好对齐方法(如 DPO、SimPO)相比,ComPO 的主要差异是不直接优化可微偏好损失,而是基于比较预言机的零阶信号。这一设计在偏好对似然边际较小时更能保持有用信息,实验上体现为在多个模型上一致的胜率提升,尤其体现在长度控制场景。工程启示:当偏好数据中存在大量低置信度样本时,ComPO 这类零阶方法可避免梯度反传的过度调整,适合在资源受限或数据噪声较高的对齐流程中应用。
行业影响
落地场景
ComPO 适合需要低资源偏好对齐的产品,如对话式客服、内容平台推荐解释、教育辅导答疑。其 zeroth-order 比较机制避免了对偏好损失的可微优化,尤其适用于只有粗粒度比较标注(好/差)且数据量较小的场景。
商业价值
- 降本:无需存储激活或计算偏好损失梯度,降低显存和时间成本,使中小团队也能频繁对齐模型。
- 体验提升:实验表明在 length-controlled win rate 上优于 DPO/SimPO,缓解似然位移,减少模型靠堆长度取巧,提升真实语义偏好拟合。
- 迭代加速:离线方案能直接增强现有 DPO/SimPO 流程,在线方案引入 reverse-KL 控制,加快部署节奏。
接口集成
ComPO 的离线方案 可作为额外信号与现有 DPO/SimPO 训练组合:保留原有偏好数据集,增加比较 oracle 或扰动生成得分即可。在线方案 利用未标注策略生成做 reverse-KL 控制,适合嵌入 RLHF 或 best-of-n 采样框架。在 TRL、Axolotl 等训练栈中,可将 ComPO 实现为自定义 loss 项或后处理模块,无需重构数据管道。
具体 use case:
- 电商推荐理由生成:用点击/购买的偏好对训练推荐解释,ComPO 能抑制冗长理由,提升用户点击率。
- 企业客服自动摘要:利用人工“好/差”比较标注,降低标注成本,同时让摘要更贴合质检标准。
局限
- ComPO 在离线场景下依赖 comparison oracle 提供方向信息,但 oracle 的质量与获取成本未被充分讨论。论文仅假设 oracle 与潜在目标兼容,并需满足 smoothness、gradient sparsity 等条件,这些假设在真实 LLM 中往往难以验证或满足。尤其梯度稀疏性在 Transformer 中通常不成立,可能限制理论收敛保证的实际适用性。此外,当偏好对似然边际很小时,oracle 本身可能带有噪声,如何从噪声中稳定提取方向信息仍缺少深入分析。
- 在线 ComPO 的性能保证建立在 local coverage 和 in-distribution pairwise reward accuracy 之上,这两个条件在动态策略更新过程中难以持续成立。随着策略偏离参考分布,局部覆盖可能失效,导致 reverse-KL 控制不足。实验部分主要汇报长度控制胜率,并未全面评估安全性、事实性等对齐维度,且基线对比集中在 DPO、SimPO 等直接偏好方法,缺乏与 RLHF、best-of-n 等强基线的横向比较,限制了关于方法优越性的结论广度。
- ComPO 的 zeroth-order 机制引入了额外超参数(如扰动数量、梯度阈值、噪声对数量),这些超参数对性能影响显著,且需要针对不同模型和数据集进行调整。论文虽然做了消融实验,但未提供自动化调参策略或启发性指导,工程落地时可能产生较高的调参成本。另外,方法目前验证的模型规模多在 7B 至 13B 量级,是否能够扩展到数十亿参数以上的超大规模模型,以及 zeroth-order 估计在大模型上的计算开销是否可控,尚缺乏实证。