论文

价值的几何:面向语言模型伦理偏好对齐的任务向量组合

价值的几何:面向语言模型伦理偏好对齐的任务向量组合

大语言模型(LLM) 被越来越多地部署到需要权衡相互冲突的道德价值的应用中,但即便是强模型也表现出隐藏偏见,以及跨语言指令跟随的脆弱性。 为此,我们构建了一个包含 12,000 个二选一二难困境实例的数据集,覆盖三组成对价值冲突:Honesty vs. Justice、Justice vs. Autonomy、Autonomy vs. Honesty,并翻译为 Hindi、Arabic、Spanish、Chinese 四种语言,用于探测跨语言行为。基准测试显示,GPT-5-mini 在五种语言中、无政策提示时一致偏好 Honesty 而非 Autonomy;Llama-3.2-1/3B 则表现出强烈的首选项偏见,而普通微调与 Direct Preference Optimization 微调都能有效消除该偏见,将准确率提升至 98% 以上。 为将数据集相关性学习的效果与抽象价值本身解耦,我们提出基于 task vector transfer 的实验:在计算某价值偏好方向的任务向量后,将其对通用指令跟随向量做正交化。实验表明,该方法能有效分离出特定价值偏好的方向,并可成功用于执行 task arithmetic,从而得到一个立场相反的模型。

论文精读

TL;DR 论文构建了 12,000 条跨语言道德困境数据集,揭示模型价值偏好偏见;并提出任务向量正交化方法,可独立操控特定价值方向,实现相反立场转移。

问题

问题背景
LLMs 越来越多被部署到内容审核、政策建议、个性化咨询等需要道德判断的场景。业界关注模型在面对冲突价值时能否稳定、可解释地做出符合预期的权衡,尤其是跨语言场景下的一致性。

现有方法局限
当前对齐主流依赖 SFT、RLHF 与 DPO,但这些方法在价值冲突场景下暴露至少三点不足:

  • 隐性偏好偏差:GPT-5-mini 在五种语言中一致偏向 Honesty 而牺牲 Autonomy,说明模型内部存在未对齐的默认价值排序,仅靠指令微调无法消除。
  • 表面偏差主导:Llama-3.2 1B/3B 存在强 first-option bias,普通微调虽将准确率推至 98% 以上,但可能只是学习了数据集中的选项位置相关性,而非真正理解抽象价值。
  • 任务耦合严重:常规微调无法分离“遵循指令”与“特定价值偏好”两个方向,导致难以将某一价值偏好迁移到相反立场,也无法实现可控的价值切换。

为什么难/重要
道德价值本身具有语境依赖性与不可通约性,不同价值对(如 Honesty vs. Justice)需要模型做出可解释的权衡。跨语言场景进一步放大难度:指令跟随在不同语言间表现脆弱,模型可能对同一价值判断因语言而异。业界对 AI 安全与伦理对齐的关注持续上升,需要可审计、可编辑的机制,而不是仅靠更多数据掩盖偏差。因此,如何解耦任务向量中的通用指令方向与价值偏好方向,成为实现细粒度价值控制的关键技术挑战。

行业类比
类似自动驾驶中的电车难题 决策系统,需要根据法规或用户偏好动态调整“保护乘客”与“保护行人”的优先级,通用指令微调无法提供这种细粒度的价值切换能力。

核心洞察

  • 任务向量正交化能分离纯粹的价值偏好方向,使模型可通过任务算术实现相反立场而不需额外微调。与常规 SFT/DPO 将指令跟随、位置偏好与价值取向混为一谈不同,该方法先将价值偏好任务向量投影到通用指令跟随向量的正交补空间,再用于模型编辑。这证明价值偏好是权重空间中的可加方向,且能去除数据集中因选项顺序、措辞等带来的伪相关,为可控伦理对齐提供了更干净的操纵接口。
  • 基准测试揭示了小模型强烈首选项偏置和 GPT-5-mini 跨语言一致的价值倾向,表明伦理偏好评估必须显式控制这些混杂因素。Llama-3.2-1B/3B 零样本几乎总是选择第一个选项,掩盖真实价值判断;GPT-5-mini 则在五语种中一致偏向 Honesty 而牺牲 Autonomy。简单的 SFT 和 DPO 虽能将准确率提升至 98% 以上,但可能只是记住数据集中的位置与措辞相关,而非学到抽象价值。该多语种两难数据集为此类诊断提供了必要测试床。

方法

输入与数据构建

本文构建包含 12,000 个两难困境实例 的数据集,覆盖 Honesty vs. Justice、Justice vs. Autonomy、Autonomy vs. Honesty 三种价值冲突对。每个实例给出两个选项,对应不同价值倾向,并翻译为 Hindi、Arabic、Spanish、Chinese。

关键模块

  1. 基线评测:在 GPT-5-mini 与 Llama-3.2-1/3B 上测试无策略引导时的价值偏好,发现 Llama 模型存在强 首选项偏置。
  2. 监督微调与偏好优化:使用 LoRA SFT 和 DPO 对 Llama 模型进行参数高效微调,以消除偏置并提升价值对齐准确率至 >98%。
  3. 任务向量提取与正交化:对经过微调的模型计算特定价值偏好方向的 任务向量(task vector),随后将其与 通用指令跟随向量 进行正交化,去除共性指令成分,隔离纯粹的价值偏好方向。
  4. 任务算术:利用正交化后的向量执行任务算术,可得到相反价值立场的模型,无需额外训练。

输出

最终输出两种能力:一是通过微调获得高度对齐特定价值偏好的模型;二是通过任务向量算术转移获得相反立场的模型,验证了价值偏好方向的可加性与可分离性。

与同类方法的差异:不同于单纯依赖 SFT/DPO 拟合数据集相关性,本文通过正交化分离指令跟随与价值偏好方向,实现更细粒度的价值操控。

实验

实验设计简述

构建 12,000 实例的道德困境数据集,覆盖三种价值冲突对:Honesty vs. Justice、Justice vs. Autonomy、Autonomy vs. Honesty,并翻译为 Hindi、Arabic、Spanish、Chinese 四种语言。基准模型为 GPT-5-mini 与 Llama-3.2 1B/3B。实验包含两条路径:一是 LoRA 监督微调(SFT)与 Direct Preference Optimization(DPO),用于消除位置偏差;二是任务向量迁移,通过正交化分离价值偏好方向与一般指令遵循方向,并进行任务算术获得相反立场的模型。

关键发现

GPT-5-mini 在无策略提示下于所有五种语言中一致偏向 Honesty 而非 Autonomy,说明跨语言道德偏好存在系统性偏差。Llama-3.2 1B/3B 表现出强烈的首选项偏置(first-option bias),但经 SFT 或 DPO 微调后准确率提升至 98% 以上,有效消除该偏置。任务向量迁移实验显示,对价值偏好方向的正交化能够解耦数据集中的表面相关性,成功提取特定价值偏好的抽象方向,并可用于任务算术翻转模型立场。

与基线的对比解读

与直接微调相比,任务向量迁移 引入正交化约束,避免模型仅记忆训练标签相关性,显式建模价值方向,在可解释性与可控性上更具优势。SFT 与 DPO 在本实验中均达到高准确率,但二者差异未深入比较;DPO 更适合偏好对齐且无需显式负样本。GPT-5-mini 的跨语言一致偏置提示,即使大规模模型也存在隐含道德倾向,对产品级价值对齐策略提出了更细粒度控制的需求。

行业影响

落地场景

  • 内容安全与审核系统:在处理举报、隐私与公平冲突时,模型需按平台政策权衡诚实、正义、自主。该工作提供的多语言两难数据集和 task vector 方法,可训练或编辑模型以符合特定价值立场。
  • 对话式 AI 助手:医疗、法律、教育场景中,助手常面临伦理两难。利用 DPO 或 task vector 可让模型稳定执行机构规范,避免跨语言行为漂移。

商业价值

  • 降低合规风险:跨语言一致性减少因文化差异导致的误判和公关危机,节省人工审核成本。
  • 提升信任与体验:将偏好准确率提升至 >98%,显著减少用户投诉,增强产品可靠性。
  • 低成本模型迭代:通过 task vector 算术,可在不重新训练的情况下切换模型价值倾向,大幅降低迭代开销。

与现有工作流的接口

  • 可在现有 LoRA / DPO 微调栈上直接使用该数据集,多语言版本无需额外翻译。
  • 计算任务向量后,将其与通用指令跟随向量正交化,得到价值偏好向量;通过简单加法注入基础模型。相比推理时的 activation steering,该参数空间编辑适合离线部署和版本管理。
  • 可集成到 Hugging Face transformers 与 PEFT 生态,提供一键式价值配置切换,方便产品团队按业务需求调整模型行为。

局限

  • **数据集覆盖有限**:论文构建的数据集仅覆盖三对价值冲突(Honesty vs Justice、Justice vs Autonomy、Autonomy vs Honesty),每个样本为二选一的虚构 dilemma,缺乏真实世界中多价值同时冲突、多利益相关方的复杂情境;翻译为五种语言但未充分验证文化适配性,跨语言结论可能受翻译质量影响。此外,数据来源为合成模板,可能带有作者的价值预设,导致模型学习到的是模板表面模式而非深层价值推理。
  • **任务向量方法局限**:正交化后得到的价值偏好方向虽能实现相反立场转换,但该实验只在两个小模型(Llama-3.2-1B/3B)上验证,且仅测试了“反向”这一极端操作,未探索细粒度偏好调节(如偏好强度、多价值混合)或插值效果。同时,用于正交化的“一般指令遵循向量”依赖特定任务构造,其通用性未经其他指令数据集验证;方法在更大模型或不同架构上的可迁移性不确定。
  • **实验设计与基线局限**:论文仅选择 GPT-5-mini 和小规模 Llama 模型作为基准,未覆盖更多主流开源模型(如 Mistral、Qwen、Gemma)或更大参数模型,结论的代表性有限。SFT/DPO 在合成数据上达到 >98% 准确率,但未报告在分布外任务或真实用户偏好上的泛化表现,存在过拟合风险。与其它价值对齐方法(如 constitutional AI、steering vectors)的比较缺失,削弱了方法优越性的说服力。
论文Utkarsh Agarwal2026-09-17原文

相关内容