Jev 风格类型化决策模型中标签覆盖定义
类型化决策模型(typed decision model)针对一个固定问题作答:为若干由调用方定义的选项各返回一个概率。每个选项带一个短标签(label)和一段书面定义(definition),开发者正是在定义中陈述模型应遵循的规则。Jev 为路由、审核和分诊引入了这一接口,随后出现了多个开源实现;每当语言模型通过给标签字符串打分来充当分类器时,同一操作也会发生。我们研究这些权重可检视、可修补的开源实现,追问概率究竟跟随定义还是跟随标签,并把这种对标签的偏好称为选项标签偏置(option-label bias)。 在四个 open-weight typed decision 模型、三种从 Qwen2.5 骨干读取答案的方式、十一个分类任务,以及我们提出的合成路由套件 PolicyBench(其中规则只出现在定义里)上,答案主要由标签决定。删掉全部定义后准确率不变(laya-td 为 0.8559,原为 0.8487),而这些定义自身可支撑 0.7971;把选项改名为 A 和 B 后准确率提升 +0.1511 [+0.1377, +0.1646]。 有一个系统 von 不受影响,而两个代码库只在一处表达式上不同:laya 把每个选项写成 "{label}: {definition}",von 只写定义。在不改动任何权重的前提下双向修改该表达式,三个 laya checkpoint 完全不变(+0.0000 [+0.0000, +0.0000]),同时在 von 中制造出该效应:当标签与定义相矛盾时,其准确率从 0.8511 跌至 0.2281。此前的工作把这一失败归因于这些模型用以替代文本解码器的受限决策头;我们的结果将其定位在 prompt 渲染环节。我们还给出一个 two-call 测试,帮助实践者判断自己的模型属于哪种情况,并测量四种缓解措施的价值。
论文精读
TL;DR **开放权重 typed decision models 存在选项标签偏差:概率跟随标签而非定义**;本文定位根因是 prompt 中 `"{label}: {definition}"` 渲染,而非决策头,并给出两调用测试与缓解措施。
问题
问题背景
Typed decision models 已成为语言模型用于分类、路由、审核、分诊等任务的主流接口:调用方为每个类别提供短标签和书面定义,模型对输入返回各类别概率。业界关注的是模型能否稳定遵循开发者写在定义中的规则,而不仅是识别标签字符串。
现有方法局限
现有实现往往假设标签与定义语义一致,因此直接拼接 "{label}: {definition}" 作为选项表示。但本文通过跨四个开源模型、十一个分类任务和自建 PolicyBench 的消融发现:
- 删除全部定义后,laya-td 的准确率几乎不变(0.8559 vs 0.8487),说明定义并未真正参与决策;
- 将选项重命名为 A/B 后准确率上升 +0.1511,表明模型默认偏好标签本身的先验语义;
- 唯一不受影响的系统 von 的差异仅在于 prompt 渲染方式——它只写入定义而不写标签。
这表明问题不在常被归咎的 constrained decision head,而在提示词渲染层。现有方法缺乏针对标签偏置的诊断与缓解手段,导致开发者误以为定义在起作用。
为什么这个问题难/重要
标签先验偏置难以察觉:它不表现为显式错误,而是静默覆盖定义规则,使模型在标签与定义冲突时偏向标签。业界大量分类接口依赖标签字符串作为打分对象,这种偏置会直接导致规则失效、路由错误或审核漏判。权重不可解释使定位困难,而重新训练成本高。本文提出 两调用测试 可区分是决策头导致还是 prompt 渲染导致,并量化了四种缓解措施的价值,为实际部署提供了低成本诊断路径。
行业类比
在智能客服工单路由中,若分类器只看选项标签“投诉”而忽略定义中“仅限账单相关投诉”的限制,就会把产品功能咨询误路由到投诉队列——这正是标签覆盖定义的直接后果。
核心洞察
- - 在 Jev-Style Typed Decision Models 中,选项标签对模型输出的影响远超定义内容,形成 option-label bias。此前工作将这种失败归因于这些模型使用的 constrained decision head,但本研究通过对开放权重模型的消融实验显示,删除所有定义后准确率几乎不变(**laya-td**: 0.8559 对 0.8487),而重命名选项为 A/B 使准确率提升 +0.1511。这表明偏差根源于提示渲染而非决策头架构,挑战了架构决定论,并提示提示词表面格式本身就是关键变量。
- - von 与 laya 两款实现之间的行为差异可归结为一个字符串格式表达式:laya 将每个选项写为 `"{label}: {definition}"`,而 von 仅写定义。仅改变这一表达式,无需修改权重,就能使 laya 完全不变(+0.0000),或在 von 中制造出强烈偏差(准确率从 0.8511 降至 0.2281)。这揭示了当前模型对格式细节的极端敏感性,为实践者提供了一个精确的干预点,也说明评估和调试 typed decision models 时必须严格控制提示模板。
- - 论文给出一个两调用测试,让实践者判断自己的模型属于哪种偏差类型,并量化了四种缓解措施的效果:**arbitrary labels**、**null-state prior correction**、**instruction to ignore labels**、**two-rendering disagreement**。该测试无需访问权重或内部表示,只需比较两次调用的输出,即可快速诊断。量化结果避免了工程上的盲目试错,为路由、审核和分类等生产场景提供了可操作的决策依据。
方法
实验设计:分离定义与标签的贡献
输入为 typed decision model 的标准请求:问题描述、候选选项(每个选项含短标签 label 与自然语言定义 definition),模型输出每个选项的概率。核心问题:模型决策究竟遵循 definition 中的规则,还是被 label 的字面联想主导。
关键模块与操作
- 双通道消融:分别在四种开源权重模型(
laya-td、laya-sq、laya-gd、von)上执行三种扰动:- 删除所有
definition,仅保留label; - 删除
label,仅保留definition; - 将选项重命名为无意义的
A/B,观察准确率变化。
- 删除所有
- 合成基准 PolicyBench:作者构建的合成路由任务,其中正确规则只出现在
definition中,label不携带任务信息,用于隔离标签优先倾向。 - 代码级干预:定位两个代码库中选项渲染方式的唯一差异——
laya使用"{label}: {definition}"拼接,von只渲染definition。互换该表达式,不修改任何权重,检查模型行为是否反转。 - 度量指标:主要用分类准确率(含置信区间),并分析置信度分数的分离度;额外采用三种 readout 方式(生成式、两种打分式)交叉验证。
输出与诊断
实验输出为各模型在 PolicyBench 与 11 个分类任务上的准确率对比,以及消融前后的行为差异。核心发现:多数模型在删除 definition 后准确率几乎不变,说明答案主要由 label 驱动;而交换渲染表达式可让 laya 变为完全不变,让 von 从无偏走向强标签偏置。作者最后提出一种 two-call test:对同一输入分别用完整渲染与仅 definition 渲染做两次推理,若结果不一致即可判定模型存在选项标签偏置。
与同类评估工作的差异:本文不引入新模型或新训练目标,而是通过权重冻结下的 prompt 渲染干预与消融基准,将标签偏置定位到输入表示层,而非决策头或骨干网络。
实验
实验设计
作者在四个开放权重 typed decision models 上,采用 Qwen2.5 骨干的三种答案读取方式,评估 11 个分类任务和新引入的 PolicyBench 合成路由套件。通过删除定义、重命名标签、反转标签定义、修改 prompt 渲染表达式等干预,分离定义通道与标签通道的贡献。
关键发现
结果呈现强烈的 选项标签偏差。删除所有定义对 laya-td 准确率影响极小(0.8559 vs 0.8487),而仅靠定义可获得 0.7971;重命名选项为 A/B 使准确率提升 +0.1511。von 系统不受影响,差异在于代码中一个表达式:laya 写 "{label}: {definition}",而 von 只写 definition。改变该表达式后,laya 达到完全标签不变性(+0.0000),von 则在标签矛盾时准确率暴跌至 0.2281。这表明偏差来自 prompt 渲染而非决策头。
与基线对比
早期工作将失败归因于受限决策头,本文通过开放权重与代码修改,将根源定位到 prompt 模板。这一发现为实践者提供了两调用测试与四种缓解措施,并量化其价值,强调分类任务中标签字符串可能成为快捷特征,需显式控制。
行业影响
落地场景
Typed decision models 广泛用于内容审核、客服路由、医疗分诊、金融反欺诈等固定选项分类任务。论文揭示的 option-label bias 表明,当 prompt 以 "{label}: {definition}" 格式渲染时,模型可能主要跟随标签而非定义,导致决策偏差。实际部署中应检查渲染格式,采用仅定义或任意标签(如 A/B)以消除偏见。
商业价值
修正该偏见可显著提升分类准确率(论文中标签改为 A/B 后准确率提升 +0.1511),直接减少错误路由、漏检和人工复核成本。对于高频调用场景(如客服自动分流),准确性提升意味着更低的运营成本和更好的用户体验。同时,论文提出的 两调用测试 可低成本评估模型是否受影响,避免上线后风险。
与现有工作流集成
该发现可无缝集成到现有 LLM 推理管线,无需重新训练或更换模型。工程师只需调整 prompt 模板,将选项标签语义中性化,或在部署前运行两调用测试。可将该测试纳入 CI/CD 质量门禁,配合 PolicyBench 进行回归验证。
具体落地 use case:
- 电商平台的智能客服将用户消息分类为“退款”“物流”“产品咨询”等,若使用
"{label}: {definition}"格式,模型可能偏向高频标签导致误路由,改为仅定义或 A/B 标签后路由准确率提升。 - 内容平台的违规审核中,模型需判断“仇恨言论”“暴力”“正常”,若标签偏见导致“正常”类过度触发,会漏掉违规内容,修正后提高审核召回率。
局限
- 论文明确将研究限制在开源可检查权重的模型上,因此结论无法直接推广到闭源商业模型或 API 驱动的分类器。实验全部基于 Qwen2.5 backbone,虽然覆盖了多个 checkpoint 和 readout 方式,但未涉及其他架构(如 Llama、Mistral 或非 Transformer 模型),这限制了发现是否具有跨架构普适性。此外,PolicyBench 是作者自行构建的合成路由套件,其任务分布与真实业务中复杂的规则定义可能存在差异,外推时需要谨慎。
- 实验设计虽然揭示了 prompt 渲染中的 label-definition 连接是偏差根源,但并未深入解释为何同一代码库的不同 checkpoint 会表现出方向相反的效应(如 laya-td 和 laya-od 在 PolicyBench 上的反差),也没有从机制层面分析注意力或表征空间中标签如何覆盖定义。给出的四种缓解措施中,两渲染不一致(M4)需额外调用模型,可能带来显著时延和成本,论文未定量评估其工程开销;指令忽略标签(M3)的效果也依赖于模型遵循指令的能力,在较弱模型上可能失效。
- 与同类工作对比,此前研究多将 typed decision model 的失败归因于 constrained decision head 无法进行文本解码,本文通过实验纠正了这一认识,但并未提出根治方案,只是提供了诊断工具和缓解手段。对于开发者而言,这些缓解措施并未被整合进现有框架的标准流程,且未在真实业务数据集上验证,因此实际落地价值仍有待观察。此外,论文只分析了 laya 和 von 两个代码基,未覆盖更广泛的开源实现(如基于不同 prompt 模板或决策头的变体)。