论文

大型语言模型对自己的回答过于自信

大型语言模型对自己的回答过于自信

已有研究表明,指令微调 后的大型语言模型(LLMs)校准性比基础预训练模型更差。然而,广泛使用的聊天模板 对对话式 LLMs 校准性的影响尚不清楚。本文通过解耦后训练算法 和聊天格式 的影响,探究了导致校准偏差的机制。 研究发现,尽管指令微调从根本上损害了校准性,但聊天模板通过一种“所有权偏见”(ownership bias)进一步加剧了问题——模型对自己生成的答案比用户提供的相同答案表现出显著更高的置信度。在六个近期开源 LLMs、三个基准测试和三种置信度获取方法上的大量实验表明,模型对自己的回答置信度最高可提升 26%。 基于这一发现,我们提出一种简单的推理策略:在获取置信度时,将模型自己的回答重新表述为用户输入。该方法无需重新训练即可显著降低过度自信,并将校准性提升多达 26%,缩小了基础模型与指令微调模型之间的差距。

论文精读

TL;DR 指令微调 LLM 对自己的回答存在所有权偏见,置信度虚高 26%;将模型答案伪装成用户输入即可低成本改善校准,无需重训练。

问题

问题背景

大语言模型(LLM)在医疗、法律、金融等高风险场景的部署,对置信度校准提出了硬性要求——模型输出的概率应如实反映其正确性。然而,研究表明,经过指令微调的模型校准度显著劣于预训练基座模型,导致过度自信,增加事实性错误不被捕获的风险。

现有方法局限

以往校准研究主要关注温度缩放、集成等训练后或训练期技术,但几乎未区分后训练算法对话模板的独立影响。具体而言:

  • 未解耦指令微调过程中,监督式微调(SFT)、RLHF 等步骤分别如何损害校准;
  • 忽略了聊天模板引入的角色标记(user/assistant)可能扭曲模型对自身生成的置信评估。 这导致现有缓解策略(如推理时校准、提示工程)可能治标不治本——若未纠正底层的“所有权偏差”,模型仍会在对话中系统性地高估自己的回答。

为什么这个问题难/重要

校准误差的来源复杂:指令微调改变了模型对输入-输出分布的拟合,而聊天模板进一步施加了对话角色偏见。论文发现,模型赋予自身生成答案的置信度比用户提供的相同答案高出最多 26%,这种“所有权偏差”独立于内容正确性,直接放大过度自信。挑战在于:

  1. 偏差深植于自回归生成过程,与模型对对话历史中角色身份的编码相关,无法仅通过概率缩放修正;
  2. 修正需兼顾推理效率和不影响生成质量,重训成本高昂;
  3. 多任务、多模型跨验证要求方法具备较强泛化性。 业界正急于在不可靠置信度输出的模型上构建可靠决策系统,该问题直接关系自主智能体的安全性底线。

行业类比

这类似于自动驾驶系统中,规划模块对自身决策的置信度远高于传感器传入的外部建议——即便建议相同——导致忽略关键信息,增加碰撞风险。

核心洞察

  • 指令微调后的LLM在置信度评估中表现出**所有权偏见**:模型对自己生成的答案赋予显著更高的置信度,即使答案与用户提供的完全相同。这一发现解耦了指令微调与聊天模板的影响,区别于以往仅关注微调算法对校准损害的研究,揭示出对话格式通过自我偏好加剧了过度自信,为理解校准退化提供了新维度。
  • 将模型回复重新包装为用户输入是一种**推理时去偏策略**:在置信度评估阶段,把模型自己的答案伪装成用户发言,即可将校准性能提升最多**26%**,且无需重新训练。该方法差异于现有基于训练或复杂提示的校准修正方案,实现零成本部署,为安全关键场景下LLM的即时可靠应用开辟了轻量化路径。

方法

问题分解与实验设计

本文方法沿“输入 → 关键模块 → 输出”线索展开。 输入为 指令微调(instruction‑tuned)LLM聊天模板(chat template) 下的对话样本;目标是量化解耦 后训练算法对话格式校准(calibration) 的影响,并找到缓解过度自信的轻量级策略。

关键模块与实验设置

  1. 校准评估基线
    使用 6 个近期开源 LLM,覆盖 3 个基准(benchmarks)3 种置信度启发方法(confidence elicitation methods)(如口头询问、token 概率、Likert 量表)。以 期望校准误差(ECE) 为主要指标,对比 基座模型(base)指令微调模型 在有无聊天模板下的校准曲线。

  2. 解耦后训练与聊天模板
    通过控制提示中是否注入聊天模板的“角色”标签(system/user/assistant),分离 指令微调带来的损害对话格式引发的额外 miscalibration。先确认指令微调本身降低校准,进而发现聊天模板加剧了这一问题。

  3. 所有权偏见(ownership bias)的验证
    精心构造“相同答案、不同来源”的输入对:

    • 模型自己生成的答案标注为 assistant 角色;
    • 完全相同内容标注为 user 角色。 比较模型对这两类答案的 置信度评分,统计差异显著性。结果显示模型对自己答案的置信度 最高可高出 26%,证实所有权偏见。
  4. 推理时缓解策略
    根据上述发现,提出一种 无需重训练 的策略:在需要模型评估答案置信度时,将模型生成的答案 重新框定为用户输入(reframing as user input)。具体做法是在构造置信度查询的提示中,将原本的 assistant 内容转移到 user 角色下。该方法直接降低所有权偏见导致的过度自信,使 ECE 改善最高达 26%,有效缩小基座模型和指令微调模型之间的校准差距。

与同类方法的差异

与依赖 温度缩放、标签平滑或集成方法 等需要重训练或修改损失的校准技术不同,本工作首创地揭示了聊天模板引发的 角色所有权信号 是主要 miscalibration 来源,并给出了一个纯推理时、即插即用 的提示工程解决方案,不改动模型参数,易于部署。

实验

实验设计

研究工作解耦了后训练算法和聊天模板对 LLM 校准的影响。在 6 个近期开源权重 LLM(覆盖 Llama、Mistral、Qwen2 等架构)、3 个基准数据集(涵盖多项选择、开放式问答等任务)和 3 种置信度引出方法(语言概率、选项后置信度、直接概率询问)上进行全面评测。实验对比了 base 预训练模型、指令微调模型,并设计角色交换测试:在 assistant 角色下生成答案,再以 user 角色呈现相同答案,测量模型对“自己的”答案和“用户给的”答案的置信度差异。

关键发现

  1. 指令微调从根本上损害校准,但聊天模板(chat template)通过引入 所有权偏差(ownership bias)使问题恶化:模型坚信自己生成的回答,即使内容与用户提供的完全一致,也赋予显著更高的置信度(最高高出 26%,平均高出 7%)。
  2. 偏差在回答错误时更突出——模型此时应低置信度,却仍维持高自信,加剧过度自信风险。
  3. 提出简单推理时策略:将模型回答在置信度引出时重新表述为用户输入(即“reframing”)。此方法无需重新训练或微调,即可大幅降低过度自信,将 ECE(预期校准误差)改善最高 26%,且在多项任务和不同模型规模上稳定有效,甚至对闭源模型也有泛化性。

与基线/同类工作对比

以往研究仅比较 base 与 instruct 模型的整体校准差异,未区分聊天格式的影响。本文通过解耦实验首次揭示:直接询问模型“你有多确定?”会触发所有权偏差,使 instruct 模型的校准进一步劣化。相比之下,本文的 reframing 策略通过消除角色身份信号,只需在推理时简单改写提示模板,就将 instruct 模型的校准水平拉近 base 模型,同时保持生成质量不变。与需要模型后训练或架构修改的方案不同,该方法零计算开销、即插即用,为实际部署中的可信度估计提供了低成本修复路径。

行业影响

落地场景

可靠的置信度估计是 LLM 在高风险场景中安全落地的必要条件。本文发现 指令微调 + 聊天模板 会引入 所有权偏差(ownership bias) ——模型对自己的回答过度自信,这一发现直接适用于所有采用 对话格式 的 LLM 应用:

  • 客户服务智能体:自动回答后需决策是否转人工,依赖置信度阈值。偏差导致模型错误坚持错误答案,降低用户体验并增加客诉。
  • 医疗 / 金融辅助决策:LLM 提供初步建议时,若未能准确表达不确定性,将直接导致错误诊断或违规操作。
  • 内容审核与法律查询:模型生成判断并附带置信度,偏差可能使审核结果过于激进,增加误判风险。

商业价值

  • 风险成本下降:校准后的置信度可减少错误决策带来的运营与合规损失,例如客服转人工过早 / 过晚导致的资源浪费或客诉赔偿。
  • 用户体验提升:更准确的不确定性表达增强用户对系统的信任,尤其在需要“承认不知道”的场景中,避免模型胡言乱语。
  • 无需重训练:本文提出的推理时策略(将模型回答以用户输入形式呈现)不增加额外训练成本,可快速部署到现有模型,校准提升高达 26%,极具性价比。

与现有产品/工作流的接口

该方法可无缝嵌入现有 LLM 推理管道:

  1. 置信度评估阶段修改提示词:在调用模型获取置信度时,将待评估的模型回复包装为 User: ...,而非 Assistant: ...,查询“该回答正确的概率”。
  2. 作为轻量中间件:可在 LLM API 网关或后处理层实现,对上游应用透明。兼容所有开放权重模型与部分闭源模型 API(只需控制对话角色)。

具体落地用例

  • 电商智能客服:用户询问退换货政策,模型回答后内部评估置信度。若原始置信度为 95%(实际可能错误),应用本文策略后降至 70%,从而触发转人工或二次确认,避免给出错误承诺引发纠纷。
  • 金融机构报告生成:LLM 汇总市场数据生成摘要,并标注置信度。校准后可减少因过度自信而发布的误导性陈述,辅助判断哪些内容需人工复核,降低合规风险。

局限

  • 实验仅在六个开源指令微调模型上验证,未涵盖更大规模的模型(如 70B+)或不同微调范式(如 RLHF、DPO),可能限制结论的泛化性。所有权偏差的发现主要基于问答和多项选择任务,未测试对话生成、摘要等更开放场景,因此缓解策略在复杂交互中的有效性未知。
  • 提出的推理时策略要求将模型回答作为用户输入进行信心引出,但该操作可能破坏对话的自然流,尤其在多轮交互中可能引入角色混淆,且未探索如何自动应用该策略而不影响用户体验。论文未深入分析所有权偏差的根本原因,例如模型是否在训练数据中学习到对自己生成的文本赋予更高信心,这限制了更根本性改进的可能性。
论文Mario Sanz-Guerrero2026-06-02原文

相关内容