论文

信心源于经验:从推理到智能体的经验性置信度估计

信心源于经验:从推理到智能体的经验性置信度估计

可靠的置信度估计 对语言模型的可靠部署日益关键:它决定哪些输出该交付、该上报、该重试。但现有估计器共享一个前提——只读取当前推理过程,无论是自省、token 概率打分还是重采样。作者认为,仅凭当前推理不足以支撑置信度。 为此提出 XConf(eXperiential Confidence),将置信度估计与模型积累的经验 结合。经验存储为过往分级片段:任务、反思、自述置信度、结果与事后教训。面对新任务,Recall 阶段检索相似任务且自述置信度相近的片段并读出历史成功率;Reflect 阶段让模型指出自身反复出现的失败模式,再据此重述置信度。方法格式通用,无需 logit 访问或权重更新,仅需一次答案生成。 在覆盖推理、编码、多模态 QA 与交互式智能体 的九个基准、三个家族的四个模型上,XConf 在 24 项比较中的 23 项于区分度(AUROC)上持平或超越十倍采样的 self-consistency,且校准误差(ECE) 显著更低,生成成本仅十分之一。用于选择性预测 时,弃答置信度最低的 10% 片段可使智能体任务交付成功率最高提升 8.7 个百分点。 作者据此将经验性置信度估计视为通用置信度估计的新范式。

论文精读

TL;DR XConf 用模型自身的历史经验(而非仅当前推理)校准置信度:检索相似任务与初始置信度的历史成功率,再反思给出更准的置信度,在多个基准上以 1/10 成本超越 10 样本自一致性。

问题

问题背景:可靠置信度估计正成为 LLM 可信部署的核心环节,决定系统何时自动交付、何时升级人工、何时重试,直接影响模型在实际业务中的自动化程度和风险控制。

现有方法局限:当前主流置信度估计方法有三大类,但都存在“只读取当前推理过程”的结构性缺陷:

  • 内省式:让模型自己判断答案是否正确,易受模型过度自信或系统校准偏差影响,缺乏外部客观证据。
  • token 概率聚合:依赖 logits 或语言模型概率,在推理型模型和长思维链场景下,token 概率与最终答案正确性相关性显著减弱,甚至误导。
  • 自一致性(self-consistency):多次采样统计答案一致性,生成开销高达 10 倍以上,且仅基于当前问题的采样分布,无法利用模型在相似任务上的历史表现。

这些方法共同缺陷是没有利用模型过往经验,无法回答“模型在类似任务上、相似置信度下,历史成功率是多少”这一校准关键问题。

为什么难/重要:置信度估计本质上是一个分布外泛化问题:测试样本标签缺失或延迟,需要从有限历史中推断。面向 agent 任务尤其困难,失败信号常常不显式、轨迹中不含答案,模型必须依赖自我评估,而自我评估本身可能不校准。业界关注度极高,因为选择性预测、模型路由、自动重试、人工审核队列都依赖一个校准良好的置信度分数。

行业类比:类似自动驾驶系统中,基于历史驾驶里程与接管事件记录来估计当前路段的接管概率,而非仅依赖当前摄像头输入。

核心洞察

  • 现有置信度估计过度依赖当前推理(自一致性重采样、token 概率、内省),忽略了模型自身历史表现中可复用的校准信号。XConf 提出用已验证的 past episodes 作为外部证据,检索相似任务与相似初始置信度下的历史成功率,实现对当前输出的条件校准。这从根本上改变了置信度估计的证据来源:从单次推断的内部不确定性,转向模型跨任务积累的行为统计,因此能在仅一次生成、无 logit 访问的前提下,达到与十次采样自一致性相当或更优的判别能力(AUROC),且 ECE 更低。
  • XConf 的 Recall + Reflect 双阶段设计将置信度校准拆解为检索与反思两步:Recall 读取相似历史片段的实际成功率,为当前置信度提供数据锚点;Reflect 则让模型基于自身 track record 显式命名反复出现的失败模式,并重述校准后的置信度。与传统 prompt-based 反思相比,它引入的是模型自己的、带有结果验证的历史案例,而非无依据的自我怀疑;与纯检索方法相比,它通过生成式反思将统计规律转化为可解释的置信度调整方向,使估计过程同时具备证据基础和语义合理性。
  • 在选择性预测场景中,XConf 对 10% 最低置信度样本弃权后,agent 任务的交付成功率最高提升 8.7 个百分点,验证了置信度估计在真实部署决策(ship / escalate / retry)中的直接价值。更关键的是,经验库可以随每次验证不断累积,且支持合并与冷启动,这意味着该方法可作为一种无需训练、跨模型泛化的通用置信度基础设施——解决了传统方法依赖特定模型 logit 或需要额外采样开销的工程痛点,为构建持续改进的 LLM 可信部署体系提供了新路径。

方法

输入

模型对当前任务生成答案,并给出初始置信度(可能附带对自身解决方案的反思)。

经验银行

经验银行存储模型过去已评分的 episodes,每条记录包含:

  • 任务描述
  • 模型当时的反思
  • 陈述的置信度
  • 最终结果(成功/失败)
  • 事后写下的教训

关键模块:Recall 与 Reflect

  1. Recall(检索):根据当前任务与先前任务的语义相似性,以及当时陈述的置信度相似性,从银行中检索相关 episodes。读取这些相似 episodes 的历史成功率,作为置信度条件命中率。
  2. Reflect(反思):将检索到的记录展示给模型,要求模型识别自身反复出现的失败模式,并基于自己的历史表现重新陈述一个校准后的置信度。

输出

输出一个校准后的置信度估计,用于选择性预测(决定交付、升级或重试)。任务完成后,真实结果验证并写回银行,形成持续学习闭环。

与同类方法的差异

与仅基于当前推理过程的内省、token 概率打分或重采样方法不同,XConf 显式利用模型自身积累的历史经验进行校准,且无需 logit 访问或权重更新,生成成本仅为一次答案生成。

实验

实验设计

XConf 在 九个基准 上评估,覆盖 推理、编码、多模态问答、交互式 agent,模型来自三个家族四个模型。基线包括 10 样本 self-consistency 等。主要指标:AUROC、ECE、生成成本。另测试 selective prediction:对最低置信度 10% 的样本弃权,观察交付成功率变化。

关键发现

  • AUROC:在 24 个比较中,XConf 有 23 个优于或匹配 10 样本 self-consistency。
  • ECE:校准误差显著更低(摘要未给具体数值)。
  • 成本:仅需一次答案生成,成本是 self-consistency 的 十分之一。
  • 选择性预测:在 agent 任务上,弃权最低置信度 10% 的 episode 可使交付成功率提升最高 8.7 个百分点。

核心论断:当前推理过程本身不足以支撑置信度,需要结合模型自身积累的历史经验。

与基线对比解读

相比需要多次采样的 self-consistency,XConf 用 检索历史表现 替代重复采样,且 无需 logit 访问或权重更新,通用性强。在保证区分度不降的前提下大幅降低成本,说明 经验记忆是一种更高效的校准信号。对实际工程,该方案适合 低延迟、高吞吐、需快速决策 的部署场景。

行业影响

落地场景

XConf 适用于需要区分模型输出可信度以决定后续动作的自动化流程。例如:电商智能客服 在处理退款、投诉时,对低置信度回答转人工,减少错误;内容审核系统 对可能违规的内容置信度低时触发人工复核,平衡效率与安全;代码辅助工具 可基于置信度决定是否直接采纳建议;金融文档解析 中,对关键字段提取置信度低时要求人工确认。此外,在交互式代理(如浏览器操作、任务自动化)中,置信度用于决定是否继续执行或请求用户介入。

商业价值

  • 降本:XConf 仅需一次生成,成本为十样本自洽性的十分之一,同时校准误差更低(ECE 更优)。选择性预测(弃绝最低置信度样本)可将成功率提升最高 8.7 个百分点,提高全自动化比例,减少人工审核成本。
  • 增收与体验:更可靠的置信度让模型在更多场景可自主决策,提升吞吐和用户体验;低校准误差便于设置业务阈值,满足合规审计要求。
  • 风险控制:经验库不断积累,模型可从历史错误中学习,降低重复犯错概率。

与现有工作流接口

XConf 作为轻量级外部组件接入,无需修改模型权重或访问 logits。集成步骤:

  1. 模型生成答案后,调用一次额外推理获得初始置信度(或直接用生成概率)。
  2. 将任务摘要、模型反思、初始置信度发送至经验库(可用向量数据库存储)。
  3. Recall 检索相似任务且相似置信度的历史 episode,计算历史成功率。
  4. Reflect 将检索到的记录展示给模型,生成修正置信度。
  5. 根据修正置信度执行路由决策(通过 / 转人工 / 重试),并将最终结果写回经验库。

该组件可嵌入现有 LLM 推理网关(如 vLLM、TGI)或与 LangChain 等编排框架配合,部署成本低。

局限

  • **经验库的构建与维护成本**:XConf 依赖一个持续增长的记忆库,每条记录包含任务、反思、置信度、结果和教训。在实际部署中,正确的结果标签往往需要人工标注或可靠的自动验证器,对于开放域问答、创意写作等没有明确对错的任务,获取可靠 outcome 的成本很高。同时,随着经验不断累积,存储和检索开销会线性增长,需要额外的索引和清理策略,可能抵消其低生成成本的优势。
  • **冷启动与分布偏移**:在经验库为空或样本很少的初期,Recall 阶段无法检索到足够的相似 episode,XConf 的校准能力会显著退化,接近普通口头置信度基线。此外,当任务分布随时间变化(如用户提问风格、领域知识更新),历史经验可能不再适用,检索出的“相似”记录反而会误导模型给出错误的置信度,方法缺乏自适应的遗忘或重加权机制。
  • **对模型推理能力的依赖**:Reflect 阶段要求模型阅读历史记录、识别自身反复出现的失败模式并修正置信度,这对模型的指令跟随和元认知能力有较高要求。论文分析显示,当模型规模从 27B 降至 9B 时性能出现悬崖,说明 XConf 的效果与基础模型能力强相关。对于较弱或较小规模的模型,该方法可能无法稳定工作,限制了其在边缘设备或轻量级模型上的应用。
论文Caiqi Zhang2026-09-15原文

相关内容