论文

Activation Oracles 的置信度与校准:用于语言模型内部的可信解释

Activation Oracles 的置信度与校准:用于语言模型内部的可信解释

Activation Oracles 旨在使其他模型的激活对人类可读,与白盒可解释性技术相比取得了有希望的结果。然而,针对此类激活预言机自然语言输出的不确定性量化(UQ) 迄今研究不足。 本文研究了 6 种不同方法来估计 Activation Oracles 的置信度,并评估其置信度分数的校准程度。实验在每个预言机 6000 个样本(变化 verbalizer 和 context prompts)上进行,发现 bootstrap mode frequency 是测试中校准最好的方法(在 Qwen3-8B 上 ECE 5.7% vs. 答案词 log-probability 的 25.5%;在 Qwen3.6-27B 上 10.3% vs. 13.1%)。此外,log-prob 基线可以以极低代价作为快速分诊信号。 代码和修补后的训练器可在 [GitHub](https://github.com/federicotorrielli/probabilisticactivationoracles) 获取。

论文精读

TL;DR 首次对激活神谕的置信度进行系统校准研究,比较6种方法发现自举众数频率校准最优(ECE 5.7% vs 基线 25.5%),对数概率可作低成本快速筛选信号。

问题

问题背景

激活预言机 (activation oracle) 通过将神经网络内部激活线性映射为自然语言描述,使模型决策过程可读,已成为白盒可解释性的重要手段,但如何量化其输出的可靠性—即置信度估计—仍属空白。

现有方法的局限

目前最常见的做法是直接采用答案词的对数概率作为置信度,但该基线存在明显缺陷:

  • 校准度差:实验显示其 ECE(期望校准误差)高达 25.5%,严重高估模型把握。
  • 缺乏对比:几乎没有工作系统比较过不同不确定性量化(UQ)方案在激活预言机场景下的表现,如自举法、MCMC 采样、直接自报告等。
  • 推理成本与校准的权衡未知:概率基线虽然计算代价低,但可能牺牲可靠性,而复杂方法增加了延迟,却不一定带来校准收益。

为什么这个问题难且重要

激活预言机的输出是自由文本而非固定类别,传统分类器的置信度校准(如温度缩放)不再直接适用。每个激活向量可能对应多种语言描述,其概率分布受 verbalizer 和上下文提示共同影响,导致真实置信度难以定义和估计。此外,可解释性研究若缺乏校准的置信度,下游决策(如人工审核、自动筛选)将面临高信任风险。业界对安全、医疗、法律等高风险领域的 AI 可解释性需求日益增长,可靠的激活解释直接关系到模型部署的可行性。

行业类比

这与自动驾驶中多模态感知融合的不确定性评估类似:当系统给出“前方有行人”的判断时,工程师必须知道这一结论的置信度,才能决定是否紧急制动——激活预言机同理,无校准的“模型在想什么”只能是玩具,无法进入生产环。

核心洞察

  • **激活预言机** 的输出置信度校准长期被忽视:直接使用答案词的 log-probability 作为置信度指标会导致严重的过度自信(ECE 高达 25.5%)。相比之下,**bootstrap 模式频率** 通过重采样扰动 verbalizer 和 context prompt,将 ECE 大幅降低至 5.7%,证明了在解释模型内部表征时,采用集成或重采样策略对于可靠的不确定性量化至关重要。
  • **模型规模** 与校准能力之间存在非单调关系:从 **Qwen3-8B** 到 **Qwen3.6-27B**,任务准确度并无提升,但置信度校准的 ECE 从 25.5% 降至 13.1%。这意味着大模型可能内化了更好的不确定性表达,尽管无法提升解释任务的判别能力。这一发现对实际部署具有指导意义:即使准确度未变,更大的模型仍能提供更可信的置信度,帮助筛选高风险样本。

方法

核心思路

激活预言(activation oracle)将某个模型(如 Qwen3-8B)的内部激活映射为人类可读的自然语言答案(通常是一个单词)。置信度估计的目标是:给定同一激活向量,量化该答案的可靠性,而无需访问原始模型的完整分布。

输入与整体流程

  • 输入:冻结的模型中间层激活向量(例如 residual stream 某一层的输出)
  • 基础模块:激活预言本身(通常是一个线性探针或 LoRA 适配器),将激活向量映射到词汇表上的 logit,再通过 verbalizer 转换为单词
  • 置信度估计模块:在预言输出的基础上,对每个样本生成一个 [0,1] 区间的置信度分数

六种置信度估计方法

  1. 回答词对数概率(M1,基线)
    直接取答案单词在语言模型 head 下的 log-probability,经温度缩放后作为置信度。优点是零额外成本,但显著过自信(ECE 高达 25.5%)。

  2. 温度自举众数频率(M2,最佳方法)
    对温度参数进行多次自举(例如从 0.1 到 2.0 采样),每次重新计算 token 概率并取 argmax,统计答案词出现的频率作为置信度。该方法不改变模型权重,仅通过推理时的随机化实现集成,ECE 低至 5.7%,且无需访问内部 logit。

  3. 直接数值自我报告(M3)
    让激活预言同时输出一个置信度数字(如 “0.8”),即 verbalizer 直接生成置信度 token。实验发现该方式在小模型上部分有效,但在大模型(27B)上出现反校准(置信度与正确率负相关)。

  4. MCMC 幂采样接受率(M4)
    基于 MCMC 的幂采样(power sampling)生成候选答案,统计目标单词被接受的比例作为置信度。

  5. MCMC 幂采样一致性(M5)
    类似 M4,但以多次采样中答案单词的出现频率(而非接受率)作为置信度。两者均未显著优于温度自举,且计算开销更大。

  6. 操控系数敏感度(M6)
    微调激活操控(steering)的强度系数,观察答案变化所需的系数偏移量;偏移越小,置信度越低。该方法仅适用于显式操控的场景,通用性受限。

输出与评估

所有方法输出单一样本的置信度标量,随后用期望校准误差(ECE)和可靠性图等指标评估校准质量。研究发现,温度自举众数频率在不同模型、不同 prompt 变体下均表现出最稳定的校准性能,而简单的 log-prob 基线可作为低成本的快速筛选信号。

与同类方法的差异点:该方法族不依赖白盒概率访问,仅通过温度自举的采样集成(bootstrap ensemble)即实现逼近黑盒置信度估计的最优校准,为无法获取内部 logit 的落地场景(如 API 受限的模型解释)提供了实用路径。

实验

实验设计

  • activation oracle 上评估 6 种置信度估计方法,每个 oracle 生成 6,000 样本,变化 verbalizer 和 context prompts。
  • 模型选用 Qwen3-8BQwen3.6-27B,以 ECE (Expected Calibration Error) 为主要校准指标。
  • 方法包括:log-probability(基线)、temperature bootstrap、直接数值自我报告、MCMC 功率采样 acceptance/agreement、steering-coefficient 敏感性。

关键发现

  • Bootstrap mode frequency 校准最优:在 Qwen3-8B 上 ECE 仅 5.7%,远低于基线 log-prob 的 25.5%;在 Qwen3.6-27B 上为 10.3% vs 13.1%
  • Temperature bootstrap 与任务准确率正相关,表明集成不确定性捕捉有效。
  • MCMC 功率采样未增加额外校准信息,可能因采样效率不足。
  • 直接自我报告在大模型上出现反校准,提示基于语言表达的不确定性不可靠。
  • Log-prob 基线可作为快速 triage 信号,计算成本低,但校准差。

与基线对比

  • Log-prob 基线严重过度自信(高 ECE),尤其在 Qwen3-8B 上,将 25.5% ECE 降至 5.7% 是显著提升。
  • 大模型基线 ECE 本身较低(13.1%),提升幅度小但方向一致,说明规模提升自带部分校准,但专门方法仍有效。
  • Bootstrap 的优势来自模式一致性:通过不同温度采样后统计最频繁输出,比单次 logit probability 更鲁棒。
  • 在实际部署中,推荐小模型和关键任务优先采用 bootstrap mode frequency,大模型可降级使用 log-prob 作为快速筛选。

行业影响

落地场景

激活预言(activation oracles)通过对模型内部激活进行自然语言解读,让模型的行为变得可解释。在引入置信度估计后,该技术可直接嵌入各类 AI 产品的 模型调试安全审计可解释 AI (XAI) 模块。

两个典型用例:

  • 金融风控:当模型拒绝一笔贷款时,激活预言可生成拒绝理由,并附带校准后的置信度。低置信度的理由自动标记给人工复核,避免误判。
  • 电商推荐:解释“为什么推荐该商品”时,高置信度的解释直接展示给用户增强信任,低置信度的解释则回退到基于规则的说明,保证体验一致性。

商业价值

  • 降本log-prob 基线可作为快速分流信号(triage signal),低成本过滤掉大量高置信度的解释,仅对低置信度案例投入人工审核资源。在 Qwen3-8B 上,该方法 ECE 仅 5.7%(对比普通 log-prob 的 25.5%),大幅减少无效的再审查成本。
  • 增收/体验提升:高可靠性的解释能提升用户对 AI 决策的信任度,降低弃用率。在合规要求严格的行业(如金融、医疗),可解释且带置信度的模型更容易通过监管审核,缩短产品上市周期。

与现有产品/工作流的接口

该方法的代码和训练器已开源(probabilistic_activation_oracles),可轻量集成到现有 ML 栈:

  • 可解释性平台(如 Captum、SHAP):作为解释生成器的后处理步骤,为每个解释附加置信度分数。
  • 模型监控系统(如 WhyLabs、Arize):将激活预言的置信度作为实时漂移指标,当模型解释变得不可靠时触发告警。
  • LLM 评估流水线:在评估模型生成内容的安全性时,用激活预言的置信度来权衡是否信任模型的自我解释。

集成只需在推理阶段增加一轮 bootstrap 采样 或获取 answer-word log-probability,不改变原有模型架构,对推理延迟影响可控。

局限

  • 1. 实验仅在两个 **Qwen** 系列模型(**Qwen3-8B** 和 **Qwen3.6-27B**)上进行,且任务依赖于特定的 **verbalizer** 与 **context prompt** 组合。对其他规模或架构(如非自回归模型)的泛化能力未经验证,结论的普适性受限。
  • 2. **bootstrap mode frequency** 虽校准最佳,但需对每个样本执行多次生成式重采样,计算开销远高于基线 **log-prob**。论文未深入探讨在不同计算预算或延迟约束下的工程权衡,也未提供轻量级近似方案,阻碍实时应用。
  • 3. 评估仅基于期望校准误差(**ECE**),缺少对置信度在下游任务(如选择性预测、人工复核调度)中实际效用的分析。高校准并不等同于能有效分离正确与错误预测,且未报告分正确 / 错误池的置信度分布,工程落地指导不足。
论文Federico Torrielli2026-05-25原文

相关内容