论文

语言模型与先验的能力门控池化用于事件预测

语言模型与先验的能力门控池化用于事件预测

在混合预测中,语言模型往往只是若干可用信号之一。系统可能已经拥有市场、群体或统计预测,因此必须判断模型是否带来有用信息,还是应当被忽略。于是关键目标不是模型的独立准确率,而是相对能力(relative competence),即模型在已有外部预测之外的边际价值。 在 Brier loss 下,我们刻画了模型分歧何时能改进外部预测,并推导出使用领域特定池化权重 相比全局池化权重 所带来的增益。据此提出 competence gate,它从已揭晓结果中估计领域级来源权重,将不确定估计向全局权重收缩,并对池化预测进行再校准。 在 2,357 道已揭晓的二分类问题与五个语言模型上,该门控将主要外部基线从 0.0771 改进到 0.0732 Brier,并显著优于全局预测组合。该增益在泄漏控制下依然显著,并在结构化集合上对比泄漏安全的时间序列先验时保持显著,另在 FRED 上有独立证据。 相反,在 ForecastBench 官方市场子集上,该门控没有显著改进,基本让位于市场。在四个 Qwen 模型中,言语置信度(verbal confidence)无法可靠识别模型何时优于外部预测,而基于结果估计的能力则支持更好的弃答决策。这些结果为基于实测边际价值的选择性模型使用提供了可行方案。

论文精读

TL;DR 提出 competence gate,按领域估计模型相对外部先验的边际价值以选择性融合预测,在 2357 个二元问题上将 Brier 从 0.0771 降至 0.0732,同时发现口头置信度不可靠。

问题

问题背景:在混合预测系统(hybrid forecasting)中,语言模型预测常与市场、人群、统计等外部先验共存,系统需要决定何时采纳模型输出、何时忽略。

现有方法局限:

  • 全局池化权重:对所有领域使用同一组组合权重,忽略领域间模型相对能力的差异,导致在模型擅长的领域权重过低、不擅长的领域权重过高。
  • 独立精度评估:仅以模型 standalone Brier 分数判断价值,未考虑模型与外部预报的相关性。冗余信息不会降低 Brier,但也不会带来增益,甚至引入噪声。
  • 言语置信度不可靠:论文实验表明,四个 Qwen 模型的 verbal confidence 不能有效识别模型何时优于外部预报,传统置信度校准或弃权策略失效。

为什么难/重要:估计相对能力需要基于已解决结果的领域级权重,但领域样本稀疏,小样本估计方差大;同时必须防止泄漏和时间序列偏差。该问题直接影响混合预测系统的部署收益:错误引入模型会恶化 Brier 分数。业界对预测市场、金融时序、供应链事件预测等场景关注度高,期望获得可验证的边际价值判断方法。

行业类比:类似于推荐系统中多路召回融合,若新召回通道与已有通道高度重复,强行加权可能降低整体排序质量;需要一种“增量价值”门控来判断是否启用新信号。

核心洞察

  • 核心创新是将优化目标从模型独立准确率转移到相对能力(relative competence),即模型在已有外部预测之上的边际 Brier 增益。这区别于大多数 LLM 预测工作只优化 standalone accuracy 或简单与外部预测平均,而是显式建模模型何时值得被集成,避免在外部先验强时引入噪声,为选择性集成提供理论判据。
  • competence gate 采用领域级权重估计并向全局权重收缩(shrinkage),兼顾小样本领域鲁棒性与跨领域信息共享。相比全局固定组合权重,它能捕捉不同领域模型相对外部先验的能力差异;相比完全独立领域估计,又通过收缩降低方差。实验表明其显著优于全局组合,且在 ForecastBench 市场子集自动接近完全信任市场,展现自适应退让能力。
  • 实证发现语言模型口头置信度(verbal confidence)不可靠地标识模型相对外部预测的优势,而基于已解决结果的 outcome-estimated competence 能支持更好的弃权决策。这与大量依赖模型自报置信度进行 deferral/abstention 的工作形成对比,说明在混合预测部署中,应优先使用外部校准信号而非内部置信度,对何时信任模型输出有直接工程价值。

方法

competence gate 的输入包括:(1) 语言模型对每个二元事件的概率预测;(2) 外部预测(市场、人群或统计模型)对同一事件的概率;(3) 历史已解决事件的结果,用于估计各信号源的相对可靠性。目标不是优化单一模型准确率,而是在 Brier loss 下最大化模型相对外部预测的边际价值。

关键模块

  1. 领域级权重估计:在 Brier loss 框架下,将组合预测表示为模型预测与外部预测的加权平均。权重按领域(例如经济、政治、科学等类别)分组估计,而不是全局共享。通过最小化已解决事件上的 Brier 损失,反推每个领域中最优的源权重。

  2. 收缩到全局权重:当某个领域的历史样本较少或权重估计方差较大时,直接使用领域权重容易过拟合。因此引入收缩机制:将领域权重向一个从所有领域数据估计出的全局权重收缩,收缩强度由样本量和估计不确定性决定,本质上类似于经验贝叶斯或分层建模。

  3. 重校准:将加权组合后的预测通过单调映射(如 isotonic regression 或 Platt scaling)调整至经验频率,以纠正概率失真。

输出是对每个事件的最终组合预测概率;此外,基于估计的领域权重还可以计算模型相对外部预测的预期边际价值,用于后续 abstention 决策。

与常见全局 forecast combination 方法不同,competence gate 使用领域特定的、可收缩的源权重,并在组合后进行重校准,从而在稀疏数据下更稳健地利用模型边际价值。

实验

实验设计

研究在 2,357 个已解析二元问题 上评估 competence gate,覆盖 ForecastBench 市场子集、FRED 经济数据以及 pooled structured set。系统将语言模型概率与外部基准(市场/统计先验)进行池化,通过 resolved outcomes 估计 domain-level 源权重,并收缩至全局权重后重校准。

关键发现

  • 主外部基线 Brier 从 0.0771 降至 0.0732,提升 0.0039。
  • 显著优于全局组合方法,且在泄漏控制下结果稳健。
  • 在 ForecastBench 市场子集上无显著提升,模型大多让位于市场信号。
  • 四个 Qwen 模型的言语置信度不能可靠识别相对优势,但 outcome-estimated competence 支持更好的 abstention 决策。

与基线对比解读

competence gate 的价值在于“边际增益”而非独立精度:当外部预测已经很强(如成熟市场)时,模型应谨慎介入;在领域特定权重可估计且模型有增量信息时,按领域路由比全局固定权重的组合更优。这为混合预测系统提供了实用的选择性集成策略:用历史结果实测模型边际价值,避免依赖模型自报置信度。

行业影响

落地场景

Competence Gate 适用于已有外部预测源(市场、统计模型、人群智慧)但希望引入 LLM 增强的混合预测系统。典型产品包括:

  • 金融事件预测:融合期权隐含概率与 LLM 对宏观事件的判断;
  • 供应链风险管理:结合历史需求预测与 LLM 对突发事件影响的估计;
  • 医疗诊断辅助:融合临床风险评分与 LLM 对患者病历的解读。

商业价值

  • 降本:避免在模型无边际价值时消耗计算资源,选择性调用 LLM;
  • 增收/提效:提升预测准确率(论文在 2357 个二元问题上 Brier 分数 从 0.0771 降至 0.0732),改善依赖预测的决策质量;
  • 体验:输出更可靠的校准概率,增强用户信任。

接口与集成

Competence Gate 可作为轻量级预测融合微服务,接收 LLM 概率、外部预测概率及历史结果,输出领域级加权并重校准后的概率。集成步骤:

  1. 将历史数据按领域划分,估计各源权重;
  2. 对样本稀少的领域,收缩至全局权重;
  3. 输出时进行 Platt 或温度缩放等校准。

具体 Use Case

  • 金融事件驱动策略:量化机构已有市场隐含概率(如选举合约价格),部署 LLM 解读新闻。Gate 判断 LLM 在该领域是否超越市场;若否,则完全 defer 给市场,避免过度交易。
  • 电商大促需求预测:已有统计时序模型,当出现突发社会事件时,LLM 尝试调整预测。Gate 基于历史事件期间的表现决定是否采纳 LLM 调整,防止统计模型被噪声破坏。

局限

  • 在官方 ForecastBench 市场子集上,该方法没有带来显著改进,gate 大多选择依赖市场预测。这表明当外部预测已经很强时,语言模型的边际价值有限,competence gate 的适用场景受限。从工程角度看,部署前需要评估外部基线的质量,否则可能引入不必要的延迟和计算开销。
  • 方法需要从 resolved outcomes 中估计 domain-level source weights,这意味着必须有足够的历史已解析问题来训练 gate。对于新领域或低数据量场景,权重估计会非常不确定,即使收缩到全局权重也可能不可靠。论文没有讨论冷启动策略,实际部署中可能需要先收集一段时间数据或依赖启发式权重。
  • 实验仅覆盖二元问题,且语言模型仅限五个(主要是 Qwen 系列等),可能限制了结论的泛化性。此外,虽然做了泄漏控制,但无法完全排除数据污染或时间泄漏对结果的影响。与端到端联合训练的方法相比,该 gate 是后处理组合,可能未充分利用模型内部表征,边际提升幅度(0.0039 Brier)在业务指标中是否显著需要结合实际成本判断。
论文Aditi Tiwari2026-09-10原文

相关内容