论文

高效测试时推理的 Claim-Level Reliability Assessment

高效测试时推理的 Claim-Level Reliability Assessment

我们提出将声明级证伪作为测试时扩展的原则,并通过 Claim-Level Reliability Assessment (CLR) 进行实例化。CLR 是一种无需训练的框架,将测试时计算从额外采样答案重新分配到针对性验证。由于整条轨迹评估常常因常规 token 的信号稀释而掩盖决定性错误,CLR 将每条推理轨迹压缩为一组决策关键声明,从而分离出逻辑锚点。 此外,考虑到在固定模型能力下生成完全正确的解决方案本身就非常困难,CLR 将重点转向语义证伪。该方法利用了解决方案构建与声明反驳之间的根本不对称性:构建有效解决方案需要一条无懈可击的推理路径,而反驳错误声明只需找出一个决定性缺陷。这种对负面证据的定向搜索系统性地压缩了高置信错误轨迹的生存空间,通过非线性可靠性评分有效抑制错误共识。 在四个 LLM 与四个推理基准上,匹配预算下,CLR 普遍优于 pass@1 和自一致性。例如,在 GPT-OSS-20B / CMIMC25 上,CLR 超过 pass@1 达 27.15 个百分点,并将自一致性准确率从 77.50% 提升至 82.19%,同时减少了 37.0% 的 token。

论文精读

TL;DR CLR 将推理 trace 提炼为关键声明并做证伪验证,以更少 token 重新分配测试时计算,抑制错误共识,提升 LLM 推理准确率。

问题

问题背景

测试时扩展(test-time scaling)成为提升 LLM 推理能力的重要方向,目标是在不更新参数的前提下通过增加推理期计算资源来改善答案质量。

现有方法局限

  • 基于采样多数投票的 self-consistency 依赖大量完整解采样,token 成本高且多数投票可能被错误共识主导。
  • 对整个推理轨迹做整体评估(whole-trace evaluation)存在信号稀释问题:常规 token 淹没决定性错误,导致错误解与正确解在置信度上难以区分。
  • 生成完全正确的解要求推理路径每一步都无误,而现有模型能力下难以保证,因此需要更务实的验证策略。

为什么这个问题难/重要

  • 推理链长且错误隐蔽,单个关键错误即可推翻结论,但定位该错误成本高。
  • 测试时计算预算有限,需要在额外采样与针对性验证之间重新分配资源,提升 token 效率。
  • 业界普遍关注如何在不增加模型参数的前提下榨取推理潜力,可靠性与效率的权衡是核心挑战。

行业类比

类比自动驾驶感知系统:与其重跑整个感知管线来复核结果,不如对关键障碍物的检测置信度做定向校验,以更低成本拦截高风险误检。

核心洞察

  • 将测试时计算从“更多采样”转向“针对性验证”:CLR 通过提取决策关键 claim,将可靠性评估聚焦于逻辑锚点,避免全迹评估中常规 token 的信号稀释。与 self-consistency 依赖多数投票不同,CLR 对每个 claim 进行语义证伪,利用“构造正确解需完美路径,反驳错误只需一个缺陷”的不对称性,以负证据搜索压缩高置信错误解的生存空间。这为固定模型能力下提升推理可靠性提供了更高效的路径。
  • 训练无关的非线性可靠性评分机制有效抑制错误共识:CLR 不训练 verifier,而是对每个 claim 独立证伪后聚合得分,使得即使多数采样得到错误答案,只要其关键 claim 被成功反驳,整体可靠性分数会急剧下降,从而“拯救”错误共识。与基于概率或熵的 intrinsic 信号不同,CLR 直接针对语义正确性,且评分非线性可以大幅度压制高置信但错误的迹。在 GPT-OSS-20B/CMIMC25 上,CLR 超过 pass@1 27.15 个百分点,并将 self-consistency 从 77.50% 提高到 82.19% 且节省 37.0% token,实证了这种测试时计算再分配的有效性。

方法

方法流程

输入:问题 Q 与一组由 LLM 采样生成的候选推理轨迹。

关键模块:

  1. 关键声明提取:从每条推理轨迹中识别并抽取决策关键的 claim,将其压缩为紧凑集合,剔除常规 token 带来的信号稀释,从而隔离逻辑锚点。
  2. 证伪式声明评估:对每个 claim 进行语义证伪(semantic falsification)。利用构造与反驳的不对称性:构造正确解需要无瑕疵推理路径,而反驳错误声明只需定位一个决定性缺陷。CLR 通过针对性搜索负面证据来评估声明的可靠性。
  3. 可靠性评分与聚合:基于声明评估结果,采用非线性可靠性评分压缩高置信度错误轨迹的生存空间,抑制错误共识;最终聚合所有轨迹的声明得分,选择答案。

输出:最终预测答案。

与 self-consistency 的差异:CLR 不是简单对完整推理轨迹投票,而是将测试时计算从额外采样重新分配到对关键声明的靶向验证,在匹配预算下用更少 token 提升准确率。

实验

实验设计

CLR 在四个 LLM 和四个推理基准上评估,匹配预算下与 pass@1 和 self-consistency 对比。具体实例:在 GPT-OSS-20B 与 CMIMC25 上,CLR 将测试时计算从额外采样重新分配给关键声明验证,包含 关键声明提取、证伪式声明评估 和 非线性可靠性评分 三阶段。

关键发现

在 GPT-OSS-20B/CMIMC25 上,CLR 相比 pass@1 提升 27.15 个百分点;将 self-consistency 准确率从 77.50% 提升至 82.19%,同时 token 消耗减少 37.0%。CLR 普遍优于两类基线,通过压缩高置信度错误轨迹的生存空间,有效抑制错误共识。

基线对比解读

与 self-consistency 的多数投票不同,CLR 不依赖更多采样,而是定向证伪关键声明。利用解答构造与声明反驳的不对称性,单一决定性缺陷即可推翻错误轨迹。token 减少 37% 仍提升准确率,表明从盲目聚合转向语义验证的测试时缩放更高效。

行业影响

落地场景

CLR 适用于对推理准确性要求高且推理成本敏感的 LLM 应用,如电商客服的复杂政策解答、代码生成平台的逻辑验证、金融分析的事实核查、医疗辅助诊断的拒答触发。尤其适合当前普遍采用 self-consistency 或 best-of-n 采样投票的场景,可将额外采样预算部分转移到针对性验证。

商业价值

主要落在降本与体验提升双线。原文显示在 GPT-OSS-20B / CMIMC25 上,CLR 相比 self-consistency 准确率从 77.50% 提升到 82.19%,同时 token 消耗减少 37.0%。对于调用付费 API 做批量推理的服务,直接降低成本;更高的回答可靠性减少错误导致的用户投诉、返工或高风险误判,间接提升用户留存和信任。若用于自动化决策(如自动审批、自动代码合入),可扩大自动化覆盖率,增加人效。

与现有工作流集成

CLR 是训练无关的后处理框架,可插入现有推理 pipeline 而不需要重新训练或微调模型。典型集成方式:

  1. 对同一问题采样多个推理轨迹(或仅单轨迹);
  2. 对每个轨迹用 LLM 提取决策关键 claims;
  3. 对每个 claim 执行伪证评估,得到可靠性分数;
  4. 根据分数进行非线性聚合,选择最终答案。

该流程可作为推理网关中的中间件,与 vLLM、TGI 等推理引擎配合,或直接封装成库供上层业务调用。对已有 self-consistency 的团队,可先保留少量采样(如 2-3 个轨迹),再对候选做 claim 验证,逐步过渡。

具体 use case:

  • 电商客服:用户询问“商品是否支持 7 天无理由退货”,模型可能给出含错误细节的回答。CLR 可在生成答案后提取关键声明(如“7 天内可退”),并让模型尝试反驳(如判断是否受品类限制),过滤出可靠答案,降低客诉率。
  • 代码生成平台:模型生成函数后,提取关键行为声明(如“空数组输入返回 0”),通过生成反例或静态分析进行伪证,剔除有缺陷的候选代码,减少开发者调试成本。

局限

  • **依赖 Claim 提取质量**:CLR 的性能高度依赖第一阶段提取出的“决策关键主张”的完整性与准确性。如果模型在生成阶段未能将隐含逻辑错误显式化为可验证的 claim,或者提取的 claims 粒度过粗/过细,则 falsification 阶段可能找不到关键缺陷,导致错误共识残留。论文未系统分析 claim 提取错误传播的影响,也未提供独立于最终准确率的提取器评估指标;实际部署时可能需要针对不同任务人工调整提取 prompt,降低了零样本即用性。
  • **验证者能力瓶颈与误拒绝风险**:falsification 阶段使用同一 LLM 进行语义证伪,但模型自身的系统性盲点可能导致无法识别错误 claim,或对正确 claim 虚构缺陷。当错误推理与训练分布偏离较大时,验证器容易“确认偏误”,无法有效压缩错误轨迹的生存空间。此外,非线性可靠性评分可能过度惩罚正确但表述不常见的 claim,产生误拒绝(false rejection),论文未报告该比率;在医疗、法律等高可信度场景下,此类风险需要更严格的校准与人工兜底。
  • **实验覆盖与工程复杂度**:论文在四个 LLM 和四个推理基准上评估,但基准类型偏向竞赛数学或形式化推理,对于开放域问答、代码调试、多跳推理等任务,claim 的自动提取与语义等价判断难度显著增大。虽然总 token 消耗下降,但引入 claim 生成、逐条验证、非线性聚合等多步流程,增加了推理延迟与系统复杂度;claim 数量、评分阈值等超参数可能需要任务级调优,抵消了训练免方法的部分便利性。论文对跨领域泛化的讨论不足,后续需要更广泛的基准和实际生产环境验证。
论文Sen Xu2026-08-12原文

相关内容