LLM-as-a-Verifier:一种通用验证框架
LLM-as-a-Verifier 提出一种概率验证框架,将验证能力作为新的缩放轴,无需额外训练即可为智能体任务提供细粒度反馈。与标准LM评判方式(如直接生成离散分数)不同,该方法通过计算评分令牌logits分布的期望来生成连续分数,从而实现验证在多个维度的缩放: 1. 分数粒度:提升评分粒度可更好区分正负解决方案,获得更校准的比较; 2. 重复评估:通过方差降低持续提升验证准确率; 3. 标准分解:通过复杂度降低进一步带来增益。 框架还引入一种低成本排序算法,利用连续分数从候选方案中选出最优解。在Terminal-Bench V2(86.5%)、SWE-Bench Verified(78.2%)、RoboRewardBench(87.4%)和MedAgentBench(73.3%)上达到 SOTA。 除验证外,其细粒度信号还可作为任务进展的代理指标,并已集成至 Claude Code,帮助开发者监控和改善智能体系统。此外,该框架能为强化学习(如 SAC、GRPO)提供密集反馈,提升机器人学和数学推理基准的样本效率。
论文精读
TL;DR 将 LLM 验证从离散打分升级为基于评分 token logits 期望的连续概率评分,通过分数粒度、重复评估和标准分解三维度扩展,在多个智能体基准上取得最优验证准确率,并可提供密集奖励提升 RL 效率。
问题
问题背景
当前 LLM 社区聚焦于通过扩展预训练、后训练和测试时计算来提升复杂智能体任务的性能。在此过程中,验证能力(判断一个解决方案正确性的能力)正成为新的关键扩展轴。
现有方法局限
传统方案依赖离散评分法官(LLM-as-a-Judge),提示模型输出单个分值。其技术局限包括:
- 评分粒度不足:离散分值(如 1~5)难以区分质量相近的候选方案,导致频繁的 tie(平局),无法提供可靠排序。
- 评估方差高:单次推理的随机性造成判断不一致,尤其在需要精细比较的场景中。
- 标准单一:仅给出整体分数,缺乏对子任务或子准则的分解,阻碍针对性改进。
- 训练依赖:部分方法需要额外训练奖励模型,成本高昂且泛化性受限。
为什么这个问题难/重要
验证是解锁 RL、测试时计算扩展和 Agent 自我改进的核心环节。难点在于:如何在零额外训练的前提下,从 LLM 的 logits 分布中挖掘连续的、多粒度的信号,同时平衡成本与准确性。业界急需一种通用、可扩展的验证范式,因为实际部署中,模型的反馈质量直接影响系统迭代效率。
行业类比
如同推荐系统中用连续点击率预估代替人工规则排序,LLM-as-a-Verifier 将离散判断转化为概率期望,为智能体任务提供更平滑、更校准的决策信号。
核心洞察
- 将验证建模为概率期望,实现了从离散判定到连续评分的范式转变。传统 LLM judge 强制模型输出离散分值,易产生平局且丢失细粒度信息。LLM-as-a-Verifier 直接利用评分 token 的 logits 分布计算连续得分,不仅降低了平局率,还天然支持评分粒度、重复评估和标准分解等多维扩展,从而更精准地分离正负样本,提升校准度。
- 连续验证信号不仅用于答案选择,更可泛化为任务进度代理与强化学习密集奖励。该方法利用细粒度得分估算任务完成度,集成到 Claude Code 中辅助开发者监控智能体系统;同时向强化学习提供稠密反馈,显著提升了 SAC 与 GRPO 在机器人操作和数学推理基准上的样本效率,开辟了验证信号的下游应用新范式。
方法
输入
待验证的候选解决方案(如代码补丁、机器人动作序列、医学诊断)与任务描述和评估标准一并输入。
关键模块
流程: LLM-as-a-Verifier 将验证建模为概率过程。首先将候选解及验证指令送入基座 LLM,然后对模型在评分 token 上的 logits 求期望,得到连续验证分数。此分数取代传统 LM-as-a-Judge 的离散打分(如 1-5),显著降低平局率,提升分辨力。
核心扩展维度:
- 评分粒度扩展 (Score Granularity Scaling):使用更细粒度的评分 token 集或直接利用 logits 分布计算期望,使正负样本的分数分布更可分,比较更校准。
- 重复评估 (Repeated Evaluation):对同一方案多次采样评分,聚合结果以降低方差。
- 标准分解 (Criteria Decomposition):将复杂验证目标拆解为子标准,分别评分后融合,将高维判断转化为低维判断,提高准确率。
成本高效排名: 引入 Probabilistic Pivot Tournament 算法,利用连续分数进行高效的成对比较与排序,平衡验证精度与 API 调用成本。
输出
输出每个候选方案的连续验证分数及最终排名。此外,细粒度信号可直接作为任务进度代理或为强化学习提供密集奖励。
与同类方法差异: 与传统 judge 输出离散分数不同,本方法通过概率期望获得连续信号,并在无额外训练的前提下,实现评分粒度、重复评估和标准分解三个维度的可扩展验证,将验证本身变成一种新的 test-time compute 扩展轴。
实验
实验设计
实验在四个 agentic 任务基准上评估 LLM-as-a-Verifier 的验证性能:Terminal-Bench V2(系统管理)、SWE-Bench Verified(软件工程)、RoboRewardBench(机器人奖励)和 MedAgentBench(医学代理)。框架利用连续评分(基于 scoring token logits 期望)、反复评估与标准分解多维度缩放验证精度。同时引入**概率枢轴锦标赛(Probabilistic Pivot Tournament)**平衡排序成本与准确率。
关键发现
LLM-as-a-Verifier 在所有基准上达到当前最优准确率:86.5% / 78.2% / 87.4% / 73.3%。缩放评分粒度有效分离正负样本,提升校准对比;反复评估与标准分解通过降低方差和任务复杂度持续增益。验证信号还可作为任务进度代理,使开发者监控 agent 系统,并作为密集奖励用于强化学习,提升 SAC 和 GRPO 在机器人与数学推理上的样本效率。
与基线对比的深度解读
相较于标准 LM judges(输出离散分数),LLM-as-a-Verifier 的连续评分大幅降低复杂方案对比的平局率,并提供细粒度反馈。概率化形式化使得验证可沿多维度扩展,无需额外训练。在成本控制上,概率枢轴锦标赛在有限调用预算下仍保持高排序准确率,优于全对比策略。该框架将验证从静态判别转变为可扩展动态流程,为 agentic 系统测评与优化提供新范式。
行业影响
落地场景
LLM-as-a-Verifier 提供了一种无训练成本的通用验证框架,通过计算 scoring token 的 logits 期望生成连续分数,能够显著提升 agentic 任务的解决方案质量评估。可直接应用于以下产品与业务:
- 自动化代码审查与修复:在 CI/CD 管线中,对 PR 或生成的补丁进行多维度连续打分,筛选最优修复方案,减少人工 review 负担。
- 智能体系统输出校验:用于客服、RPA、数据分析等含长链路脚本或工具调用的场景,自动甄别幻觉或执行错误。
- 医疗/金融合规性审核:对诊断建议、理赔决策等进行细粒度 criteria decomposition,输出可解释的连续置信度分数,辅助高风险决策。
- 通用 RL 的密集奖励信号:在机器人操作、数学推理等任务中,提供过程级 dense reward,提升 SAC、GRPO 等算法的样本效率。
商业价值
- 降本:替代部分人工验证与人工打分,Verifier 本身不需要额外训练,只需调用现有 LLM 推理接口,避免了训练专用 reward model 的昂贵标注与算力成本。
- 质量提升:连续分数机制大幅降低了 tie rate,使方案排序更精准(尤其在 Terminal-Bench V2 达 86.5%、SWE-Bench Verified 达 78.2%),直接降低生产环境中的错误率,间接减少事故赔偿或服务中断损失。
- 体验优化:可嵌入开发者工具(如 Claude Code 扩展),向开发者实时反馈任务进度与方案质量,加速迭代与调试,提升开发者效率与满意度。
与现有工作流的接口
- 部署方式:作为轻量级服务包装现有 LLM API(如 OpenAI、Anthropic),接收候选解与验证标准,返回连续分数与排名结果。无需修改模型权重或重新训练。
- 集成模式:
- 离线批量评估:对历史交互数据集进行离线验证,构建质量门禁。
- 在线实时筛选:在 agent 规划或代码生成步骤后,同步调用 Verifier,对多个 rollout 进行即时排名,仅执行最优动作。
- RL 反馈注入:将连续分数作为 reward 信号直接喂给训练循环,替换稀疏二元 reward,提升策略学习稳定性与收敛速度。
具体落地 Use Case
电商平台的智能客服方案择优:用户问题触发多个 LLM 生成的回答(含退换货政策、商品推荐等),LLM-as-a-Verifier 依据预先分解的 criteria(准确性、同理心、政策符合性)给出连续分数,平台优选最高分回答发送给用户,同时自动过滤“幻觉”答案。无需重新训练,可直接接入现有 Anthropic/GPT API,显著降低客诉率。
自动驾驶仿真场景的自动审核:仿真系统生成大量驾驶行为片段,传统人力审核效率低。引入 Verifier 对安全性、合规性、舒适性等维度进行连续评分,自动筛出异常场景,并将分数转化为 RL 的密集奖励,加速规控策略迭代。该框架的 Probabilistic Pivot Tournament 算法以可控成本完成多方案排序,适应仿真流水线的高吞吐需求。
局限
- **对 logits 的强依赖限制了实用性**:LLM-as-a-Verifier 的核心是计算评分 token 的 logits 期望,这要求模型输出完整的概率分布。但许多商业 API(如 GPT-4o、Claude)不直接暴露 logits,或只提供受限的 top-k logprobs。论文附录 B.6 提出了一种两阶段恢复流程(先用模型生成候选评分词,再重算其 logprob),这不仅增加了一倍推理开销,还可能因候选词集不完整而引入偏差。对于无法获取任何概率信息的模型(如纯黑盒 API),该方法完全无法应用,这大大缩小了可使用的模型范围。相比之下,传统 LM Judge 只需离散输出,对所有模型兼容。
- **多维度 scaling 带来高昂的计算成本**:论文验证了评分粒度、重复评估、标准分解的 scaling 收益,但每条轴上提收益都伴随着推理 token 数的线性或超线性增长。例如,增加评分 token 粒度(如从 5 个词扩到 500 个词)会使每次验证的 token 消耗剧增;重复评估(多次采样取平均)直接倍乘成本。尽管作者提出 Probabilistic Pivot Tournament 等成本优化策略,但其本质仍是牺牲部分召回率来降低开销,且在大规模任务部署(如持续集成中的自动化验证)时,累计成本仍难以忽视。论文未给出与简单方法(如多次调用离散 Judge 然后平均)在同等预算下的性能对比,使得 scaling 的性价比不够清晰。
- **验证性能对基础模型能力高度敏感**:框架本身是无训练的,因此验证质量完全依赖于底层 LLM 本身的理解与推理水平。当基础模型在特定领域(如医疗、法律)知识薄弱或推理能力不足时,生成的连续得分校准性会大幅下降。论文仅在 Gemini 2.5 Flash、Claude Sonnet 等强大模型上展示结果,未系统研究模型规模或系列(如从 7B 到 405B)变化对验证准确率的影响。在实际应用中,若选用的模型不够强,scaling 策略可能无法弥补基本判断力的缺失,而论文并未提供模型选择指引或最低能力阈值。