论文

VeriHarness:为长时程任务扩展 Agentic 验证能力

VeriHarness:为长时程任务扩展 Agentic 验证能力

随着 LLM agent 承担越来越复杂的长时程任务,验证其输出也愈发困难。本文研究在固定基座模型、且测试时无法获取参考答案或评分标准的条件下,如何增强验证能力:重复采样可得到包含互补正确论断的多条 rollout,但需要一个可靠的机制来判断哪些论断值得信任。 作者发现,分歧往往暴露正确答案,而共识却可能掩盖错误。据此提出 VeriHarness,将生成器所用的底层 LLM 转变为 agentic verifier,为其配备工作区、证据工具与可复用的验证技能:disagreement resolver 依据环境证据检验相互竞争的论断,consensus challenger 则检验共识论断并搜索被遗漏的需求,两者的发现共同指导最终产物的选择与修订。 在 5 个长时程工作区 benchmark 与 2 个前沿模型 上,VeriHarness 取得了所评测基线中最高的选择得分。基于证据的修订进一步提升平均表现,相较单次 rollout 在 Gemini 3.5 Flash 上提升 6.2 分、在 Claude Opus 4.8 上提升 6.4 分。此外,验证技能能够从失败反馈中自我改进,表明 VeriHarness 是扩展长时程 agentic verification 的新颖且关键的途径。作者还公开了覆盖全部 5 个 benchmark 与 2 个模型的约 26,000 条 rollout(生成成本超过 $100,000),以支持未来的 agentic verification 研究。

论文精读

TL;DR VeriHarness 将生成模型本身升级为带工作区与证据工具的 agentic verifier,通过证据化解分歧、挑战共识,在长时程任务上实现最优选择并驱动修订,平均提升超 6 个点。

问题

问题背景

随着 LLM agents 处理越来越复杂的长时程任务(如生成研究报告、操作电子表格、编写多步代码),验证这些产物的正确性已成为关键瓶颈。业界关注如何在不依赖参考答案或评分标准的情况下,自动评估并提升 agent 输出质量。

现有方法局限

目前主流方法依赖重复采样 + 投票(如 self-consistency),假设多数共识正确。但本文指出:同一模型生成的多个 rollouts 往往共享系统性错误,共识可能掩盖错误,而分歧反而暴露正确替代。此外,现有验证方案通常需要参考答案或人工制定的 rubrics,测试时不可得;即使有外部工具,模型也缺乏主动检索证据、检验假设的机制,导致验证停留在表面。

为什么这个问题难且重要

长时程任务涉及多步推理和外部工具交互,错误会随步骤累积;验证需要跨来源证据比对与逻辑判断,远超单一生成模型的固有能力。业界对 agent 系统的可靠性 和 可审计性 要求不断提高,人工验证成本高昂且难以规模化。因此,构建能自主使用工具、主动挑战共识的验证框架,是提升 agent 部署可信度的核心挑战。

行业类比

类似自动驾驶系统中的多传感器融合验证:不能仅依赖单一摄像头或雷达的多数投票,而需要交叉验证不同来源证据,才能可靠判定决策的正确性。

核心洞察

  • VeriHarness 的核心洞见是:在长时程任务中,通过将生成模型包装为 agentic verifier,为其配备 workspace、evidence tools 与 reusable verification skills,可以在不增加模型参数或训练的情况下提升验证可靠性。与常见自洽性投票(如 Self-Consistency)仅聚合答案不同,VeriHarness 显式区分 rollout 间的 disagreement 与 consensus,并利用环境证据裁决冲突、挑战共识,从而突破单模型生成的内在偏见。这种“以工具和流程放大固定模型能力”的思路,为 agentic verification 的 scaling 提供了新方向。
  • VeriHarness 发现共识可能掩盖错误而分歧反而暴露正确替代,这一观察颠覆了“多数投票即正确”的假设。其设计的 disagreement resolver 与 consensus challenger 分别针对互补正确片段和共享缺陷,使验证过程从被动选择变为主动查证。相比依赖参考答案或 rubric 的方法,VeriHarness 完全无需外部 ground truth,且通过 failure feedback 实现技能自我进化,展示了一种可扩展的闭环验证框架。这为长时程 agent 的输出质量保障提供了可操作的工程路径。

方法

输入

给定同一生成器在长程任务上的多个 rollouts(重复采样产物),以及可交互的 workspace 环境。测试时无参考答案或评分标准,需要从 rollouts 中筛选正确主张并生成最终 artifact。

关键模块

VeriHarness 将底层 LLM 转化为agentic verifier,提供三类支撑:

  • workspace:一个可执行操作的环境,用于读取文件、运行代码、检查中间产物。
  • evidence tools:面向环境取证的工具集,如文件内容比对、状态查询。
  • reusable verification skills:从失败反馈中沉淀的可复用验证技能。

核心流程分为两支:

  1. Disagreement Resolver:识别不同 rollouts 间的冲突主张,主动获取环境证据进行裁决,从而暴露被共识掩盖的正确替代方案。
  2. Consensus Challenger:对 rollouts 中一致出现的 claims 进行压力测试,并搜索可能遗漏的需求约束,防止共识性错误存活。

两个组件的验证发现汇总到 Adjudication 阶段,决定最终 artifact 的选择或触发Evidence-Backed Revision:基于已验证证据对选定 rollout 进行修订。

输出

经过证据验证、必要时修订的最终 artifact(如报告、表格、代码库等)。

与同类方法差异

区别于单纯的自一致性投票或依赖外部参考答案的验证器,VeriHarness 将生成器自身转化为能主动查询环境、挑战共识的 agentic verifier,在无参考标准条件下系统提升长程任务的验证可靠性。

实验

实验设计

  • 在五个 long-horizon workspace benchmarks 上评估,使用 Gemini 3.5 Flash 与 Claude Opus 4.8 作为基础模型。
  • 对比单次 rollout、多数投票等基线,评价 selection score(选中正确 rollout 的准确率),以及 evidence-backed revision 后的最终任务得分。
  • 释放约 26,000 个 rollouts 供复现。

关键发现

  • VeriHarness 在所有基线中取得最高 selection score。
  • Evidence-backed revision 进一步提升平均性能,相对单次 rollout 分别提升 +6.2(Gemini 3.5 Flash)与 +6.4(Claude Opus 4.8)。
  • 验证技能能够从失败反馈中自我改进,证明 agentic verification 可扩展。

与基线对比解读

  • 相比多数投票等简单集成方法,VeriHarness 通过 分歧解决器 检查竞争声明、共识挑战器 测试共享声明并搜索遗漏需求,有效避免共识掩盖错误、利用分歧暴露正确替代。
  • 生成器自身被赋予 workspace、evidence tools 和 reusable skills 成为验证器,不依赖外部模型或参考答案,在固定 base model 下实现更强的验证能力,为长周期任务提供了一条可扩展的验证路径。

行业影响

落地场景

VeriHarness 适用于需要长程 agent 输出验证的业务,如代码自动修复、数据分析报告生成、文档撰写、合规审计等开放式任务。典型 use case:

  • 电商平台:商品详情页自动生成后的事实一致性校验,验证卖点描述是否与商品参数、图片、用户评价中的证据相符,减少虚假宣传风险。
  • 在线教育:无参考范文的作文自动评分与反馈,通过多次采样不同评分意见,依据写作规范证据(语法、结构、逻辑)裁决分歧,提升评分可信度。

商业价值

核心降本点在于减少人工复核成本。传统验证依赖参考答案或人工评分,VeriHarness 利用环境证据自动裁决,可将人工审核量大幅降低。同时通过多次采样 + 证据支持修订,单次任务平均性能提升 6.2–6.4 分,意味着更高的首次交付合格率,减少返工和客户投诉。在金融研报生成、医疗报告校验等高风险场景,该机制能显著提升输出可靠性,降低合规风险,带来直接的体验与信任提升。

与现有产品/工作流的接口

VeriHarness 可作为独立的验证中间件接入现有 agent pipeline,无需更换底层模型。其核心组件包括:

  1. Workspace + 证据工具:与现有工具调用(数据库查询、代码执行、网页检索)对接,获取验证证据。
  2. 验证技能库:类似可复用的 prompt 或 skill 模块,可接入现有 prompt 管理系统,并从失败反馈中自我迭代。
  3. 裁决器输出:直接驱动最终产物选择或修订,可集成到 CI/CD 流水线、模型评测平台或生产环境监控中。

代码与数据集已开源(GitHub),便于快速原型集成。

局限

  • **计算与资源开销显著**:VeriHarness 依赖多次采样和代理验证循环,论文发布的约 26,000 个 rollouts 成本超过 10 万美元,推理成本远高于单次生成。对于资源受限的团队或需要实时响应的场景,这种开销可能难以承受。实际部署时需权衡验证收益与计算预算,或设计自适应采样与早停策略来降低平均成本。
  • **依赖环境证据工具与任务类型**:方法假设存在可查询的环境证据工具(如代码执行、数据库检索)来仲裁声明真伪,但许多长程任务(如开放域写作、创意设计、复杂推理)缺乏明确的外部验证源,此时证据工具可能失效或引入额外噪声。论文在五个 workspace 基准上评估,这类基准天然具备可执行反馈,对其他类型任务的泛化性尚未得到验证。
  • **自我进化机制的闭环挑战**:验证技能从失败反馈中自我改进需要可靠、高质量的失败信号,但在实际部署中,失败样本可能稀疏、噪声大或需要人工标注,导致技能更新不稳定。此外,论文未分析技能库随时间膨胀后的管理成本与潜在冲突问题,长期运行的代理系统可能面临技能维护的额外负担。
论文Caiqi Zhang2026-10-01原文

相关内容