Ignorance or Incompetence? 构建知识门控、可验证的 LLM Agent 任务
专业 Agent 任务往往依赖公共语料中缺失的约定(conventions),但现有基准很少控制 Agent 是否能访问这些约定。我们提出一种知识门控的任务构建协议:将任务指令与一个包含私有约定、参考表和实用算子的紧凑工件(artefact)分离。 构建阶段的可追溯性(provenance)、在提供/隐藏工件条件下字节相同的任务指令、泄漏审计(leak audits)以及可执行见证(executable witnesses),使得对工件的依赖关系变得明确且可检验。在十五个校准任务上,某个前沿 Agent 配置在提供工件时通过率为 68.0%,而在无工件时为 0%;在其中一个任务上,使用看似合理但错误的工件在五次试验中也得到 0% 通过率。 对于结构化任务,确定性求解器(deterministic solvers)和规则语料(rule corpora)提供精确的真实标签;对于无法由单一可执行预言机检查的输出,则使用命名的标准级评分细则(criterion-level rubrics)。经过配置相对的校准筛选,最终保留了七个满足我们五次试验经验性知识门控筛查的任务。 这些实验验证了构建协议的行为;但并不能证明保留的任务能改善后训练。我们已在 https://github.com/DatagridsAI/Knowledge-Gated-Task-Construction 公开发布部分任务集和配套工具。
论文精读
TL;DR 构建知识门控任务协议:把任务指令与私有约定/参考表等 artifact 分离,使 LLM 代理是否真正依赖隐藏知识变得可检验,从而区分‘无知’与‘无能’——校准任务中无 artifact 时通过率 0%。
问题
问题背景: LLM agent 评估正从通用能力转向专业场景,但许多专业任务依赖私有约定(如内部编码表、规则手册),这些知识不在公共预训练语料中。
现有方法局限: 传统 benchmark 通常假设任务所需知识已隐含在指令或模型参数中,导致无法区分无知 (ignorance, 缺少知识) 和无能 (incompetence, 有能力但执行错误)。即便引入外部知识库,也常缺乏构建时溯源与泄漏审计,指令本身可能意外泄露工件内容,或缺少可执行见证来验证 agent 是否真正依赖工件。此外,确定性求解器与规则语料库的缺失,使结构化任务的验证难以保证精确。
为什么重要/难: 构建有效测试必须保证有/无工件时任务指令字节级相同,同时工件紧凑且可验证。这需要多重机制:数据溯源、泄漏检测、可执行见证、配置相对校准。业界高度关注 agent 在真实专业场景中的可靠性,评估必须回答“失败是因为没给知识,还是给了也不会”,否则无法定位改进环节。
行业类比: 类似部署医疗编码助手时,若输出错误,需要判断是因为没提供最新 ICD 编码手册,还是提供了也理解不了编码规则。
核心洞察
- 知识门控任务构造协议将任务指令与私有惯例 artifact 分离,并强制两条件下指令字节级相同、附带构造时溯源、泄漏审计和可执行见证,从而显式测试 agent 对隐藏知识的依赖。与仅检查最终答案的基准不同,该协议能区分“无知”与“无能”:实验中某前沿 agent 配置在有 artifact 时通过率 68.0%,无 artifact 时 0%,且错误但看似合理的 artifact 也导致 0%,证明任务成功并非靠猜测或表面模式。
- 配置相对校准屏幕通过五次试验经验门控筛选任务,但作者明确该实验仅验证协议行为,不证明保留任务能改善训练后能力。这种谨慎的 evidential scope 隔离了任务构造工具与基准有效性声明,避免过度推广。同时,确定性求解器和规则语料库提供精确 ground truth,命名标准级 rubrics 支持无法由单一可执行 oracle 检查的输出,展示了可验证性设计的层次化思路,为后续构建更稳健的 agent 评估提供工程模板。
方法
输入
- 任务指令
instruction与知识工件artefact分离。工件包含私有约定、参考表、效用运算符等,来源为公开语料之外。
关键模块
- 构建时溯源 确保工件来源可审计,避免数据污染。
- 字节级指令一致性:提供与扣留工件条件下,任务指令完全相同,仅改变是否注入工件。
- 泄漏审计 检查任务与工件是否泄漏答案或提示。
- 可执行见证 通过确定性求解器、规则语料库或评分标准实现自动验证。
- 知识门控家族:结构化任务使用确定性求解器和规则语料库提供精确真值;非结构化任务使用命名标准级评分标准。
- 配置相对校准筛选:采用五试验经验筛选,要求提供工件时显著通过、扣留工件时接近零性能。
输出
- 经筛选的知识门控任务集,附带可验证真值、工件依赖证据与校准报告。
差异
与常见合成基准不同,该协议把隐性约定显式化为独立可控制的 artefact,并用字节相同指令和无工件时通过率为零来证明任务对知识的依赖,而非简单追加私有上下文。
实验
实验设计
构建 knowledge-gated task-construction 协议,将任务指令与私有工件分离,工件包含私有约定、参考表和实用算子。在提供工件 与隐藏工件 两种条件下保持指令字节一致,并执行泄漏审计与可执行见证。共构建 15 个校准任务,使用一个前沿代理配置,每个任务多次试验(如 5 次)评估通过率。
关键发现
- 带工件时通过率 68.0%,无工件时 0%,证明任务依赖工件知识。
- 对某一任务,给出看似合理但错误的工件,5 次试验通过率仍为 0%,说明代理无法仅靠先验猜测。
- 结构化任务采用 deterministic solvers 和 rule corpora 提供精确 ground truth;非结构化输出用 criterion-level rubrics 支持。
- 配置相对的校准筛选(calibration screen)保留 7 个满足 5 次试验经验知识门控的任务。
与基线对比解读
传统基准不控制代理是否接触约定,本工作通过双条件设计建立了内部基线:无工件条件为“无知”下界,带工件条件为“能力”上界。可排查代理失败是缺知识(ignorance)还是缺能力(incompetence)。部分公共配对条件基准的上下文证据(如第 4.4 节)辅助验证。工程上,该协议可复用于构建公司内部私域流程任务,避免公开数据污染导致指标虚高。
行业影响
落地场景
该协议可直接用于企业私有知识增强型 agent 的能力评估与回归测试。例如,客服 agent 需要严格遵循内部退货政策表(私有约定),电商推荐 agent 依赖商品类目映射表(私有参考表)。通过构造知识门控任务,可以区分模型是“不知道约定”还是“无法执行约定”,为 agent 上线前的可靠性验证提供证据。
商业价值
- 降低误判成本:传统基准无法控制私有知识可得性,可能将“知识缺失”误判为“推理无能”。该协议提供
byte-identical指令对比,能精确定位失败根因。 - 提升部署信心:当有 artifact 时 pass@1 达 68%,无 artifact 为 0%,说明任务对知识高度敏感。企业可据此筛选出真正需要注入知识的场景,避免不必要的大模型重训练。
- 加速迭代:
executable witnesses与provenance支持自动审计,减少人工评估开销。
与现有产品/工作流的接口
- 评估流水线:可集成到现有 LLM evaluation harness(如 LangSmith、Azure AI evaluation),作为自定义 metric 或 task 生成器。
- RAG 系统:用该协议测试 RAG 检索到的文档是否被 agent 正确利用,侧面对比不同 retriever 的效果。
- CI/CD:在模型或提示词更新时,运行知识门控任务集作为回归测试,防止私有约定被遗忘。
具体 use case:一家跨国零售企业部署退货客服 agent,使用该协议生成 10 个依赖内部退货规则的对话任务,并分别为 agent 提供正确规则书、错误规则书和无规则书。结果显示仅正确规则书条件下通过率稳定 > 60%,错误规则书为 0%。据此,团队可以确定 agent 确实读取并遵循了注入的知识,而不是靠猜测或记忆,从而批准上线。另一个场景:金融服务企业的合规报告生成 agent,其输出无法用单一可执行 oracle 检查,可使用 criterion-level rubrics 建立多维度评分标准,验证其对私有监管映射表的遵循度。
局限
- 论文明确承认,实验仅验证了构建协议的行为,并未确定保留任务能改进 post-training。这意味着该协议的主要价值在于评估代理是否真正依赖私有约定,而非提供训练数据或提升模型能力。因此,后续工作若希望将此类任务用于训练或 RLHF,仍需另行验证其效果,限制了当前成果的适用范围。此外,该协议仅确保任务对知识门控敏感,并不保证任务在其他维度(如推理难度、现实性)上的价值,降低了其直接转化为训练资源的潜力。
- 任务规模较小,仅 15 个校准任务经过五试验筛选后保留 7 个,样本量有限可能导致校准结果的统计显著性不足,难以推广到更广泛的任务类型。同时,配置相对校准屏幕依赖于特定前沿代理配置,如果更换代理模型或版本,可能需要重新校准,增加了维护成本。此外,任务构建过程涉及人工设计工件和规则,存在一定主观性,可能影响任务的可复现性和一致性,使得不同团队构建的任务集难以直接比较。
- 与大规模基准(如 MMLU、BigBench)相比,本文任务套件规模小且覆盖领域有限,其私有约定类型(参考表、工具运算符等)可能无法全面代表真实专业任务中的知识门控多样性。泄漏审计和可执行见证虽然提供了自动化手段,但工件设计和审计标准仍依赖人工判断,可能引入偏差。另外,该协议主要适用于结构化或有明确规则的任务,对于开放式、创造性任务,如何定义知识门控和验证仍待探索,限制了其在这些场景下的适用性。