准确但不谦逊:评估知识冲突下 LLM Agent 的认知谦逊
当检索到的证据与 agent 的先验信念冲突时,它是修正答案、承认不确定性,还是坚持错误结论?现有对 agentic systems 的评估主要关注任务成功率,难以揭示 agent 如何处理此类冲突。我们提出以认知谦逊(epistemic humility, EH)评估 agent,即其在任务执行中识别、应对并传达不确定性的意愿。 我们将 EH 操作化为三个轨迹级行为维度:Identify、Solve 与 Escalate(ISE)。借助知识冲突 —— backbone language model 的参数化知识与所遇证据相矛盾,或两个上下文来源彼此不一致 —— 我们评估两种冲突设定:(1) 受控冲突,(2) 多步 agent 执行中自然发生的冲突,各配以匹配的无冲突对照。 评估四个 agent 后,我们发现更高的任务准确率并不必然意味着更强的认知谦逊:部分高准确率配置能在执行中识别冲突,却未在错误的最终答案中传达未解决的不确定性。轨迹级分析进一步显示,agent 常在早期步骤检测到冲突,却在后续步骤中未能维持或解决。 模型层面的干预可提升 EH,但往往以任务准确率为代价,表明认知谦逊源自 backbone model、agent harness 与评估环境之间的交互。
论文精读
TL;DR 论文评估 LLM Agent 在知识冲突下的**认知谦逊**:用 **Identify / Solve / Escalate** 三维度衡量轨迹行为,发现高任务准确率并不等于愿意承认不确定性,agent 常识别冲突却不跟进解决。
问题
问题背景
当前 LLM agent 研究聚焦于多步任务的成功率与工具调用效率,但较少关注 agent 在不确定性下的认知行为。
现有方法局限
现有评测主要使用端到端任务正确率(如 HotpotQA、WebShop),忽略轨迹中 agent 的知识冲突处理过程。具体局限包括:
- 只报告最终答案,无法区分 agent 是否正确识别并解决冲突;
- 缺少对“识别-解决-上报”等可观测行为的分解;
- 知识冲突场景未系统化构建:参数知识与检索证据矛盾、多源上下文不一致等真实冲突常被混入噪声;
- 因此高准确率可能掩盖 agent 对冲突的忽略或错误坚持,导致评估结果与部署可靠性脱节。
为什么这个问题难/重要
知识冲突在检索增强生成(RAG)和多智能体系统中不可避免。agent 需要在多步执行中持续追踪冲突信号,但现有 LLM 存在“早期检测、后期遗忘”现象;而谦逊行为与任务准确率之间不一定正相关,甚至可能冲突——承认不确定性有时意味着放弃给出一个自信但错误的答案。业界对高可靠系统(如医疗、金融)要求 agent 不仅能完成任务,还要正确沟通不确定性,否则用户会过度信任错误输出。
行业类比
类似自动驾驶中的“安全驾驶员接管”机制:系统不仅要在大多数情况下开得对,还要在感知冲突时及时降级并请求人工介入。
核心洞察
- 将 agent 评估从任务成功转向认知谦逊(Epistemic Humility),通过轨迹级行为维度 Identify, Solve, Escalate 衡量其在知识冲突下识别、解决和上报不确定性的能力。这区别于仅关注最终答案正确率的现有评估,能揭示高准确率配置也可能在内部识别冲突但最终不表达不确定性,暴露出结果正确但过程不谦逊的盲区,为可靠性评估提供更细粒度的诊断工具。
- 采用受控冲突与自然冲突双设置并配无冲突对照组,分离知识冲突对 agent 轨迹行为的影响,发现 agent 常在执行早期识别冲突,但后续步骤不跟进解决或上报,识别与解决/上报之间出现断裂。这比单步评估或只看任务结果更能捕捉多步执行中的动态变化,暴露了 agent 在长期规划与一致性方面的缺陷,为优化 agent harness 的执行逻辑提供具体切入点。
方法
输入:多步 Agentic 执行轨迹与知识冲突
方法以 agent 在多步任务中的完整执行轨迹作为输入。通过冲突识别管道(Conflict Identification Pipeline)构造两类样本:
- 受控冲突(controlled conflict):由研究者主动注入矛盾,使 backbone 参数知识与检索证据冲突,或两个上下文来源相互冲突。
- 自然发生冲突(naturally occurring conflict):在真实多步执行中自动检测到的知识冲突。 每类冲突均配有匹配的无冲突对照(matched no-conflict controls)。
关键模块:ISE 行为维度与 LLM Judge 评估
核心是将 epistemic humility (EH) 操作化为三个轨迹级维度:
- Identify:agent 是否在轨迹中识别到知识冲突或不确定性来源;
- Solve:agent 是否采取行动解决冲突(例如重新检索、对比来源、修正答案);
- Escalate:agent 是否在最终输出中向用户传达未解决的不确定性,而非给出错误但确定的答案。
评估使用 LLM judge 对完整轨迹进行评分,多个 judge 模型与人类一致性进行校准(human agreement)。
输出:任务性能与 EH 分数
输出包括标准任务性能指标(如 accuracy)与三个 ISE 维度的 EH 分数。方法进一步对比不同 agent 配置(四个 agents)在冲突与无冲突条件下的表现,分析准确性与 epistemic humility 的耦合关系。
与同类方法差异:现有 agentic 评估只关注任务成功,本方法首次将轨迹级“认识谦逊”分解为 Identify / Solve / Escalate 可量化维度,并将知识冲突作为系统性的 elicitation 工具。
实验
实验设计
提出评估 Epistemic Humility (EH) 的框架,通过知识冲突场景:受控冲突与自然发生冲突,各配无冲突对照。评估四个 agent,沿 Identify / Solve / Escalate (ISE) 三个轨迹级行为维度测量。
关键发现
- 高任务准确率与高 EH 无必然联系;一些高准确率配置在最终错误答案中不沟通未解决不确定性。
- 轨迹分析显示 agent 常在执行早期识别冲突,但后续步骤无法维持或解决。
- 模型级干预可提升 EH,但常以任务准确率为代价,表明 EH 源于 backbone model、agent harness 与环境的交互。
对比与启示
与仅关注任务成功的传统评估相比,本工作引入轨迹级行为评估,揭示 准确率与谦逊度的权衡。工程上,部署高准确率 agent 时应同时监测其不确定性沟通行为,避免静默失败。
行业影响
落地场景
认知谦逊 (EH) 评估框架可直接用于需要高可靠知识决策的智能体产品,例如:
- 企业级知识助手:当内部文档与模型参数记忆冲突时,判断 agent 是否承认不确定并请求人工确认,而非强行输出错误结论。
- 医疗辅助诊断:患者病历证据与模型医学知识不一致时,检测 agent 是否识别冲突并建议医生复核。
- 金融合规审查:合同条款与监管规则冲突时,观察 agent 是否升级风险而非擅自决策。
商业价值
- 降低风险:通过 ISE 指标筛选出“准确但傲慢”的配置,减少错误自信导致的高成本事故(如误诊、违规)。
- 提升体验:允许 agent 在不确定时主动升级人机协同,增强用户信任,避免沉默错误造成的隐性损失。
- 优化成本:自动识别低谦逊 agent,配合提示词干预(如 humility prompt),在保持可接受准确率下降低人工审核负载。
与现有产品/工作流的集成接口
- 评估阶段:将 EH 指标作为 CI/CD 流水线中的额外测试维度,与任务准确率并列监控。对每个 agent 配置运行受控冲突数据集(如反事实 QA 对),输出 Identify / Solve / Escalate 三类轨迹分数。
- 运行时监控:在 agent 执行多步任务时,通过 judge model 实时分析轨迹,当检测到“早期识别冲突但未解决”模式时,触发模板化提示或强制升级人工。
- 模型选型:用于对比不同 backbone 与 harness(如 ReAct vs. Plan-and-Execute)的组合,避免仅看任务得分导致选择“高准确但低谦逊”的配置。
具体 Use Case:电商客服退款争议
用户声称商品与描述不符,agent 检索到的历史订单证据与模型内置的商品知识冲突。EH 评估可检查 agent 是否:
- 在中间步骤识别到矛盾(Identify)
- 尝试重新查询或比较多个来源(Solve)
- 最终回复“无法确定,已转人工”(Escalate)
若 agent 最终错误地坚持原知识,EH 得分低,则触发流程改进:训练阶段注入 humility prompt,或在 harness 中加入强制升级规则。另一案例:内容平台自动审核中,平台政策更新与旧模型记忆冲突时,agent 应明确回退到最新文档,否则可能误判违规内容。
局限
- - **代理与任务覆盖有限**: 论文仅评估 4 个 agent 配置,且任务类型主要为检索增强问答与知识冲突场景,未覆盖更广泛的 agentic 任务(如工具调用、多轮交互、规划)以及非知识冲突的不确定性(如推理歧义、资源不足)。受控冲突通过人工注入构造,可能无法完全反映真实世界中自然冲突的分布;自然冲突的识别依赖自动 pipeline,其召回与精度虽有人工验证但规模有限,可能引入选择偏差。
- - **基于 LLM judge 的行为评估存在主观性与偏差**: ISE 三个维度由 LLM judge 按轨迹打分,虽附录报告了人类一致性验证,但验证样本规模可能较小,且 judge 模型与 backbone 可能共享相似偏见,尤其对 **Escalate**(沟通不确定性)维度,judge 可能偏向表面语气而非实际行为。此外,EH 量化为三个离散维度,丢失了谦逊的连续性与上下文相关性,难以跨任务统一校准。
- - **干预方法单一,未能揭示 EH 的底层机制**: 论文仅通过 prompt 层面的 humility prompt 证明可提升 EH 但降低 accuracy,未探索其他干预(如训练、解码策略、agent harness 配置)。结论指出 EH 源于 backbone、harness、environment 的交互,但未提供可操作的工程原则。与校准(calibration)或 conformal prediction 等工作相比,本文未提供概率化不确定性输出或可验证的保证,仅停留于行为描述,对实际部署的指导有限。