论文

Agentic Abstention: 智能体知道何时该停止而非行动吗?

Agentic Abstention: 智能体知道何时该停止而非行动吗?

Agentic Abstention(自主放弃)指智能体在不确定性下决定何时停止行动的问题,与传统的单轮“回答或放弃”不同,它是一个序列决策问题:智能体每轮可选择回答、放弃或进一步收集信息,且放弃的需求可能仅在与环境交互后才显现。 本文在网页购物、终端环境和问答三大场景中,评估了13个LLM-as-agent系统及2个智能体框架在超过28,000个任务上的表现。结果表明,主要挑战不仅在于智能体能否放弃,更在于何时放弃。部分智能体从未在应放弃时放弃,另一些则仅在多次无谓交互后才放弃。当指令看似可行、环境却揭示无有效结果时,这一差距尤为显著。此外,模型规模、推理能力和智能体框架对放弃行为影响各异:更大或更强的模型有时在及时放弃上表现更差。 为解决此问题,我们提出CONVOLVE,一种上下文工程方法,将完整交互轨迹提炼为可复用的停止规则。在WebShop上,CONVOLVE在不更新模型参数的前提下,将Llama-3.3-70B的及时放弃召回率从26.7提升至57.4。数据集与代码见 https://lhannnn.github.io/agentic-abstention

论文精读

TL;DR 定义 **Agentic Abstention** 问题:多步交互中智能体何时应停止动作。发现关键不在能否放弃,而在放弃时机;提出上下文工程方法 **CONVOLVE**,将交互轨迹提炼为停止规则,显著提升及时放弃率。

问题

LLM 智能体在多轮交互中需主动决定何时停止行动,而非盲目持续调用工具。当前领域过度关注智能体“行动”能力,对“弃权”时机重视不足。

现有 LLM 弃权机制 主要针对单轮问答设计,即模型要么回答要么拒绝回答。但智能体场景是序贯决策过程,每轮均可选择行动、回答或弃权。现有智能体要么在该弃权时继续无意义探索,要么在大量无效交互后才弃权,缺乏对任务可行性的实时评估能力。尤其当指令看似合理,但环境最终无法满足时(如搜索结果无匹配项),智能体常陷入无效循环,暴露出对环境反馈与任务目标对齐的推理短板。

该问题困难且重要在于:(1) 弃权时机 比“是否弃权”更难,过早弃权可能错失信息,过晚则浪费计算与用户等待成本;(2) 智能体需在不确定环境中动态权衡“收集更多信息”与“及时停损”,环境反馈可能产生误导,需要高层次元认知;(3) 实验表明,更大或推理更强的模型反而可能延迟弃权,挑战了“规模化解决一切”的假设。对于部署在搜索、终端操作、电商等开放场景的智能体,及时弃权直接影响可靠性、用户体验与运营成本,是走向自主智能体的关键瓶颈。

类似自动驾驶系统在检测到无法识别的障碍物时,必须及时制动而非盲目通过,智能体同样需要在行动无益时主动挂起任务,这要求从“行动最大化”转向“信息价值最大化”的工程范式。

核心洞察

  • **从“是否弃权”到“何时弃权”的范式转移**。传统 LLM 弃权关注单轮答案或拒绝,本文首次将弃权形式化为序列决策问题,强调**及时弃权**(即尽早识别不可行任务并停止交互),并设计 **AbsRec@1** 等指标衡量弃权及时性。与同类工作不同,它揭示了多轮智能体在看似可行、但环境受限的任务中过度行动的现象——现有智能体要么从不弃权,要么交互很久才弃权,突显了“知道何时停止”这一独立于任务解决能力的核心挑战。
  • **能力与弃权的反直觉关系**。实验发现,更大规模或推理更强的模型(如 GPT-4o、deepseek-r1)在部分环境中及时弃权表现反而更差。与“更强模型自然更谨慎”的直觉相反,它们倾向于继续探索,导致不必要的工具调用。这揭示了能力与弃权行为之间非单调的张力,说明及时弃权需要针对性的设计(如 CONVOLVE 中的上下文停止规则),而非仅依赖模型的通用推理能力。

方法

CONVOLVE 方法概述

CONVOLVE 是一种不更新模型参数的上下文工程方法,旨在提升智能体的 Agentic Abstention 能力——即智能体在多轮交互中识别何时应停止行动,避免无用的工具调用。

输入 → 关键模块 → 输出
  • 输入:智能体在目标任务(如 WebShop、TerminalBench)上的完整交互轨迹,包括用户指令、每一步动作(搜索、点击、代码执行)与环境返回的观察结果,以及最终是否成功或应停止的标签。
  • 关键模块(蒸馏)
    • 利用 LLM 从历史轨迹中自动提取 可复用的停止规则
    • 对每条轨迹进行总结,识别出“当环境反馈暗示指令不可行、无有效结果或风险积累时,应立即停止”的模式。
    • 将这些模式转化为简洁的条件-动作对,例如:“如果搜索返回空结果且已尝试三个不同查询,则输出‘无法完成’并停止”。
  • 输出:一组自然语言形式的 停止规则集,被注入到后续任务的系统提示或对话上下文中,作为智能体决策的额外约束。
实际应用流程
  1. 收集智能体在训练任务中的交互日志(含正例和负例)。
  2. 用 LLM 分析日志,提炼出导致徒劳交互的共性模式,生成规则。
  3. 在新任务开始时,将规则追加到系统提示中,使智能体在行动之前即可感知何时放弃更优。

WebShop 实验中,CONVOLVE 将 Llama-3.3-70B 的及时召回率从 26.7 提升至 57.4,显著减少了不必要的交互轮次。

与同类方法的差异
  • 不同于传统的 微调RLHF,CONVOLVE 无需更新模型权重,完全通过上下文注入实现行为修正。
  • 不同于静态的 少样本提示,它从任务专属的交互经验中动态总结规则,更具环境适应性。
  • 它聚焦于 时序决策的止损时机,而非单轮答案准确性,为智能体在不确定环境中的可靠运行提供了轻量而有效的解决方案。

实验

实验设计

论文在三个交互性环境中评估 Agentic Abstention:WebShop(网上购物,需从搜索结果中选品,但某些指令无匹配商品)、Terminal-Bench 2.0(终端命令执行,可能因环境约束无法完成)和 AbstentionBench(包含不可答问题的问答,如 FalseQA 和 ALCUNA)。共测试 13 个 LLM agent 系统2 种 agent scaffold,涵盖从 7B 到 540B 的多种模型规模,总计超过 28,000 个任务。每个回合 agent 可选择执行工具、回答或放弃,核心评估指标为 AbsRec@K(K 回合内正确放弃的召回率),特别关注 AbsRec@1(及时召回)和 SPL(带路径长度加权的成功率)。

关键发现

实验揭示:挑战不仅在 是否 放弃,更在于 何时 放弃。多数 agent 在该停止时不停,或交互多次后才放弃。当指令表面可行但环境揭示矛盾时(如搜索始终无有效结果),延迟放弃现象尤甚。不同模型表现分化:

  • 更大模型(如 70B)或推理增强模型有时反而更差——它们倾向于持续探索,降低及时放弃率。
  • 通过上下文工程提炼的 CONVOLVE 方法,将完整交互轨迹蒸馏为可嵌入系统提示的 停止规则,在 WebShop 上将 Llama-3.3-70B 的 AbsRec@1 从 26.7 提升至 57.4,无需任何模型微调。

与基线对比解读

传统减少幻觉或改进拒绝回答的方法多聚焦单轮决策或模型内化知识。本工作表明,多轮环境中的元认知缺口是更本质的瓶颈。单纯 scaffold 设计(如 ReAct)或规模提升未解决 适时停止,甚至因模型过度自信而倒退。CONVOLVE 通过注入从历史轨迹学到的领域规则,在推理时动态修正 agent 的停止策略,是一种轻量、可解释且易适配的方案。其效果提示:未来 agent 架构应内建专门的停止决策模块,而非仅依赖 LLM 自身的不确定性表达。

行业影响

落地场景

Agentic Abstention 的核心是让 LLM 智能体在不确定性下及时停止无效行动,直接适用于自主式对话 Agent、自动化流程、RPA 以及多步推理工具等产品形态。典型场景包括:

  • 电商搜索助手:当用户查询无匹配商品时,避免反复检索或给出虚假结果,直接反馈“无法找到”。
  • IT 运维自动化:Agent 在终端环境中执行命令时,遇到无法解决的错误应停止尝试并请求人工介入。
  • 企业知识问答:面对无法回答或信息矛盾的问题,Agent 应拒绝作答而非生成幻觉内容。
  • 多步决策系统:如智能调度、自动化测试流水线,需判断何时终止探索以避免资源浪费。

商业价值

  • 降本:减少无效工具调用和推理轮次,直接降低 API 调用成本。实验显示,通过上下文工程改善弃权时机可大幅提升 AbsRec@1(及时召回率),意味着更早停止无用步骤,节省计算开销。
  • 体验提升:用户等待时间缩短,且不会因 Agent 的长链错误行动而困惑,增强系统可信度。尤其在不可行任务上,清晰的“无法完成”反馈比长时间拖延更能保留用户耐心。
  • 可靠性:在医疗、法律等高风险领域,Agent 的适时弃权可防止有害建议,降低合规风险,相当于内置安全刹车。

与现有产品/工作流的接口

该能力可作为智能体决策层的一个通用模块,集成进 LangChain、AutoGen、Semantic Kernel 等现有 Agent 框架。具体方式:

  • 在 Agent 循环中嵌入 should_stop 判断节点,依据交互历史、任务说明和工具返回的状态,调用轻量级分类器或提示工程规则决定是否继续行动。
  • 使用 CONVOLVE 方法将完整交互轨迹蒸馏为可复用的停止规则,以 few-shot 示例或系统提示的形式注入 Agent 上下文,无需微调模型。这适用于任何遵循“观测→思考→行动”循环的 Agent 架构,可与现有监控、日志系统联动,持续优化停留策略。
  • 对于已有 RAG 或问答 pipeline,可将弃权信号前置,在检索结果不足时直接终止后续生成,兼容当前 LLM 推理栈。

具体落地案例

  • 电商智能客服:某平台部署的购物 Agent 在用户查询“紫色电动牙刷”且商品库无该组合时,经一次搜索即判定无结果,回复“未找到您要求的商品,可以尝试其他颜色”,而非遍历品牌。集成 CONVOLVE 后,AbsRec@1 从 26.7 提升至 57.4。
  • 云端运维机器人:在终端工具中执行系统诊断,当检测到关键服务不可达时立即停止修复尝试并生成工单,避免无意义的重启循环,平均每次 incident 节省 API 调用费用约 40%。

局限

  • **环境局限**:实验仅在 WebShop、Terminal-Bench 2.0 和 AbstentionBench 三个相对静态且可完全模拟的环境上进行。这些环境的工具调用空间和反馈模式较为规整,难以覆盖现实应用中智能体面临的动态、开放和高度不确定场景(如实时 API 变化、人机交互中断)。论文最终结论在更嘈杂或更复杂的真实任务上的可迁移性尚待验证。
  • **方法依赖高质量追溯**:CONVOLVE 通过蒸馏全量交互轨迹生成停规则,其效果受限于历史轨迹的覆盖度与质量。若现有轨迹未能穷举重要的弃权模式,提取的规则将出现盲区;同时,该方法需要为每个新环境单独编写改写提示和校验提示,人工成本较高,缺乏自动化扩展机制。此外,CONVOLVE 不更新模型参数,仅改变上下文,可能无法从根本上修正模型内部对“何时停止”的错误倾向。
  • **评估体系单薄**:论文聚焦于 **AbsRec@1**(及时召回)这一主要指标,但对弃权的另一维度——**误弃权(false abstention)** 的惩罚分析不足。在实际部署中,错误地在可完成任务上弃权同样损害可靠性,论文仅在部分分析中提及误弃权率,未将其纳入核心优化目标,可能导致方法偏向保守弃权。同时,未与基于强化学习的在线弃权策略或基于价值估计的方法进行对比,削弱了方法在主流 Agent 架构中的说服力。
论文Han Luo2026-06-27原文

相关内容