论文

基于 On-Policy 内在知识边界增强的高效 Agentic 强化学习

基于 On-Policy 内在知识边界增强的高效 Agentic 强化学习

Agentic 强化学习(RL)虽能有效训练具备外部工具调用能力的 LLM 智能体,但现有方法存在两个问题:1) 训练过程导致冗余工具调用激增;2) 模型内在知识边界模糊,无法区分何时需要工具、何时仅凭参数知识即可。基于奖励塑形的现有方案提供粗糙的优化目标,往往不加区分地抑制工具调用,引发奖励黑客问题。 为此,本文提出 AKBE(Agentic Knowledge Boundary Enhancement),一种策略内方法。它在训练时通过双路径 rollout(带工具路径 vs 无工具路径)动态探测模型的内在知识边界——即每个实例是否需要工具以及最低工具调用次数。通过对比两条路径的正确性,AKBE 对轨迹分类并构造针对性的监督信号,引导每个问题的高效工具使用模式。这些信号无缝集成到 Agentic RL 训练循环中。 在 7 个 QA 基准上的实验表明,相比标准 Agentic RL,AKBE 将任务准确率平均提升 +1.85,工具调用减少 18%,工具生产率提高 25%,且未牺牲准确率。进一步分析验证了其跨不同 RL 算法的即插即用兼容性以及各信号类别的作用机制。代码已开源。

论文精读

TL;DR AKBE 通过在线双路径 rollout 动态感知 LLM 智能体的知识边界,生成定向监督信号,在不牺牲准确率下减少 18% 的工具调用,提升 25% 工具效率。

问题

Agentic RL 训练 LLM 智能体使用外部工具,已成为提升任务解决能力的热点方向。然而,现有训练过程会导致模型频繁进行冗余工具调用,并模糊其内在知识边界(即区分何时依赖参数化知识,何时需要工具)。当前缓解方案主要基于奖励塑形(Reward Shaping),通过添加粗粒度的工具调用惩罚项来抑制工具使用。这种全局性的优化目标过于生硬,倾向于不加区分地抑制所有工具调用,引发奖励黑客(Reward Hacking):模型单纯降低工具调用频率以最大化奖励,甚至在需要工具的任务中也选择直接回答,最终损害准确性。

该问题的技术难点在于,知识边界是实例相关的,需要细粒度信号动态引导:既要在模型自身知识充足时避免冗余调用,又要在必要时鼓励高效工具使用。静态的惩罚难以实现这种平衡,且任何过度的惩罚都会损害工具使用的意愿。在业界实际部署中,工具调用直接关联计算延迟与成本,因此在不牺牲准确率的前提下提升工具生产效率成为关键关切。

类似场景:智能客服模型中,系统必须实时判断是否需要查询知识库——恰当决策能兼顾低延迟与高准确性,避免错误激活外部 API 造成资源浪费。

核心洞察

  • AKBE 通过在线双路径比较精确建模“知识边界”,而非粗粒度奖励塑形。现有工作通常使用奖励塑形在整体上鼓励减少工具调用,但这种粗粒度信号容易导致模型盲目抑制工具调用,造成奖励黑客。AKBE 在每个训练步骤中对同一问题执行带工具和不带工具两种 rollout,通过比较正确性将轨迹分为四类(模型已知答案、需要工具、工具调用冗余等),并据此构建针对性的监督信号,从而显式地教会模型何时需要使用工具。这种基于内在知识边界的细粒度优化避免了奖励黑客,实现了更高效的工具利用。
  • AKBE 实现了无权衡的性能提升:同时提高准确率和减少工具调用。传统方法往往在工具调用效率和任务准确率之间进行权衡,抑制工具调用可能牺牲准确率。AKBE 在七个 QA 基准上平均提高准确率 +1.85%,同时减少工具调用 18%,工具生产力提升 25%,证明通过精准的边界引导,模型可以在更少调用工具的情况下提高答案质量,解耦了效率与准确率的矛盾。这种即插即用的特性也使其易于与其他 RL 算法集成,具有广泛的应用潜力。

方法

输入与任务定义

给定训练样本(问题 $q$),模型依次生成思考与回答 token,并可调用搜索工具获取外部信息。任务目标是在正确性约束下最小化工具调用,使模型学会区分何时依赖参数化知识、何时必须使用工具。

双路径轨迹滚动(Dual-Path Rollout)

AKBE 在每个训练步骤对同一问题执行两条并行的在线策略 rollout:

  • with-tool 路径:允许模型调用工具,生成完整轨迹 $\tau_{\text{tool}}$。
  • no-tool 路径:强制禁用工具,模型仅基于内部参数化知识生成轨迹 $\tau_{\text{no_tool}}$。

通过对比两条路径的最终答案正确性,为每个问题实例动态推断其知识边界(knowledge boundary),即是否需要工具以及所需的最少调用次数。

边界引导的信号构建

基于双路径正确性对比,将所有轨迹归类为四种类型,并针对性地生成监督信号:

  • 工具依赖型(Tool-dependent):仅 $\tau_{\text{tool}}$ 正确 → 鼓励使用工具,保留工具调用行为。
  • 高效率型(Efficient):两条路径均正确 → 模型内在知识已足够,信号抑制多余的工具调用(如通过负梯度的 DPO 对冗余调用进行惩罚)。
  • 冗余型(Redundant):$\tau_{\text{no_tool}}$ 正确但 $\tau_{\text{tool}}$ 错误 → 工具使用引入错误,强制降权工具调用。
  • 不足型(Insufficient):两条路径均错误 → 不做针对性奖励,仅依靠原始正确性奖励优化。

这些信号被封装为 token 级的优势标签或偏好对,直接注入训练目标(如 GRPO 或 PPO),实现实例级、细粒度的工具使用引导

联合训练目标

最终优化目标为:

$$ \mathcal{L}{\text{AKBE}} = \mathcal{L}{\text{RL}} + \lambda \cdot \mathcal{L}_{\text{boundary}} $$

其中 $\mathcal{L}{\text{RL}}$ 为原始 agentic RL 损失(基于 rollout 奖励),$\mathcal{L}{\text{boundary}}$ 为知识边界引导的额外监督项(如 SFT 的正样本模仿或 DPO 偏好优化),$\lambda$ 平衡两者权重。该框架可即插即用于不同的 RL 算法(如 PPO、GRPO)。

与同类方法的差异

现有基于奖励塑形(reward shaping) 的方法通常对工具调用次数施加全局惩罚,易引发奖励黑客——模型无差别抑制工具调用甚至降低简单问题的准确率。AKBE 则通过在线双路径探测直接感知每个实例的内在知识需求,构造选择性、边界敏感的监督信号,从而在不牺牲准确率的前提下削减冗余调用,实现真正的准确率-效率双赢。

实验

实验设计

在七个问答基准上评估 AKBE,覆盖多跳与单跳场景,并与标准 Agentic RL 对比。AKBE 采用 on-policy 双路径 rollout:对每个问题同时生成“使用工具”和“不使用工具”的轨迹,通过比较正确性将轨迹分类为四类(工具依赖、参数知识充足等),并构建 针对性监督信号 融入 RL 训练。关键超参 λ 由理论分析及实验确定。此外,测试了在 PPO、GRPO 等不同 RL 算法上的即插即用性,并通过消融实验剥离各类信号。

关键发现

  • AKBE 平均提升准确率 +1.85 点,同时减少工具调用 18%,工具生产力(准确率/调用次数)提升 25%
  • 模型学会了区分何时需要工具,有效抑制了标准 RL 训练引发的 冗余工具调用,修复了 知识边界模糊 问题。
  • 消融实验证实四类信号各有贡献:抑制冗余、激励必要调用、保护参数知识等。
  • 方法在不同 RL 算法上表现一致,展现 即插即用 特性。
  • 训练轨迹分布变化表明模型逐步减少无效调用,验证了边界增强机制的动力。

与基线对比解读

标准 Agentic RL 仅依赖结果奖励,易出现 reward hacking:模型为提升正确率盲目调用工具,造成计算浪费并压制内部知识。AKBE 通过在策略内动态探测知识边界,将“何时用工具”直接作为优化目标,避免了 reward shaping 的粗粒度压制。其 +1.85 准确率 表明边界增强不仅未损害精度,反而通过遏制错误调用、优化知识调配提升了正确性。工具生产力 25% 的提升意味着在同等算力下可处理更多请求,对实际部署的资源优化具有明确价值。

行业影响

落地场景

AKBE 可直接嵌入各类基于 LLM 的 agentic 系统,尤其适用于需要频繁调用外部工具的应用。典型的落地产品包括:

  • 智能客服与对话系统:模型需根据用户意图决定调用知识库搜索、订单查询 API 或直接回答,AKBE 可避免冗余工具调用,降低延迟。
  • 企业级搜索增强问答:在合同审查、法规查询等场景,模型要精准判断何时需要检索外部数据库,AKBE 训练出的边界意识能减少无效检索。
  • 自动化工作流引擎(如 AutoGPT、MetaGPT):多个工具串联时,每个步骤的工具选择直接影响整体效率,AKBE 有助于构建更节制的工具调度策略。
  • AI 数据分析助手:面对自然语言提问,模型需决定是直接生成 SQL 还是先调用元数据查询工具,AKBE 可优化此决策流程。

商业价值

AKBE 带来的商业价值体现在三条线上:

  • 降本:工具调用次数减少 18%,对于按调用量计费的服务(如搜索 API、云函数),可显著降低运营成本;同时推理延迟降低,节省 GPU 资源。
  • 增收:准确率提升 +1.85 个点,直接提高用户满意度与付费转化率,尤其在付费 QA 服务或高级订阅中更具优势。
  • 体验提升:用户获得更快的响应(响应长度缩短,工具调用减少),且答案更可靠,减少从工具返回无关信息导致的幻觉。

与现有产品/工作流的接口

AKBE 是一个即插即用的训练增强模块,与现有 RL 训练流水线兼容:

  • 训练阶段:在 on-policy 采样中并行生成 with-toolno-tool 两条轨迹,根据对比结果构造监督信号,加入训练目标。可与 PPO、GRPO 等主流 RL 算法无缝结合。
  • 部署阶段:无需额外推理开销,模型直接输出,不改变推理架构。
  • 框架集成:可封装为 LangChain 或 LlamaIndex 的插件,在训练工具链中作为回调函数实现双路径 rollout,对现有工具定义无侵入。

具体落地 use case

电商购物助手:当用户询问“这款手机支持 5G 吗?”,模型需判断:若参数表已知可直接回答(no-tool),若需查实时库存则调用工具(with-tool)。AKBE 训练后,模型能减少 80% 以上不必要的商品 API 查询,同时保持回答准确率,每年可节省数百万 API 开销。

医疗文献辅助审阅:研究人员提问“某药物对某基因突变的影响”,系统需决定是否检索 PubMed。AKBE 让模型优先使用已吸收的参数知识,仅在置信度不足时触发检索,避免过度调用付费文献 API,并缩短审阅时间。

这两个场景均无需修改现有工具接口,仅需在训练阶段引入 AKBE 的轨迹对比信号,即可获得效率与成本的双重优化。

局限

  • **计算开销与效率权衡**: AKBE 方法需在训练时为每个样本执行双路径 rollout(带工具与不带工具),并在每次迭代中动态分类并构建监督信号,这引入了额外的推理计算和内存开销。尽管论文声称通过 `λ` 平衡、理论分析与实验证明该开销在可接受范围内(工具调用减少带来的收益超过额外开销),但在超大规模模型或更频繁工具交互场景下,双路径 rollout 可能成为瓶颈,限制其直接应用于在线持续训练系统。
  • **任务与环境的泛化性未充分验证**: 实验仅在七个 QA 基准(多跳与单跳)上测试,且工具定义相对简单(搜索类工具),未涉及复杂工具组合、多模态、长序列交互或开放式代理任务(如代码执行、API 编排)。AKBE 的知识边界定义依赖“任务正确性”作为判断依据,在模糊奖励或主观任务中可能难以可靠估计边界信号,泛化到更广泛的 agentic RL 场景尚需更多证据。
  • **知识边界估计的稳定性与理论基础**: 方法通过比较双路径正确性来推断知识边界,该估计策略假设模型在 rollout 时的行为稳定,但实际训练中模型策略不断变化,边界分类可能带有噪声。论文虽在附录提供了可靠性分析,但未讨论边界漂移带来的训练不稳定性,也未建立更严格的理论收敛保证,可能与基于 RL 的 on-policy 更新存在相互作用风险。
论文Dingwei Chen2026-05-26原文

相关内容