面向多模态智能体推理的Agent Explorative Policy Optimization
具备扩展推理能力的视觉语言模型在复杂问题上取得成功,但许多实际问题需要外部工具,仅靠内部推理往往无法解决。因此,智能体推理交织着两种具有结构不对称性的行为:思考(默认的自包含行为)和工具使用(一种高方差辅助行为)。我们将这种不对称性称为思考-行动鸿沟。 在标准RL方法(如GRPO)下,这种鸿沟在训练中表现为两种诊断症状: - 工具使用仅在约30%的轨迹中被尝试; - 当尝试时,组内使用工具的轨迹在约40%的问题上全部错误(all-wrong),抑制了工具调用处所需的学习信号。 我们提出AXPO(Agent eXplorative Policy Optimization):对于每个全部错误的工具使用子组,AXPO固定思考前缀并重新采样工具调用及其后续内容,结合基于不确定性的前缀选择。 在九个多模态基准测试和三个规模的Qwen3-VL-Thinking上,SFT+AXPO平均优于SFT+GRPO(8B模型平均Pass@1提升1.8个百分点,Pass@4提升1.8个百分点),并且8B的SFT+AXPO在Pass@4上以少4倍的参数超越了32B Base模型。
论文精读
TL;DR 针对多模态智能体推理中工具调用率低、错误集中的“思维-行动鸿沟”,AXPO 通过前缀修复与重采样提升探索效率,使 8B 模型性能反超 32B 基座模型。
问题
问题背景
多模态视觉语言模型(VLM)在需要外部工具辅助的复杂推理任务中,正从纯内部推理转向代理推理(agentic reasoning),即交替进行“思考”与“工具调用”。然而,两种行为天然存在结构不对称:思考是自封闭的默认过程,而工具调用则具有高方差、离散且稀疏的特性。
现有方法局限
当前的训练方案(如 SFT 后接 GRPO 等强化学习)并未显式处理这种Thinking-Acting Gap。实际训练中会出现两个典型症状:
- 工具使用率极低:仅约 30% 的 rollout 会尝试调用工具,模型倾向于用内部推理强行回答;
- 全错工具子组频繁出现:在试探工具的 rollout 中,约 40% 的问题上整组工具调用全部失败,导致这些步骤失去有效的学习信号,进一步抑制工具探索。
这两个局限使得策略优化在工具调用处几乎停滞,模型无法学会何时及如何正确使用工具,限制了 agentic 能力的上限。
为何此问题难且重要
- 技术挑战:工具调用动作空间离散且奖励稀疏,与连续思考步骤的优化目标耦合困难;探索不足会导致策略退化,过度依赖内部幻想式推理。
- 业界关注度:从视觉问答到具身机器人控制,越来越多的应用要求模型能可靠地与外部 API、代码解释器或物理环境交互。若工具使用学习失败,整个 agent 系统将退化为被动推理器,丧失实际部署价值。
行业类比
类似为大语言模型接入搜索或计算器插件时,若训练中奖励信号未能有效区分“内部推测”与“外部验证”,模型会泛滥性地依靠记忆胡编答案,而非调用更准确的外部工具,最终损害可靠性。
核心洞察
- **Thinking-Acting Gap 的结构性诊断**:论文明确定义了代理推理中思考与行动之间的行为不对称——自主推理是默认自洽模式,而工具调用属于高方差辅助行为。不同于以往工作将训练失效归因于稀疏奖励或探索不足,该诊断直接从行为分布角度揭示了两个可量化症状:工具调用尝试率仅约 30%,且全错工具调用子群比例高达约 40%。这种结构性视角为后续策略优化提供了明确的干预靶点,也解释了为何标准 GRPO 在代理任务中难以有效利用工具信号。
- **基于前缀修正的探索性策略优化**:AXPO 方法针对全错工具调用子群,固定思维前缀并重采样工具调用及其后续轨迹,同时通过不确定性估计选择前缀。相比 GRPO 对整个轨迹进行均匀更新,AXPO 实现了对工具调用决策的靶向强化,缓解了全错子群对学习信号的抑制。该方法本质上是一种数据高效的探索策略,在不改变模型架构的前提下,显著提升了工具使用的学习效率,为多模态代理的强化学习训练提供了新的范式。
方法
核心思路
AXPO 针对多模态 agent 推理中的思考-行动鸿沟(Thinking–Acting Gap)设计:在 GRPO 等标准 RL 训练中,工具调用尝试率低(约 30%),且尝试时近 40% 的问题出现整组全错——即同一组 rollout 中所有工具调用均失败。这严重削弱了工具调用处的学习信号。AXPO 通过针对性重采样与前缀固定,放大工具调用的探索性学习,而非整体依赖整条 rollout 的奖励。
输入 → 核心模块 → 输出
输入:多模态问题(图像 + 文本)及对应的 agent 环境,模型按思考-行动模式生成 rollout(先内部推理,再调用外部工具)。训练沿用 GRPO 的分组采样:每个问题采样一组 rollout,按组内奖励计算优势。
关键模块:
- 全错子组检测:识别出那些所有工具调用 rollout 均奖励为零的子组。这些子组中,思考部分可能无误,但工具调用或后续环节出错。
- 思考前缀固定与重采样:保留每条 rollout 中工具调用发生前的思考前缀(think prefix),在此基础上重新采样工具调用及其后续(tool call + continuation),生成新的探索序列。这一过程仅针对工具片段注入新鲜探索,而非扰乱已正确的推理链。
- 基于不确定性的前缀选择:并非对所有全错子组都做重采样,而是根据模型对思考前缀的不确定性估计(如熵或预测概率)筛选最具回报潜力的前缀,避免无效重采样。
输出与优化:重采样得到的工具调用序列与原有思考前缀拼接,形成新的 rollout,参与 GRPO 的策略梯度更新。最终模型在保留内部推理质量的同时,显著提升多步工具调用的成功率。
与同类方法的关键差异
与原生 GRPO 全序优化不同,AXPO 仅对全错工具子组解耦思考与行动,精准注入探索,而非均匀地扰动所有序列。这种细粒度重采样在不增加额外模型参数的前提下,有效缓解了 tool-call 的高方差问题,使 SFT+AXPO 在 8B 规模即可超越 32B 基线的 Pass@4。
实验
实验设计
在 Qwen3-VL-Thinking 三个规模上,先进行全量 SFT 微调,再分别采用 AXPO 与 GRPO 做策略优化。评估覆盖九个多模态基准,涵盖需要代理式推理(agentic reasoning)的场景。AXPO 针对训练中工具调用子群全错的问题,固定思考前缀并重采样工具调用及后续,结合不确定性前缀选择,以恢复被 GRPO 抑制的学习信号。
关键发现
- AXPO 平均提升:在 8B 模型上,Pass@1 和 Pass@4 均获得 +1.8pp 的绝对提升,表明对工具利用的有效改进。
- 参数效率:8B + SFT + AXPO 在 Pass@4 上超越了 32B 基础模型,仅用四分之一参数量,凸显了探索性优化的收益。
- GRPO 的诊断症状:工具调用仅发生在约 30% 的 rollout 中,且当工具被调用时,同一组内所有 rollout 全部错误的概率约 40%,导致工具相关学习信号丢失。AXPO 通过针对性重采样,直接缓解了这一“思维-行动间隙”。
与基线对比的深度解读
GRPO 在存在高变异度辅助动作(工具调用)时,会因错误样本集中而压制梯度,使策略不敢探索。AXPO 则主动修复全错子群,保留正确前缀的同时注入多样性,本质上是一种结构性探索增强。与常规奖励工程或辅助损失不同,它不依赖额外标注,而是从 rollout 本身挖掘学习机会。工程上,该方法可轻松嵌入现有 GRPO 流程,对需集成外部工具的视觉语言代理系统有直接的应用价值,尤其适合工具调用稀疏且易出错的场景。
行业影响
落地场景
AXPO (Agent eXplorative Policy Optimization) 专攻多模态智能体的工具使用能力,对任何需要视觉理解后调用外部 API / 工具的 AI 产品都有直接价值。典型场景包括:
- 电商视觉搜索与自动客服:用户上传商品图片,模型需先识别图像特征,再调用商品库 API 检索相似款或回答库存、价格等。传统 RL 方法(如 GRPO)工具调用尝试率仅约 30%,且约 40% 的尝试全错,导致大量问题无法解决。AXPO 通过不确定性前缀选择与工具调用重采样,显著提升工具调用的成功率。
- 企业级多模态 RAG 助手:处理合同、发票、报表等文档时,模型需先解析图像内容(OCR、布局理解),再调用数据库查询或知识库检索。AXPO 可有效增强模型在“思考-行动”不对称性下的表现,减少因工具使用失败造成的回答中断或幻觉。
商业价值
- 提升任务成功率:论文显示,SFT+AXPO 在 8B 参数规模上平均 Pass@1 提升 1.8pp,Pass@4 提升 1.8pp,且 8B 模型甚至超过 32B 基线的 Pass@4。这意味着可以用更小、更便宜的模型达到或超过大模型的性能,直接降低推理成本。
- 改善用户体验:工具调用更准确,减少“卡在思考阶段”或给出错误答案的情况,提升交互流畅度,减少人工兜底,适用于对实时性和准确性要求高的商业应用。
与现有产品 / 工作流的接口
- 即插即用的训练阶段增强:AXPO 是在 SFT 之后、强化学习微调阶段引入的新奖励设计与采样策略,不改变模型架构,可无缝接入现有基于 GRPO 的训练流程。只需在训练时替换 rollout 生成与奖励计算逻辑。
- 与现有 Agent 框架兼容:AXPO 训练的模型输出标准 ActiOn 序列,可直接集成到 LangChain、AutoGen、Semantic Kernel 等多模态 Agent 框架中,无需额外适配。
- 轻量级部署:训练后模型保持相同结构,仅需替换权重,适合云端、边缘或私有化部署场景。
原文论断:“under standard GRPO, tool use is attempted on only ~30% of rollouts, and when attempted, the tool-using rollouts are all-wrong on ~40% of questions”,AXPO 正是针对这一“Thinking-Acting Gap”设计的优化策略,对工业级多模态 Agent 落地具有直接参考价值。
局限
- **模型与任务泛化性验证不足**:实验仅基于 **Qwen3-VL-Thinking** 系列模型,未在其他主流 VL 架构(如 LLaVA-NeXT, InternVL 等)上验证,也未涉及不同工具调用范式(代码执行、知识检索等)的迁移效果;论文自述“future work will explore broader model families”,当前结论的通用性有限。
- **依赖高质量 SFT 初始化且超参敏感**:AXPO 在 SFT 后应用,且前缀选择的不确定性阈值、重采样次数等超参需手工设定,文中未系统分析鲁棒性;在真实部署中,若 SFT 数据噪声大或工具定义频繁变化,方法可能退化。
- **工具调用探索的效率瓶颈**:AXPO 通过固定思维前缀并重采样工具调用及后续轨迹来增强信号,这引入了额外的推理开销;当单次工具调用耗时高(如调用大型外部 API)时,训练吞吐量可能显著下降,论文未提供计算成本的定量对比。