Agentic ESOpt:以极低GPU需求微调长程LLM智能体
强化学习(RL)在单轮LLM微调中展现出潜力,但长程智能体推理面临日益分支的交互与稀疏奖励,暴露出RL的局限:其基于反向传播的重型训练栈使其难以微调更大规模的LLM,且更长轨迹使信用分配更加困难。本文论证进化策略(ES) 可成为微调长程LLM智能体的更优选择。 与智能体RL相比,ES具有三大优势: - 模型可扩展性:ES支持全参数优化,且仅需推理级GPU内存,使大模型微调成为可能。 - 灵活性:轻量级黑盒反馈接口使ES微调易于与提示空间进化组合。 - 长程可扩展性:ES在轨迹层面进行参数归因,无需分解跨时间步的奖励,随轨迹长度增长相比智能体RL具有更优扩展性。 基于此,我们提出Agentic ESOpt,一个面向参数-上下文协同进化的全参数智能体微调框架。每一步,Agentic ESOpt在当前LLM参数附近采样扰动,评估所得智能体的奖励,并执行在线奖励加权更新。为改善探索-适应权衡,Agentic ESOpt进一步引入扰动规模σ的余弦衰减调度。 在WebArena-Lite上,对Qwen-3.5-27B的全参数优化相比无技能基线提升6.69%。在测试时自动启发式设计中,Agentic ESOpt执行在线提示-参数协同进化,在36个设置中改善了28个匹配基线。
论文精读
TL;DR Agentic ESOpt 用进化策略替代强化学习做长程 LLM 智能体全参数微调,仅需推理级显存,并在 WebArena-Lite 上提升 Qwen-3.5-27B 基线 6.69%。
问题
问题背景
当前,基于 LLM 的 agentic reasoning 任务(如 Web 导航、工具调用)正成为研究热点,如何高效微调长程决策智能体是核心挑战。
现有方法局限
传统 Agentic RL(如 PPO、GRPO)依赖反向传播更新参数,需存储完整计算图的中间激活,显存开销随模型尺寸与轨迹长度线性增长,难以对 27B 以上模型做全参数微调。同时,长程轨迹中奖励极其稀疏,RL 需要将轨迹回报分解到每个 token 或 step 进行信用分配,随着 horizon 增长,分解偏差与方差显著增加,导致训练不稳定且样本效率低下。此外,分支交互使策略梯度估计高度非平稳,进一步加剧优化困难。
为什么这个问题难/重要
长程 agentic 任务本质是序列决策问题,动作空间大、环境反馈延迟,信用分配是经典难题。现代 LLM 动辄数十亿参数,全参微调需要大量 GPU 显存,而 LoRA 等参数高效方法又可能限制表达能力。业界对可扩展的 agent 训练框架需求迫切,但现有方案要么算力成本过高,要么无法处理长程依赖。因此,需要一种替代梯度优化的训练范式,既能全参数优化又能适应稀疏奖励。
行业类比
类似于自动驾驶中的端到端策略学习,文本 agent 的轨迹反馈同样面临稀疏奖励与长时依赖,若能用只依赖标量奖励的黑盒优化绕过反向传播,将大幅降低训练门槛。
核心洞察
- 进化策略(ES)通过评估完整轨迹的标量奖励并施加参数扰动,避免了强化学习(RL)中逐 token 的奖励分解和梯度回传。与 Agentic PPO/GRPO 相比,ES 不需要存储激活、无需计算策略梯度,GPU 显存占用仅相当于推理级别,因此可对 27B 参数模型做全参数微调。更重要的是,长程任务中 ES 的信用分配天然基于整个轨迹的表现差异,不会因 horizon 增长而稀释信号,这与 agentic RL 中稀疏奖励和时序差分误差累积形成鲜明对比。
- Agentic ESOpt 将参数扰动与 prompt 空间的技能/启发式进化融合为同一黑盒优化循环,实现参数-上下文协同进化。不同于以往将参数微调与提示工程分离的做法,Agentic ESOpt 利用 ES 的轻量反馈接口,使模型权重更新和测试时启发式设计共享相同的采样-评估-加权机制。这种设计让 prompt 空间的变化可以即时影响参数更新目标,而参数更新又能反过来让 prompt 空间的搜索更有效,在 WebArena-Lite 和自动启发式设计任务上验证了组合增益(36 个设置中 28 个优于基线)。
方法
输入
包括当前 LLM 参数、可选的提示上下文(如技能描述)和环境奖励函数;每轮从参数空间采样多个扰动向量。
关键模块
- 扰动采样:以当前参数为中心,按高斯分布采样扰动(扰动尺度
σ),生成一组候选智能体。 - 轨迹评估:候选智能体与环境交互,产生完整轨迹并得到轨迹级标量奖励(不分解到每一步)。
- 奖励加权更新:用各候选奖励值对扰动向量加权求和,得到参数更新方向,直接更新参数,无需反向传播。
- 余弦衰减 σ:
σ按余弦曲线从初始值衰减到小值,控制探索幅度,平衡早期探索与后期收敛。 - 参数-上下文共演化:可选地将参数优化与提示空间演化(如技能优化)融合,共享黑盒奖励反馈,实现联合搜索。
输出
更新后的 LLM 参数,以及可能演化的提示/技能;整个过程仅需推理级 GPU 内存,支持大模型全参数微调。
与 Agentic RL(如 PPO/GRPO)不同,Agentic ESOpt 避开逐步奖励分解与反向传播,以轨迹级评分驱动全参数更新,在长时程与模型规模上更具可扩展性。
实验
实验设计
论文在四类环境上验证 Agentic ESOpt 的有效性:Sudoku 作为长时程受控实验,比较 ES 与 Agentic RL(PPO/GRPO)随 horizon 增长的扩展性;Math 和 DocVQA 上评估 ReAct 工具使用场景下的全参数微调;WebArena-Lite 上测试模型扩展性,对 Qwen-3.5-27B 进行全参数优化;以及 test-time 自动启发式设计任务中进行 prompt-parameter 协同进化。扰动尺度 σ 使用余弦衰减,以平衡探索与适应。
关键发现
在 WebArena-Lite 上,Agentic ESOpt 对 Qwen-3.5-27B 的全参数优化相对 No Skill baseline 提升 6.69%。在 test-time 自动启发式设计的 36 个设置中,有 28 个 超过匹配基线。该方法仅需推理级显存即可全参数优化大模型,且通过轨迹级 reward 加权更新避免了跨 horizon 的奖励分解,在长时程任务上表现出更好的扩展性。
与基线对比的深度解读
与 Agentic RL 相比,Agentic ESOpt 无需反向传播,显存开销大幅降低,使其能够全参数微调 27B 级模型;同时轨迹级 credit assignment 在 horizon 增长时比逐步分解更稳定。但 6.69% 的提升是对 No Skill 基线的绝对增益,论文未提供与 RL 在同一环境下的直接对比。启发式设计中 28/36 的胜率表明方法并非在所有设置下均优于基线,可能与启发式空间的特性有关,需进一步分析失败案例。
行业影响
落地场景
Agentic ESOpt 适合长时程、多步工具调用与决策的 LLM 智能体任务:Web 导航自动化、数据分析流程、企业 RPA、多轮客户支持等。其 full-parameter 优化只需推理级 GPU 内存,降低硬件门槛,使团队能在单卡上微调 27B 级模型。
商业价值
- 降本:免去反向传播的激活/梯度存储,训练 GPU 内存需求大幅下降,支持大模型全参数优化,节省基础设施投入。
- 增收/效率:在 WebArena-Lite 上较 No Skill 基线提升 6.69%,在线 heuristic 设计 28/36 设置优于 baseline,提高智能体任务成功率,减少人工介入,提升自动化吞吐。
- 加速迭代:黑盒反馈接口允许同时优化 prompt 与参数,缩短试验周期。
与现有产品/工作流接口
- 可作为 RL 替代品 集成到训练栈:替换 Agentic PPO/GRPO 等,只需轨迹级 reward,与 LangGraph、AutoGen 等框架解耦。
- 支持 prompt-space 协同进化,可与 DSPy、自动提示工程工具结合,在 test-time compute 阶段在线优化。
- 部署简单:加载参数、扰动评估、加权平均,易与推理服务整合;ES 天然支持小种群并行评估,可充分利用多 GPU 推理服务器。
具体场景举例:
- 电商导购智能体:负责多轮商品搜索、比价、加购等长程流程,采用 Agentic ESOpt 对基座模型微调,奖励设置为任务完成率/转化率,无需大量标注即可迭代。
- 企业 IT 流程自动化:处理工单、审批、系统操作等多步骤,通过 ESOpt 优化行为,降低成本并提升成功率。
局限
- 论文作者承认引入新超参数(如扰动半径 σ、余弦衰减周期和种群大小)增加了调参负担。这些超参数对任务特性敏感,在不同 agentic 环境下的最优配置可能差异较大,但论文未提供系统的敏感性分析或自动调参策略,导致方法迁移到新场景时需要额外实验成本。
- ES 通过多次扰动采样评估来估计更新方向,每个扰动 agent 需要完整 rollout,在长程交互任务(如 WebArena)中单次评估的 token 和时间成本高。尽管单次推理内存占用低,但总计算量(前向次数 × 序列长度)可能超过基于梯度的 RL 方法,限制了在算力紧张或快速迭代场景下的实用性。
- 方法依赖标量奖励且假设可通过交互直接获得,对奖励稀疏、多目标或难以量化的复杂长程任务,扰动评估的方差会显著增加,需要更大种群或奖励塑形,但论文未讨论奖励质量对收敛的影响。全参数扰动更新缺失梯度信息,在大参数模型(27B)上的收敛速度与参数高效微调(如 LoRA)的对比证据不足,可能在样本效率上存在差距。