论文

SePO: 用于系统提示优化的自进化提示代理

SePO: 用于系统提示优化的自进化提示代理

系统提示优化 旨在不修改底层模型的情况下改进智能体行为,生成可读且模型无关的指令。现有方法构建一个提示代理来优化任务代理的系统提示,但其自身的系统提示仍为手工设计且固定不变。本文提出 SePO(自进化提示优化),采用自引用设计,将提示代理本身的系统提示也作为优化目标,与任务代理的系统提示共同进行开放式进化搜索,并维护一个候选提示存档作为进化垫脚石。训练分为两阶段:预训练在多任务池上进化提示代理,微调将其应用于目标任务。在五个基准测试(数学 AIME'25、抽象推理 ARC-AGI-1、研究生级科学 GPQA、代码生成 MBPP、逻辑谜题 Sudoku)上,SePO 均优于 Manual-CoT、TextGrad 和 MetaSPO,平均准确率提升 4.49 个百分点。此外,预训练获得的提示优化技能可泛化到未见任务,而非记忆特定任务的提示。

论文精读

TL;DR SePO 让提示词优化 agent 自身的系统提示词也能自我进化,实现完全自动化,在多个推理基准上平均提升 4.49 分。

问题

问题背景

在大语言模型驱动的智能体(agent)应用中,系统提示词(system prompt) 是控制模型行为、注入任务知识的核心接口。业界正从手工设计转向自动优化系统提示词,以提升 agent 在下游任务上的表现,同时保持指令的人类可读性与模型无关性。

现有方法局限

当前主流方案(如 TextGradMetaSPO)引入一个专门的提示词智能体(prompt agent),负责为任务智能体(task agent)迭代生成与修改系统提示词。然而,提示词智能体自身的系统提示词却依然是人工固定编写的。这种非对称优化使提示词智能体的改进能力受限于初始人工设计,无法根据任务反馈持续自我调整,难以应对复杂多变的任务场景。此外,现有方法多基于梯度式或单步修正,缺乏全局探索能力,易陷入局部最优。

为什么这个问题难/重要

提示词空间是离散且高维的,优化目标高度非凸,自动搜索有效提示词本身就是一个元优化问题。让提示词智能体同时优化自身和任务智能体的提示词,形成自指(self-referential)闭环,极易导致不稳定或退化。但若成功,便能实现自我进化的提示词优化器,随着使用自动变强,大幅降低人工干预成本。这一能力对构建持续改进的 LLM 应用至关重要,也契合 AutoML 领域追求自动化整个机器学习流程的长期趋势。

行业类比

这类似于自动化机器学习(AutoML)中,不仅自动搜索模型架构,还让搜索算法本身随任务动态进化——正如 **NAS(Neural Architecture Search)**中控制器与子模型联合优化的设定,但对象换成了纯文本空间中的提示词。

核心洞察

  • 自指优化闭环:SePO 将提示优化器自身的系统提示也作为优化对象,形成自我改进的闭环。与传统方法始终依赖人工编写的固定提示代理不同,SePO 的提示代理在优化任务系统提示的同时,也通过同一演化搜索过程更新自身指令,这突破了优化器与优化目标之间的不对称性,使提示代理能够持续适应新任务而无需人工介入。
  • 跨任务泛化的元优化技能:SePO 通过预训练在多任务池上进行演化,习得的并非针对特定任务的记忆,而是一种可迁移的提示优化能力。在未见任务上微调时,预训练带来的初始化优势超越了随机搜索或手工设计,这证明演化可以从任务分布中提取通用的优化策略,从而实现高效的跨任务泛化。

方法

SePO 将系统提示优化视为一个自我指涉的进化搜索问题,核心思想是:不仅优化任务代理的系统提示,也将提示代理自身的系统提示作为优化目标,让二者在开放式搜索中协同进化。

输入与组件

  • 任务代理:执行具体任务的 LLM,其行为由系统提示控制,可评估任务性能。
  • 提示代理:一个 LLM 实例,负责生成/改进系统提示。它接收当前候选提示与任务反馈,输出新的提示变体。
  • 初始提示:为任务代理与提示代理分别提供手工编写的种子系统提示;所有提示组成一个存档,作为进化起点。
  • 多任务池(预训练):一组多样化的任务,每个任务配有少量训练样本和评分函数。

关键模块:进化搜索与自我进化

  1. 种群维护:维护一个候系统提示的存档,每个候选提示对应一个特定角色(任务代理或提示代理)。
  2. 变异与评分:提示代理根据存档中的现有提示,通过 LLM 生成新的提示变体(例如修改措辞、添加推理步骤),并在目标任务上评估其效果,得到适应度分数。
  3. 选择与存档更新:采用开放式算法(如 QD-search),根据适应度和多样性选取有潜力的提示加入存档,淘汰低效者。
  4. 自我指涉:在优化任务代理提示的同时,提示代理自身的提示也被纳入同一种群。也就是说,改进后的提示代理提示会被用于后续的变异过程,形成自提升循环。

两阶段训练管道

  • 预训练(SePO-Generalist):在一个构造的多任务池上运行进化搜索,让提示代理学会通用的提示优化技能,而非死记特定任务的提示。此阶段产出可泛化的优化策略。
  • 微调(SePO-Specialist):以预训练得到的提示代理提示为起点,在目标任务上继续进行有限步进化,快速适配到新任务。

输出

优化后的任务代理系统提示及最终自进化后的提示代理系统提示。无需修改模型参数,完全通过提示工程提升性能。

与同类工作的差异:TextGrad、MetaSPO 等方法仅将提示代理视为固定工具,其系统提示需人工设计且保持不变;SePO 首次将提示代理的提示也纳入优化循环,实现真正的自我进化,不仅提升了单任务上的表现,更通过多任务预训练获得了跨任务泛化的优化技能。

实验

实验设计

SePO 采用两阶段训练范式:预训练阶段 在多个任务(LIMO, Humanities, Social Sciences 等)组成的任务池上,通过开放式进化搜索同时优化 prompt agent 的系统提示和任务 agent 的系统提示,维护一个候选提示存档作为“垫脚石”;微调阶段 则将预训练的 prompt agent 应用到特定目标任务(AIME'25, ARC-AGI-1, GPQA, MBPP, Sudoku)。底层使用大语言模型(如 GPT-4o)作为任务 agent,基线包括手动设计的 Manual-CoT、基于梯度的 TextGrad 以及元提示优化的 MetaSPO

关键发现

在全部五个基准上,SePO 均一致优于所有基线,平均准确率相较 Manual-CoT 提升 +4.49 个百分点。值得注意的是,预训练获得的 prompt 优化技能展现出跨任务泛化能力——即使目标任务不在预训练混合中,SePO 依然能有效提升性能,而非单纯记忆每个任务的特定提示。

与基线对比的深度解读

对比方法中,Manual-CoT 未进行任何优化,纯粹依赖手工编写;TextGrad 与 MetaSPO 虽然能优化任务 prompt,但其 prompt agent 自身的系统提示始终保持固定,由人工设计。SePO 的创新在于 自指设计:将 prompt agent 的系统提示也纳入优化目标,通过进化搜索使 prompt agent 自身不断改进。这种自我进化机制意味着 prompt agent 不仅能学会如何为特定任务写出好的提示,还能学会“如何更好地学会”提示优化,实现了元层面的提升,从而在复杂推理和生成任务上取得显著增益,并具备更强的泛化性。

行业影响

落地场景

SePO 提供了一种模型无关、可读的系统提示自动优化方案,可直接应用于依赖 LLM Agent 的产品与业务线:

  • 智能客服与对话系统:自动优化客服机器人的系统提示,使其在多轮交互中更稳定地遵循企业知识库与话术规范,减少人工调优成本。
  • 自动化代码审查与生成:在 CI/CD 中集成代码代理,通过自我进化让提示保持对最新编码规范的适配,提升 PR Review 效率。
  • 教育 / 科研辅助工具:如数学解题、逻辑推理类 AI 助手,可利用 SePO 动态调整解题策略提示,适应不同难度与学科。
  • 内容安全审核:优化审核代理的判定准则提示,降低误杀与漏报,并随着新违规模式演进自动更新。

商业价值

  • 降本:SePO 自动迭代提示,减少专家编写和反复实验的人力投入。其预训练 + 微调的两阶段设计进一步降低单任务优化成本,预训练获得的优化技能可跨任务泛化,避免每个新场景都从零开始。
  • 增效:在 AIME’25、ARC-AGI-1、GPQA、MBPP、Sudoku 等基准上平均提升 4.49 个百分点,模型回答质量提升直接转化为更高的任务成功率与用户体验,强化产品竞争力。
  • 体验提升:人类可读的优化提示方便审核与可解释性,在受监管行业(金融、医疗)中更容易通过合规审查,同时让非技术团队成员也可理解代理行为逻辑。

与现有产品 / 工作流的接口

SePO 可作为一个中间件层嵌入现有 AI 应用栈:

  • 输入为任务代理的描述、少量示例和评估函数(如准确率或自定义指标),输出为优化后的系统提示,无需修改底层模型。
  • 集成方式:
    1. 在已有 LLM Application Pipeline 中增加一个 SePO 优化步骤,定期或在触发条件(如效果下降时)重新优化提示。
    2. 通过 API 或 SDK 将 SePO 与 LangChain、AutoGen、Dify 等框架结合,作为 Prompt Repository 的动态刷新源。
    3. 支持多模型部署:优化出的提示是纯文本,可直接用于 OpenAI、Anthropic、Mistral 或本地模型,无供应商锁定。

具体落地 Use Case

  1. 电商搜索推荐 Agent:在电商平台的智能导购机器人中,SePO 可优化系统提示使其更精准地理解用户模糊描述。当商品库更新或促销规则变化时,只需提供新示例,SePO 便能自动调整提示,保持高准确率并减少人工维护。
  2. 金融服务合规报告生成:金融分析师使用 LLM 生成投资报告。SePO 迭代优化系统提示,使其严格遵循监管披露模板并自动适应不同市场的法律条文更新。预训练阶段已学会“提示优化”的技能,微调后即可针对特定报告类型快速收敛,节省大量 lawyer-in-the-loop 校验时间。

局限

  • - 演化搜索的计算开销:SePO 的开放式进化搜索需要维持候选提示档案,并在多轮迭代中反复调用底层 LLM 进行评估与生成,相比 TextGrad 等单步优化方法,计算成本显著增加。在多任务预训练阶段尤其突出,每次评估都需要运行多个任务智能体,累积的 token 消耗与延迟可能限制在低预算场景的实际部署。论文虽定性提及成本,但未给出与基线方法在同等性能提升下的详细成本收益对比,影响工程应用决策。
  • - 自引用优化的稳定性风险:让提示智能体同时优化自身系统提示构成自引用闭环,可能导致迭代中出现退化或震荡。尽管开放式进化与档案机制有助于保留历史优秀提示,但无法完全避免探索过程中的质量波动,一旦生成的自提示质量恶化,可能反向拖累任务智能体的提示优化效果,形成负反馈。论文未深入分析这种自引用结构在不同基础模型下的收敛稳定性与安全边界。
  • - 任务分布与初始提示的敏感性:SePO 的预训练泛化能力依赖于多任务池的丰富性,在跨域任务(例如从推理跳跃到创造性写作)上可能受限。此外,提示智能体的种子手工提示对最终优化结果的影响尚未充分消融,若初始提示质量过低,进化搜索可能陷入局部最优,削弱方法的普适性。论文未系统研究种子提示的鲁棒性因素。
论文Wangcheng Tao2026-06-03原文

相关内容