EEVEE: 面向真实世界中自改进智能体的测试时提示学习
现有方法大多针对单数据集设计,而真实应用需处理来自多个数据集、领域和任务分布的异构输入流,限制了其实用性。为此,本文提出 EEVEE,首个面向 LLM 智能体的多数据集测试时提示学习框架,支持在真实任务流中实时学习。 方法上,EEVEE 引入 路由器 将输入划分为 任务聚类,并分配至合适的提示配置,以缓解跨数据集干扰。该设计通过 路由器-提示协同进化策略 优化,采用交错的路由器与提示学习阶段,解决两者相互依赖问题。 实验在多个数据集上表明,该框架在异构数据流下提升鲁棒性,同时保持单基准学习能力与效率。具体而言,EEVEE 在 Qwen3-4B-Instruct 和 DeepSeek-V3.2 上平均多基准分数分别提升 10.38 和 24.32 分,超越 SOTA 方法 GEPA 和 ACE 最高达 37.2% 和 48.2%。
论文精读
TL;DR EEVEE 是首个多数据集测试时提示学习框架,通过路由器-提示协同进化应对现实异构任务流,显著提升 LLM Agent 的跨域鲁棒性与性能。
问题
测试时提示学习的真实世界瓶颈
在LLM智能体的部署后适应中,测试时提示学习(test-time prompt learning)因其无权重更新、轻量高效的特性正成为热门方向。现有研究多聚焦于单一基准下的提示优化,追求固定任务分布上的最高分,却忽略了真实场景的本质特征:异构数据流——来自不同数据集、领域、任务的输入持续混合到达,模型需即时响应并持续提升。
现有方法的根本局限
当前SOTA方法如 GEPA 和 ACE 均预设任务边界清晰且固定。它们为每个基准学习一组静态提示,缺乏处理多任务交错的机制:
- 跨数据集干扰:直接在多任务流上交替更新提示,会导致不同任务的梯度方向冲突,新习得的模式可能覆盖已有知识,造成灾难性遗忘。
- 无任务感知路由:所有输入共享同一条提示或盲池化所有提示,无法根据样本特性动态分配最适配的提示,导致强推理任务混入简单格式化要求,性能大幅波动。
- 单函数假设:将提示学习简化为对单一损失面的搜索,忽视真实数据流需支持多个并行优化子问题的本质。
技术挑战与业界关注度
该问题的难点在于路由与提示的相互依赖:路由的质量决定提示接收到的训练数据纯度,而提示的表达力又影响路由区分任务的精度。二者必须协同学习,但联合优化易陷入局部极小或发散。此外,任务冷启动要求面对未见过的输入分布时,系统仍能快速收敛至有效提示,这对探索策略提出严苛要求。
随着LLM智能体从实验室走向持续运行的生产服务(如客服系统、数据管道监控、代码助手),对无中断在线自改进的需求激增。解锁测试时提示学习在多任务流上的鲁棒性,是使LLM智能体真正实现“部署即进化”的关键一步,具有极高的工程价值。
就像API网关根据请求路径将流量路由到不同微服务,EEVEE 为LLM智能体添加了类似的路由层,动态将异构查询分配到最适配的提示配置上,实现多任务的按需自适应。
核心洞察
- **任务路由器解耦多数据集流**:EEVEE 通过可学习路由器将异构输入在线划分为任务簇,为每个簇维护专用提示配置,从而在混合数据流中缓解跨数据集干扰。这与现有仅支持单数据集的测试时提示学习方法(如 GEPA、ACE)根本不同,后者无法处理真实世界中来自多个分布的问题流,而 EEVEE 在不牺牲单任务性能的前提下,实现了多任务流上的鲁棒自改进。
- **路由器-提示协同进化打破静态依赖**:EEVEE 设计了一种交替优化策略,先基于当前路由聚类进化各簇的提示,再利用提示表现反向优化路由器划分,形成循环增强。这突破了传统方法中路由与提示独立训练、难以适应动态任务变化的局限,使系统能够随着流数据分布漂移持续调整分工,是面向真实部署的轻量级自进化智能体关键创新。
方法
框架整体流程
EEVEE 面向测试时提示学习 (test-time prompt learning) 实际部署场景,输入为来自多数据集、多领域、多任务分布的异构流式数据。模型在部署后无法预知任务边界,需在线自适应。
核心流程分为三步:
- 数据到达:每个样本仅以原始文本形式流入系统,不携带任务标签。
- 路由分簇:轻量级 路由器 (router) 将输入分配到若干个任务簇 (task cluster),每一簇对应一组提示配置 (prompt configuration)。
- 提示执行:LLM 使用该簇对应提示生成回答,回答质量通过下游评价信号(如正确性)反馈给系统。
关键模块:路由器-提示共同进化
EEVEE 的核心创新在于路由器与提示协同优化,解决二者相互依赖难题:
- 路由器:将异构输入按潜在任务相似性分组,使同一簇内样本可共享同一提示。路由器参数从零开始学习,无需预训练分类器。
- 提示配置:每个簇维护一个可学习的软提示 (soft prompt) 或离散提示模板,可适配该簇任务风格。
- 共进化策略 (router-prompt co-evolution):训练被组织为交替阶段——路由器进化时冻结提示,提示进化时冻结路由器。该设计避免二者同时变化导致的不稳定,并逐步收敛至最优划分与对应提示。
训练三阶段
- 初始化 (Initialization):随机初始化路由器与提示,进行少量预热更新。
- 探索 (Exploration):路由器与提示轮流迭代,路由器根据提示性能调整分配,提示根据聚类结果优化自身表达。此阶段允许探索不同簇划分。
- 收敛 (Convergence):降低学习率,微调至稳定,最终形成任务簇-提示对的集合。
输出与部署
训练完成后,系统获得一个固定的路由器与多个提示模板。推理时新样本仅需经过路由器选择对应提示,即可直接用于LLM生成,无需额外训练。整个过程仅更新少量提示参数,不触及 LLM 权重,保持轻量与高效。
与同类方法差异:现有测试时提示学习(如 GEPA、ACE)假设单一任务分布,无法处理真实世界的多任务流;EEVEE 通过隐式任务发现与动态路由,首次在无需任务边界先验的条件下,实现多数据集流式输入的提示自进化,且通过共进化策略抑制跨数据集干扰。
实验
实验设计
实验在多数据集流设定下进行,模拟真实世界异构输入场景。测试集混合了不同领域、格式和任务分布的数据流,直接观察模型在无事先分辨条件下的连续推理表现。EEVEE 部署路由器和提示协同进化机制,动态将输入聚类并匹配对应的提示配置。同时监控单基准学习能力和 token 开销,以评估框架的鲁棒性与实用性。
关键发现
- EEVEE 在异构流下大幅超越基础模型:Qwen3-4B-Instruct 平均得分提升 10.38 分,DeepSeek-V3.2 提升 24.32 分,验证了测试时提示学习的有效性和跨模型普适性。
- 相比现有 SOTA 方法 GEPA 和 ACE,EEVEE 相对提升高达 37.2% 和 48.2%,表明路由机制有效缓解了跨数据集干扰,避免了提示退化。
- 在保持单数据集学习精度的同时,EEVEE 未显著增加推理开销,实现了实际部署的可行性。
对比解读
现有测试时提示学习方法通常假定单一数据分布,面对混合流时性能骤降。EEVEE 首次引入任务路由,在无标签条件下自主划分任务簇,让不同提示专用化。这一设计使得每个提示只需学习局部任务模式,从根本上避免了负迁移。在与 GEPA/ACE 的对比中,EEVEE 的巨大优势凸显了在多任务部署环境下,结构化解耦比全局优化更具竞争力。对于需要持续自改进的代理系统,EEVEE 提供了一条轻量、高效且可扩展的演进路径。
行业影响
落地场景
EEVEE 为 LLM 代理 产品的线上服务开辟了新的自适应范式。任何需要实时处理多域、多任务异构输入流的系统——如智能客服、内容审核、自动化运维——都可直接受益。传统上,此类系统依赖预先划分好的独立 prompt 或模型,而 EEVEE 的 路由器 + 协同进化 prompt 机制使代理在测试时根据输入内容自动路由到最合适的 prompt 配置,无需人工干预,极大提升了代理对“真实世界任务流”的适应性。
商业价值
- 降本:大幅减少 prompt 工程与领域专家的人力投入,同时避免为每个子任务维护单独的模型实例,降低推理资源开销。
- 增收:在多任务混合流中保持高准确率,减少因 prompt 不适配导致的错误输出,从而降低订单流失、误审等业务损失。
- 体验提升:代理响应更精准、一致,且能快速适应新任务,直接改善用户满意度和留存。
与现有产品/工作流的集成
EEVEE 可作为一个轻量级中间层,插入现有 LLM 推理管线。具体集成方式:
- 在请求进入 LLM 前,先经过 EEVEE 路由器进行任务聚类。
- 路由器将输入映射到对应的 prompt 槽位,该 prompt 已通过离线进化优化。
- 拼接后的完整 prompt 再送入下游 LLM 生成响应。
该流程可无缝集成到 LangChain、Semantic Kernel 或自建 API 网关中,且支持持续在线进化:利用未标注的实时反馈逐步优化 prompt,形成自我提升的闭环。
具体落地用例
- 电商智能客服:某全球电商平台的客服代理需同时处理售前咨询(商品对比)、售后(退货流程)、物流查询等异构任务。EEVEE 通过路由器自动识别意图,为“退货”类对话选用强调安抚与流程引导的 prompt,为“商品对比”选用强调特征对比的 prompt,使回答更专业、转化率更高。
- 教育 AI 批改系统:在线教育平台的 AI 助教需批改数学证明、编程作业和作文。不同科目对批改格式、评分粒度要求迥异。EEVEE 可根据题目内容自动路由到对应的“数学-证明”或“编程-完整性” prompt,保证批改一致性,降低教师复核成本,并使得同一 LLM 能在多学科间平滑切换。
局限
- **路由器的初始聚类依赖与泛化挑战**:EEVEE 依赖预先定义的任务聚类初始化路由器,这在实际动态任务流中可能不够灵活——当出现全新任务分布时,路由器可能需要重新适应,而协同演化过程在持续流入的新数据上如何高效更新尚未充分探索。此外,路由器的学习与提示演化相互耦合,若初始聚类不佳可能陷入次优解,泛化至完全未见任务类型的能力存疑。
- **路由器引入的推理开销与超参敏感性**:尽管路由器模块轻量,但在每个测试样本上前向计算仍会增加延迟,对实时性要求高的场景可能成为瓶颈。同时,任务聚类的数量(slot 数)需要作为超参数预先设定,其选择直接影响任务划分粒度和最终性能,论文未充分讨论对不同数据流的最优设置及自动化确定方法。
- **提示学习的根本能力边界**:作为测试时提示学习方法,EEVEE 仅优化提示指令而冻结模型参数,这意味着其性能上限受限于基础模型的能力。与全参数微调或适配器方法相比,在需要根本改变模型行为或注入全新知识的场景中可能表现不足。此外,提示学习对奖励信号的质量高度敏感,在稀疏或噪声奖励的现实任务流中稳健性有待验证。