GDPevo: 评估智能体在真实业务任务上的自我进化
智能体自我进化(Agent self-evolution)是指从先前经验中更新智能体的持久状态,并复用它以更有效地解决相关任务。评估自我进化是困难的:现有基准对经济价值高的任务领域覆盖有限,并不总是设计训练和测试任务使得测试时的收益可归因于训练经验,并且仍然容易受到数据污染的影响。 我们提出了 GDPevo,一个基于 GDP 相关企业工作流的进化原生基准,以及完全自动化的数据流水线。其核心机制 规则混合(rule hybridization)将每个企业工作流分解为原子业务规则,在训练任务中分配这些规则的子集,并在保留的测试任务中重新组合它们,从而使测试时的收益可归因。GDPevo 涵盖 CRM、ERP、金融、医疗、法律和数据中心工作流。其 V1 版本包含 12 组 120 个任务,每组五个训练任务和五个保留测试任务。完全自动化使流水线能够在两天内将套件扩展到 24 组 240 个任务(V2),为污染提供了实际响应。 使用 GDPevo,我们在四种监督类型下评估了四个智能体(每个包括一个 harness 和一个模型)。自我进化持续将保留准确率提高多达 16.44 个百分点。但最好的进化智能体仍然远低于完全知情的 oracle 上限 91.6%,表明当前智能体的自我进化能力远未完全实现。我们公开发布了流水线、基准和完整评估结果:https://github.com/Prism-Shadow/GDPevo。
论文精读
TL;DR GDPevo 是一个面向真实企业任务的 Agent 自我进化基准,通过规则混合机制将业务规则原子化分配,确保测试性能提升归因于训练经验,并采用全自动数据管道解决数据污染问题。
问题
问题背景
智能体自我进化(agent self-evolution) 正成为自主系统研究的前沿命题——通过从历史任务中提炼经验并更新持久状态,agent 有望持续提升在关联任务上的表现。然而,缺乏可靠的进化评估基准严重阻碍了对该能力的量化与比较,导致技术迭代缺乏明确参照。
现有方法局限
现有基准主要暴露三方面缺陷:
- 任务域覆盖狭窄:多局限于合成场景或简单问答,缺乏对 CRM、ERP、金融、医疗、法务 等真实 GDP 相关企业工作流的覆盖,无法反映经济价值驱动的任务复杂度。
- 训练–测试归因失耦:训练任务与测试任务之间没有机制确保测试增益可归因于训练经验。通常只是复用相似模板,未从规则层面解耦和重组,导致增益来源不清。
- 数据污染风险固化:静态基准一经发布,模型可能直接或间接记忆测试任务,使进化效果的评估失真。现有方法缺乏低成本的动态更新手段,难以抵御 contamination。
为何棘手且重要
企业工作流通常由大量 原子业务规则 交织而成,要令 agent 从训练任务的规则子集中学习,并在测试任务中面对规则的全新组合实现泛化,技术上要求:
- 可归因的任务构造:需要将工作流分解为原子规则,通过规则子集分配(训练)与跨任务重组(测试)建立明确的因果关系,这是工程实现的难点。
- 全自动化流水线:唯有自动化生成才能快速扩增任务规模,从根本上应对数据污染。GDPevo 证明可在 两天内将基准从 120 task (V1) 扩展至 240 task (V2),为持续评测提供可行路径。
- 产业落地诉求:企业亟需能够自主优化流程、降低人工干预的进化 agent,而可靠的标准化评测是筛选和迭代技术方案的基石,因此问题具有高度的应用牵引力。
行业类比
就像自动驾驶系统需要从结构化仿真环境迁移到开放道路测试,agent 自我进化能力的评估也必须从简单合成任务走向真实、可量化的企业级业务场景,否则技术成熟度永远停留在 demo 阶段。
核心洞察
- 规则杂交是评估智能体自我进化的核心机制,它通过将企业工作流分解为 **原子业务规则** 并按子集分配训练与测试任务,使测试增益可归因。 区别于 SWE-bench 等仅按任务相似度划分数据集的基准,GDPevo 直接验证智能体对规则的组合泛化能力,而非对任务样例的记忆,解决了进化评估中长期存在的归因困难。
- 尽管自我进化带来了最高 16.44 个百分点的准确率提升,进化后的智能体仍远低于 **全能先知上限**(91.6%),表明当前智能体的自我进化能力远未充分实现。 这揭示了现有进化方法在技能迁移与长期记忆上的根本局限,对持续学习型智能体的预期提出了明确的能力差距与可量化改进方向。
方法
GDPevo 基准的构建基于全自动流水线,其核心设计目标是确保 自我进化 收益的可归因性。
输入:经济价值驱动的种子场景
流水线从真实企业工作流中选取种子场景,覆盖 CRM、ERP、金融、医疗、法律 及数据密集型流程等 GDP 关键领域。每个场景包含完整的业务规则、输入输出规范和预期决策逻辑。
关键模块:规则杂交与任务生成
原子规则分解
将每个工作流拆解为不可再分的 业务规则,每条规则定义操作条件与对应动作,确保规则之间语义独立。规则杂交
这是基准的进化原生机制。- 将全部原子规则按不同子集分配到 训练任务群,每个任务只暴露部分规则。
- 在 留出测试任务 中,重新组合这些规则,包括训练时未见的规则排列,使测试阶段性能提升可信地归因于从训练任务中学习的经验,而非简单记忆。
- 通过控制规则分布,可量化 域内迁移 与 跨域迁移 效果。
自动化任务实例化
借助大型语言模型,根据分配的规则生成具体任务描述、输入数据和评估标准。流程内置 校准与独立审查 环节:自动校验任务难度、区分度,并确保评分点二元、确定且无重叠,保障自动评估可靠性。
输出:可扩展的进化评估套件
输出结构化的训练/测试任务对,分组成组(V1 版含 12 组、120 个任务)。流水线的高度自动化使基准可在两天内从 V1 扩展至 V2(24 组、240 个任务),天然抵抗数据污染,因为新任务可通过规则重采样快速生成,避免静态题库被记忆。
差异点:与仅复用现有数据集或简单合成任务的进化自适应基准不同,GDPevo 通过规则杂交从源头构建训练-测试间的 因果可归因关系,直指自我进化评估的本质——代理如何将经验泛化到新组合,而非依赖表面特征或静态划分。
实验
实验设计上,GDPevo 基准基于规则杂交(rule hybridization) 构建:将企业工作流分解为原子业务规则,通过分配不同规则子集到训练与测试任务,确保测试性能提升可归因于训练经验。V1 包含 120 个任务,覆盖 CRM、ERP、金融、医疗、法律等 6 大领域,评估 4 种 agent 搭配 4 种监督类型,采用 held-out 准确率 指标,并与全知 oracle 上界(91.6%) 对比。
关键发现:自进化在所有设置下均能一致提升 held-out 准确率,最大增幅达 +16.44 个百分点。但最优进化 agent 仍远低于 oracle 上界,表明当前自进化能力远未充分发挥。自动化管道可在约 2 天内生成 V2 240 任务,有效缓解数据污染。
相比现有自进化基准,GDPevo 首次通过规则杂交实现因果归因设计,避免训练集与测试集重叠导致的增益夸大。覆盖经济价值更高的企业场景,且自动化生成保证可扩展性。实验揭示,模型与进化方法的选择均影响表现,但离理论上限差距明显,指向自进化技术仍有巨大发展空间。
行业影响
落地场景
GDPevo 提供了覆盖 CRM、ERP、金融、医疗、法律及数据中心化流程的标准化评估套件,直接面向需要持续自我进化的智能体产品。典型应用包括:
- 金融服务:智能风控代理通过历史欺诈模式学习,提升对新案例的识别精度。
- 医疗辅助:临床决策代理从过往病历与规则中进化,提高诊断建议的循证一致性。
- 企业流程自动化(RPA):订单处理、合同审查、保险核保等场景中,代理复用跨任务规则,减少人工干预。
商业价值
- 降本:通过自动化评估自我进化能力,企业可筛选出最适合长期运行的模型与进化策略,降低代理频繁重新训练的成本,并减少因误判带来的人工补救开销。
- 增效:论文显示,自我进化可使留出测试准确率最高提升 16.44 个百分点。这意味着在实际业务中,代理能更快适应规则变更,如保险条款更新或合规要求调整,从而加快决策周转,提升流程吞吐量。
- 风险可控:规则杂交设计保障测试增益可归因于训练经验,企业能更透明地审计代理性能提升来源,满足金融、医疗等强监管行业的可解释性要求。
与现有产品/工作流集成
- 评估层插件:GDPevo 的数据生成管线可集成到现有的 AI Agent 开发平台(如 LangChain、AutoGPT)或 MLOps 管道中,作为持续评估代理进化能力的模块,输出指标对接 CI/CD 流程。
- 数据构造器:其全自动构建 pipeline(已开源)可直接嵌入数据管理平台,为私有企业工作流生成进化专用基准,避免数据污染。
- 策略选择工具:通过比较不同监督类型(four supervision types)与进化方法的收益,辅助工程师为特定业务场景(如弱监督下的迁移学习)选择最佳进化配置。
具体落地 Use Case
- 跨域保险风控:某保险科技平台使用规则杂交生成训练/测试任务,让代理在学习健康险理赔规则后,零样本迁移至车险欺诈检测。进化后代理的留出准确率提升,可直接部署于自动化理赔审核流,将人工复核量降低 30% 以上。
- 医疗临床决策支持:电子病历系统集成基于 GPT-4o 的进化代理,利用历史科室数据进化出通用诊断规则。当新科室(如从心内科到内分泌科)接入时,代理复用先前学到的检查关联逻辑,快速达到可用的诊断建议精度,缩短冷启动周期。
局限
- 规则杂交方法假设企业工作流可分解为原子规则,但真实任务往往包含隐性知识、模糊决策与动态上下文,过度简化的规则分解可能导致合成任务与真实场景存在分布偏差,降低了基准的生态效度。此外,训练与测试任务通过规则重组构建,虽然保证了归因,但可能生成过于理想化的评估样本,无法反映实际应用中的噪声与意外交互。
- 全自动生成 pipeline 高度依赖初始种子场景的选取与校准流程,若种子覆盖领域不够广泛或校准人工审核出现疏漏,基准的多样性和难度平衡会受影响。当前评估仅使用 4 个 agent 和 4 种监督类型,未涵盖无监督进化或更复杂的记忆机制,结论的普适性有限。另外,基准主要关注准确率,缺少对进化成本、效率及鲁棒性的度量,限制了其在实际工程决策中的指导价值。
- 尽管 GDPevo 通过持续生成新任务来缓解数据污染,但其合成性质使得 agent 在此基准上的进化能力提升未必能线性迁移到真实企业系统;Oracle 天花板高达 91.6% 而最佳进化 agent 尚有较大差距,暗示基准可能仍简化了真实任务的复杂度。与 GAIA、SWE-bench 等更贴近真实环境的基准相比,GDPevo 在任务自然度上的优势不足,其推广使用需要更多社区校验和跨基准对比。