行业新闻

清华大学发布SEAGym,为自进化Agent提供动态评测框架

SEAGym 将 Agent 自进化过程与 RL 训练对齐,多视角评测更新效果,解决现有基准无法评估自我改进的空白。

AI Agent 的能力提升不仅来自模型参数更新,还来自外部系统(即 harness,包括提示词、记忆、工具等)的演化。但现有基准测试无法评估这种自我改进的动态过程。清华大学提出的 SEAGym 将自进化 Agent 的训练与强化学习对齐,从多个视角(验证、域内迁移、域外迁移、遗忘、成本)评测每次更新带来的效果。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/8107e719-c0b1-4661-b3ca-790537870293/01(2).jpg) 近日,翁荔发布长文《Harness Engineering for Self-Improvement》,系统梳理了 harness engineering(智能体系统工程,即设计和管理模型外部组件的方法)在 AI 自我改进中的作用。她指出,原始模型与真实世界任务之间的 harness layer(智能体系统层)正在变得和模型本身一样重要:它决定模型如何规划、调用工具、管理上下文、保存状态、评估结果,并在长期任务中持续迭代。 这也揭示了当下 LLM Agent 研究中的一个关键转向:Agent 的能力提升不再只来自模型参数更新,也越来越来自模型外部系统的演化。 Prompt、memory、tools、workflow、middleware、permission control、runtime state 等组件共同构成 agent harness,而这些组件正在成为自进化系统的核心优化对象。 但随之而来的问题是:如果 Agent 会不断修改自己的 harness,我们应该如何评测这种「自我改进」? 现有 Agent benchmark 大多仍然面向静态系统:给定一个固定 Agent,在一组独立任务上运行,然后报告最终成功率。这种评测方式无法回答 harness evolution(系统层演化)中更关键的问题:一次更新到底改进了什么?提升是否能迁移到未见任务?是否只是过拟合近期反馈?是否遗忘了旧能力?是否引入了更高成本或运行时不稳定?

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-15原文

相关内容