字节 Seed 等提出三项基准,研究 Agent 能否从模糊目标中自我进化
这篇讲的是 AI 自我进化缺的那一环:现有 RSI 设定都靠外部裁判喂反馈,而三项新基准测的是 Agent 自己定方向、自己判断、自己保留改动,结果普遍不理想。
人学新工作时没有现成题库和评分标准,AI 也一样。字节跳动 Seed、TokenWave 等机构在 Self-Developing Agents 项目中提出 ASPIRE、S³Gym、HarnessDev 三项基准,分别研究:Agent 如何从模糊目标中分辨该学什么、能否从自身经验中学习、对执行系统(Harness)的改动能否沉淀下来。
正文摘录
.jpg)  从模糊目标中找到正确的方向,并在这种场景下自我进化。Self-Developing Agents 用三项基准研究这个过程。 人学习一项新工作时,往往没有现成的题库和评分标准。比如,想成为更好的物理学家,需要根据个人当前水平,决定该补哪些数学知识、学习什么新的物理理论,或掌握哪种实验方法。让 AI 像这样学习,是字节跳动 Seed、TokenWave 等机构研究者在 Self-Developing Agents 项目 Blog 中提出的研究方向。团队希望 Agent 能在工作中逐步胜任一个角色,并将反复处理实际问题的经验积累成可复用能力。 这也是递归式自我改进(Recursive Self-Improvement,RSI)需要真正补上的一部分。当前常见的一些设定,其实并不是真正的 RSI——「半环 RSI」:假设有一个可靠的 Golden Verifier,持续判断结果、指引改进方向。Agent 可以沿着反馈优化,但学习目标和判断依据已经由外部准备好了。而更完整的闭环还要处理前面的判断和后面的积累。