清华华为提出HiSME,让Agent技能演化算法本身也能演化
HiSME让Agent的技能演化算法也能从经验中学习,实现双层测试时优化,显著提升多轮工具调用和开放世界任务性能。
大模型Agent在不更新参数的前提下,能否从执行经验中提炼技能?清华和华为提出的HiSME框架,不只能让技能从轨迹中演化,还能让“产生技能的算法”本身也通过测试时反馈自我优化。它通过层次化结构管理轨迹、技能和元技能,用轻量文本规则持续改进技能抽取与维护策略,避免了静态方法的场景适配和成本问题。
正文摘录
请将以下 markdown 正文翻译成中文(原文已是中文,按 ELI25 标准优化表述与格式): .jpg)  作者介绍:李旭浚、郑克寒等来自清华大学计算机科学与技术系,研究方向包括 LLM Agent、大语言模型强化学习和测试时学习。 当大模型 Agent 被部署到工具调用、长程任务和开放环境中,一个关键问题会随之出现:能否在不更新模型参数的情况下,将执行经验沉淀下来,并在下一次做得更好? 「技能演化」(skill evolving)正是这样的测试时学习范式。Agent 执行任务后,系统从轨迹中总结可复用技能,比如工具调用流程、API 前置条件或领域操作经验;之后再遇到相似任务,这些技能会被检索出来,作为上下文提供给 Agent。但现有流程本身通常是静态的:抽取、重构、修订和过滤技能的策略往往由人工预先写死。既然技能可以从执行经验中演化出来,那么「产生技能的算法」是否也可以在测试时继续演化? 清华大学与华为基础模型部的研究者在论文中给出了答案:HiSME,一个轻量级的层次化技能元演化框架。