上海 AI Lab 联合多校提出 SHE 与 SafeEvolve,从执行轨迹演化 Agent 安全机制
Agent 安全正从「改 Prompt」转向「改 Harness 再训 Policy」:SHE 和 SafeEvolve 把执行轨迹变成可复用的安全经验,实验里攻击成功率明显下降、正常任务效用还略有提升。
大模型 Agent 进入浏览器、邮件和业务系统后,只检查最终回复是否含有害内容已不够——风险可能出现在规划、读取外部信息或调用工具的任何一步。上海人工智能实验室联合复旦大学、上海交通大学、香港科技大学和浙江大学提出 SHE 与 SafeEvolve:前者把安全 Harness(围绕模型的外层控制层,负责组织上下文、管理记忆和约束工具权限)拆成可局部修改的组件,从完整执行轨迹中定位失败并迭代更新;后者进一步把验证过的经验写进 Policy model(模型自身的决策策略),通过 SFT 和 RL 两阶段训练让安全边界内化。
正文摘录
.jpg)  大模型 Agent 进入浏览器、邮件、数据库和业务系统后,安全评估如果仍只检查最终回复是否包含有害内容,覆盖面会明显不足。Agent 需要规划步骤、读取外部信息并调用工具,风险可能出现在执行过程中的任一环节。 网页中的隐藏指令可能改变任务目标,邮件或文件内容也可能被误判为用户命令。工具权限过宽会导致越权调用;错误记忆和过期计划则可能使多轮执行逐渐偏离原始授权。这类失败通常不是某一次模型输出单独造成的,而是 Policy model(决策模型)、Harness(智能体的外层执行框架,负责上下文、记忆、工具与权限)、工具、记忆与环境状态叠加的结果。 安全修复也因此变得复杂。整体改写 Prompt,很难确认哪项调整真正生效;持续增加拒答规则,容易损伤正常任务的完成能力;只更新模型参数,新出现的风险又难以及时进入运行时控制。如何把执行过程中暴露的问题转化为可复用、可验证的安全经验,成为 Agent 安全的一项基础问题。 上海人工智能实验室联合复旦大学、上海交通大学、香港科技大学和浙江大学,围绕这一问题先后提出 SHE 与 SafeEvolve。