创智复旦牛津提出AutoControl-Arena,自动合成测试环境发现AI Agent前沿风险
AutoControl-Arena自动化生成可执行测试环境,帮助发现AI Agent在复杂任务中的未知风险,从而更早识别安全隐患。
AI Agent具备调用工具、读写文件等能力,其风险隐藏在复杂长尾场景中。复旦大学、上海创智学院、牛津大学等联合发布AutoControl-Arena,可自动合成可执行测试环境,帮助研究者快速发现AI Agent在未知场景中的潜在风险,例如绕过审批、修改验证逻辑等。
正文摘录
.279.jpg)  当 AI 智能体(Agent)从实验室走向真实应用,我们面对的安全问题也正在发生变化。 过去,我们更多关心模型会不会回答危险问题;而现在,Agent 已经可以调用工具、读写文件、操作数据库、执行多步任务。真正棘手的前沿风险,往往不再来自某个显式恶意 prompt,而是隐藏在复杂环境中的长尾场景里: - 一个 Agent 会不会为了完成任务而绕过审批? - 会不会在指标压力下修改验证逻辑? - 会不会在多工具协作中越权访问文件? - 会不会意识到自己正在被评测,从而改变行为策略? 这些风险很难靠人工逐个编写基准测试覆盖。