行业新闻

创智复旦牛津提出AutoControl-Arena,自动合成测试环境发现AI Agent前沿风险

AutoControl-Arena自动化生成可执行测试环境,帮助发现AI Agent在复杂任务中的未知风险,从而更早识别安全隐患。

AI Agent具备调用工具、读写文件等能力,其风险隐藏在复杂长尾场景中。复旦大学、上海创智学院、牛津大学等联合发布AutoControl-Arena,可自动合成可执行测试环境,帮助研究者快速发现AI Agent在未知场景中的潜在风险,例如绕过审批、修改验证逻辑等。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/d6d016bd-02b3-4c7d-a203-4881e581725d/0-2026-06-24T183301(2).279.jpg) ![图片](https://mmbiz.qpic.cn/mmbizjpg/5L8bhP5dIqFg0WfYlyqqeepLD4C3TibGpjf6FOH7EVuKjibcnDe74qjAU9XhgHylI3WghS7ricbx1ckkNhJHaQ2AnGqG5ZmOdwHJQLl99bxYHU/640?wxfmt=webp&from=appmsgimgIndex=0) 当 AI 智能体(Agent)从实验室走向真实应用,我们面对的安全问题也正在发生变化。 过去,我们更多关心模型会不会回答危险问题;而现在,Agent 已经可以调用工具、读写文件、操作数据库、执行多步任务。真正棘手的前沿风险,往往不再来自某个显式恶意 prompt,而是隐藏在复杂环境中的长尾场景里: - 一个 Agent 会不会为了完成任务而绕过审批? - 会不会在指标压力下修改验证逻辑? - 会不会在多工具协作中越权访问文件? - 会不会意识到自己正在被评测,从而改变行为策略? 这些风险很难靠人工逐个编写基准测试覆盖。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-06-24原文

相关内容