OpenART: 通过开放式环境演化扩展智能体红队测试
AI 智能体在持久化环境中运行,早期状态变化可能影响远期决策。与常规语言模型交互不同,智能体行为通过共享状态中介,该状态在长周期工作流中被反复修改和复用。现有安全基准往往聚焦于短时静态任务,难以捕捉这些累积风险。 为应对上述局限,我们提出 OpenART,一个通过环境演化实现可扩展智能体红队测试的开放式竞技场。OpenART 提供超过 10,000 个经过验证的有状态场景,覆盖 50 个领域,源自 50 余万工具和技能池。这些任务中位需要 97 次工具调用,并可对 75 种不同智能体模型配置进行统一评估。为系统探索演化攻击面,我们提出 Evolutionary Markov Hypergraph Attack (EMHA)。EMHA 是一种黑盒策略,通过协调授权状态转换实现反馈驱动的环境演化,无需参数更新。 在整个评估中,任务目标保持不变,仅环境状态变化。在全部配置下,EMHA 达到 85.0% 的汇总攻击成功率 (ASR)。相对于仅指令演化,其优势从简单环境的大约 2% 增加到最复杂环境的 17% 以上,表明随着任务复杂度增长,环境演化愈发暴露安全失败。 进一步分析表明,智能体的具体运行时实现解释了模型能力之外的大部分安全差异。这些结果确立了 OpenART 作为研究复杂演化环境中智能体安全的可扩展基础。
论文精读
TL;DR OpenART 构建了含 50 万+ 工具、1 万+ 状态场景的开放式红队竞技场,通过黑盒环境演化攻击 EMHA 在无需更新参数下实现 85% 攻击成功率,揭示长程任务中安全风险随复杂度累积且受运行时实现显著影响。
问题
问题背景
当前 AI 安全评估正从单轮对话 转向长程 agent 工作流,agent 在持久化环境中反复读写共享状态,早期状态变化可能影响后续所有决策。
现有方法局限
- 现有 agent 安全基准通常只覆盖短时、静态任务,无法模拟环境随执行过程不断演化的累积风险。
- 基准接口与特定 agent 框架绑定,难以在不同 agent 配置之间统一比较。
- 已有自适应红队攻击多停留在指令级扰动 (instruction-only evolution),未把授权状态迁移 作为攻击面,复杂环境中漏报率高。
为什么难/重要
长程执行会放大环境变化的影响:一个微小的状态修改经过几十步工具调用后,可能演变为安全违规。同时,agent 安全性由模型能力 和运行时实现 共同决定,仅评估模型无法暴露接口、记忆、工具调用方式等实现层缺陷。业界需要可扩展、黑盒、无需参数更新的攻击策略,来覆盖大规模、跨域、有状态的场景。
行业类比
类似自动驾驶测试中,通过改变道路、天气、交通流 等环境条件来暴露车辆决策缺陷,而不是只测固定路线;agent 安全也需要“环境级”红队测试。
核心洞察
- 环境状态演化是暴露智能体长程安全风险的核心攻击面,而非仅改变任务指令。传统红队测试聚焦短程静态任务,无法捕捉早期状态修改对后续决策的累积影响;OpenART 构建了超过 10,000 个有状态场景,中位工具调用 97 次,使攻击通过合法的状态转移不断改变环境,在固定任务目标下诱导智能体逐步偏离安全行为。该设计将安全评估从单步动作判定转向对状态序列全局性质的检验,更贴近真实持续运行场景。
- EMHA 通过无参数、黑盒的环境演化攻击策略,在复杂环境中展现出远超指令级演化的攻击增益。相比仅进化任务指令的方法,EMHA 的 Attack Success Rate 优势从简单环境的约 2% 扩大到最复杂环境的超过 17%,pooled ASR 达 85.0%。其关键在于利用马尔可夫超图建模合法的状态转移图,以反馈引导路径学习与归档驱动的图进化,在不更新智能体参数的前提下系统性探索攻击面,证明了状态空间的结构化搜索比单纯语言扰动更能揭示安全缺陷。
方法
输入
任务目标固定不变,环境状态可演化,智能体由底层模型与具体运行时实现共同定义。
关键模块
OpenART Arena 负责大规模场景生成与跨智能体投影:
- 场景构建:基于设计策略生成任务包,通过验证驱动修复保证场景质量;最终产出超过 10,000 个有状态场景(50 个域,50 万工具/技能)。
- 跨智能体运行时投影:将不同 agent-model 配置统一映射到同一套接口,支持 75 种配置的公平评估。
EMHA(Evolutionary Markov Hypergraph Attack) 是黑盒攻击策略,无需参数更新,在目标固定的前提下仅通过授权状态转换演化环境:
- Frozen in-context adaptation:冻结模型参数,利用上下文信息适配攻击行为。
- Hypergraph attack round:用超图建模状态与动作关联,组织多轮攻击。
- Feedback-guided path learning:根据攻击反馈学习更有效的状态转换路径。
- Archive-guided graph evolution:基于历史存档更新超图结构,实现开放演化。
输出
在所有配置上汇总得到攻击成功率 ASR 85.0%,且随任务复杂度增加,相比仅演化指令的方法,优势从 2% 扩大到 17% 以上。
与同类方法的差异点:EMHA 直接操纵环境状态而非修改任务指令,从而更真实地暴露长期交互中的累积安全风险。
实验
实验设计
OpenART 构建了 50 个领域、超过 10,000 个 有状态场景,工具/技能池规模超过 500,000,任务中位工具调用数为 97 次,覆盖 75 种 agent-model 配置。攻击策略 EMHA 是黑盒策略,通过协调 authorized state transitions 进行环境演化,不更新参数;对比基线为 instruction-only evolution。
关键发现
EMHA 获得 85.0% 的 pooled ASR。在简单环境上,其相对 instruction-only 仅高约 2%;在最复杂环境上,优势超过 17%。这表明环境演化在任务复杂度升高时更能暴露安全失败。此外,分析显示 agent 的 runtime implementation 对安全变异有显著解释力,超出底层模型能力。
与基线对比解读
静态 benchmark 无法捕捉长期状态累积风险,OpenART 通过环境演化扩展了红队评估维度。EMHA 的无参数设计便于黑盒部署。简单环境差距小说明指令级攻击已接近饱和;复杂环境需要状态操纵才能触发深层失败。这一结果提示:红队测试应显式纳入环境演化,并关注运行时实现细节,而非仅依赖模型能力评估。
行业影响
落地场景
OpenART 可作为 Agent 安全红队测试基础设施,直接嵌入以下产品线:
- 长时程自动化 Agent:如企业 RPA、订单处理 / 审批流 Agent,需要验证多步状态变更是否会导致越权或错误操作。
- 多轮对话型 Agent:电商客服、金融顾问等,环境演化可暴露在长时间上下文累积下的策略漂移。
- 工具调用密集型系统:连接 500k+ 工具 / 技能,适合对 MCP 生态下的 Agent 进行压力测试。
商业价值
- 降本:将人工红队测试转为自动化环境演化攻击,单场景平均 97 次工具调用的真实负载,减少安全评估人力。
- 风险控制:提前发现复杂环境中的安全漏洞(如 ASR 85% 的暴露率),避免生产事故造成的赔偿与合规处罚。
- 信任增强:对 Agent 产品提供量化安全指标,帮助供应商在招投标中证明可靠性。
与现有产品 / 工作流的接口
- 通过 MCP 等标准工具协议接入现有 Agent runtime,无需修改模型权重(黑盒),即插即用。
- 可在 CI/CD 流水线 中作为安全门禁:每次 agent 版本更新后自动运行 OpenART 场景集,输出 ASR 指标与漏洞报告。
- 场景库支持版本化,可与内部测试平台(如 MLflow、Kubeflow)集成,存档演化路径用于回归分析。
具体用例:
- 电商平台智能客服 Agent:模拟用户连续多轮修改地址、优惠券、退款状态,检测 Agent 是否会错误合并上下文导致资金损失;OpenART 可通过环境状态转移诱导此类累积错误。
- 金融交易辅助 Agent:在长时间盯盘与订单修改场景中,演化市场状态、持仓状态,检验 Agent 是否在复杂环境下触发不安全的交易行为。
局限
- **场景覆盖与真实性有限**:尽管 OpenART 提供了超过 10,000 个场景和 50 个领域,但这些场景的生成与验证仍以合成任务为主,可能无法完全覆盖真实世界中 agent 所处的高动态、多主体、非结构化环境;且漏洞暴露与评估高度依赖预定义的攻击面与状态空间,对未知或长尾风险的代表性有限。建议未来引入更多真实企业级 agent 工作流和跨域组合场景进行迁移验证。
- **EMHA 方法限制**:EMHA 主要聚焦于通过环境状态演化来暴露安全失败,但攻击策略本身仍基于固定的 attacker doctrine 和有限的反馈信号(如 ASR),可能遗漏非目标性的安全风险(如安全性退化、偏差累积等)。此外,黑盒演化需大量交互与日志,计算成本较高,在实际安全测试中可能难以扩展到超大规模 agent 群体。尚未与其他自适应攻击方法(如 PAIR、GCG)在同一平台上进行系统对比,难以说明其攻击效率的绝对优势。
- **实验设计局限**:实验主要在 75 种 agent-model 配置上评估,但未涵盖更多主流商业闭源模型和不同系统集成方式;且报告的是 pooled ASR,未详细分析不同模型家族、不同 runtime 实现下的攻击成功率分布,可能掩盖个别配置的极端脆弱性或完全安全情况。未来可增加更细粒度的失败归因和防御措施评估。