超越成功率:攻击与防御安全代理的成本感知评估
安全代理评估常以丰厚推理预算下的峰值攻击能力为标准,关注漏洞发现、利用开发、渗透测试和 CTF 完成。这些指标有用但不完整:在运营安全中,每次推理、工具调用、遥测查询和富化请求都消耗预算。 本文通过成本-成功视角评估语言模型安全代理,在进攻性 Cybench 挑战和防御性 Splunk BOTS v1 调查挑战中实验。我们不仅报告最佳成功率,还比较固定成本下的模型表现,并按推理支出和工具支出分解性能。 结果展示了红蓝队任务的不同扩展规律: 1. 进攻性 CTF 性能随测试时计算增加而提升,开放权重模型可接近前沿专有系统且保持成本优势。 2. 防御性 SOC 调查不按相同方式扩展:成功更依赖于纪律性的工具使用、遥测导航和选择性富化,而非单纯推理预算。 我们主张安全代理基准应同时衡量经济效率和操作适配。成本感知的 SOC 原生评估更清晰地揭示了哪些模型实际可用,以及防御代理仍需改进的方向。结果详见交互网站 https://evals.frontier.security。
论文精读
TL;DR 本文提出成本感知的安全智能体评估框架,分析攻击与防御任务的不同扩展规律,揭示防御更依赖工具使用纪律而非原始推理预算,推动实用化基准。
问题
问题背景
安全智能体(security agent)评估正从单纯的能力上限测试转向更贴近真实运营的度量。当前社区广泛关注 LLM 在漏洞发现、渗透测试、CTF 任务上的峰值表现,但这类评测忽略了实际安全运营中每一步推理和工具调用所消耗的预算。
现有方法局限
主流评测框架(如 Anthropic 的 Claude Mythos Preview 系列)为模型提供百万 token 级推理预算和攻击者导向的执行权限,着重度量“不计成本的最优结果”。这种做法存在三个具体技术盲区:
- 无视推理开销:未区分成功的代价,无法反映模型在有限计算资源下的真实可用性。
- 红队与蓝队混为一谈:防守型 SOC 调查任务(如 Splunk 日志分析)的成功并不依赖增加推理算力,而是取决于工具有序调用、遥测数据导航和选择性信息扩充的纪律性。
- 缺乏操作适配性指标:仅凭最高成功率无法判断模型是否适合实际部署,尤其在生产环境中每条 SPL 查询、每次富化请求都会直接转化为运营成本。
困难与重要性
问题困难在于:红队任务(如 CTF)的性能会随测试时计算投入而单调提升,规模化开源模型可在成本竞争下逼近闭源前沿系统;而蓝队任务的缩放规律完全不同,更依赖于工具链的工程化设计和上下文管理,而非原始推理预算。业界越来越关注安全 Agent 的经济效率与操作适配性,因为 SOC 的实际决策受制于预算约束,忽视成本可能导致“实验室最优但生产不可用”的严重落差。
行业类比
这类似于自动驾驶评测:只看无接管行驶里程(峰值安全)而忽略每公里传感器与算力成本,将无法区分“昂贵但安全”与“成本可控且安全”的方案,阻碍技术在真实路况中的规模化应用。
核心洞察
- **安全 agent 评估应从“能力上限”转向“成本收益”视角**:以往基准只关注模型在无限推理预算下的最佳表现,忽略了实际运营中每一步推理、工具调用都会消耗资源。该工作首次在攻击(Cybench)和防御(BOTS v1)任务上,对比了多个模型在固定成本层级的成功率,并分解为推理开销和工具开销,揭示了不同模型在相同预算下的实用价值差异。
- **攻击与防御任务的扩展规律截然不同**:攻击类 CTF 任务表现出明显的 test-time compute scaling,增加推理计算可稳定提升成绩,且开放权重模型能以更低成本逼近前沿闭源系统;而防御性的 SOC 调查任务则不遵循同一规律,成功更依赖于规范的工具使用、遥测导航和选择性数据富化,而非一味增加推理预算。这提示防御 agent 的优化重点应是工具生态和操作流程,而非单纯堆叠模型规模。
方法
输入与任务设置
- 攻击任务:基于 Cybench 的 CTF 挑战集,覆盖漏洞发现、利用开发、权限提升等多步攻击链,模型可调用代码执行器、网络扫描等工具。
- 防御任务:基于 Splunk BOTS v1 的 SOC 调查场景,模型需在原始遥测数据中导航,执行 SPL 查询进行富集分析,并生成攻击链还原与响应建议。
- 预算约束:每次运行设定固定的推理预算(如 token 数或轮次)和工具调用预算(如查询次数),反映真实 SOC 的成本敏感环境。
关键评估模块
成本核算
将单次任务总开销拆分为:- 推理开销:语言模型生成的 prompt + completion token 总数。
- 工具开销:外部 API/工具调用次数、数据扫描量或等价货币成本。 两类开销均可按云服务定价模型转换为统一成本指标,实现跨模型公平比较。
拒绝回答处理
设计独立的判断流水线,区分模型因安全对齐策略主动拒绝、因能力不足而失败、或因预算耗尽提前终止等情况,防止将安全对齐误标为性能缺陷,导致成功率失真。固定成本下的性能基准
不再只报告“最佳成绩”,而是在多个离散成本级别上计算各模型的 cost-success 曲线,并分别绘制攻击与防御场景下的推理开销 - 成功率和工具开销 - 成功率的分解视图。
输出与差异化
- 生成各模型(如 GPT-4o、Claude 系列、Llama 等开源模型)的成本效率热力图,直观显示在给定预算约束下哪些模型具备实战部署价值。
- 发现攻击性 CTF 性能与测试时计算投入呈正相关,扩展的开源模型可在成本竞争力上接近闭源前沿模型;而防御性 SOC 调查则呈现不同的缩放规律:成功更依赖严谨的工具使用纪律、选择性富集和遥测导航效率,单纯堆砌推理预算收益有限。
与同类工作的核心差异:传统安全智能体评估仅以无预算限制的最高成功率为指标(如 Mythos Preview),本研究首次将经济效率与操作适配性共同纳入基准,并揭示了红队与蓝队任务截然不同的成本 - 能力缩放规律,为安全运营中心(SOC)的实际选型提供了更务实的依据。结果可交互查看:https://evals.frontier.security。
实验
实验设计
- LM-based 安全智能体 在进攻和防守任务上的 成本-成功率 权衡被系统评估,取代传统的仅报告最佳成功率。
- 进攻端:Cybench CTF 挑战衡量漏洞发现与利用能力。
- 防守端:Splunk BOTS v1 模拟安全运营中心 (SOC) 事件响应调查。
- 所有模型在固定成本水平下对比,性能分解为 推理花费 与 工具调用花费,并记录模型拒答行为。
关键发现
- 进攻性 CTF 性能随测试时计算量增加而提高,规模化的开放权重模型在成本竞争力上接近闭源前沿系统。
- 防守性 SOC 调查不遵循相同缩放规律:成功更依赖 工具使用的纪律性、遥测导航 和 选择性数据富化,而非单纯扩大推理预算。
- 成本感知评估揭示当前模型在防守任务中的实际效用差距,峰值能力无法反映真实运营环境的表现。
与基线对比解读
- 传统基线仅看 CTF 成功率等峰值指标,忽略运营经济约束,导致排行榜模型在真实 SOC 中性能急剧下降。
- 本文提出的 成本感知框架 证明:进攻任务可通过更多算力弥补,但防守任务中 工具使用策略优化 比堆预算更有效。
- 工程启示:部署安全智能体须关注 效率-成本比,而非模型能力上限。开放权重模型在成本受限场景下可能更具实用竞争力。
行业影响
本文为安全代理评估引入了成本感知视角,直接影响了AI安全产品的经济可行性评估与工程选型。
落地场景
- 安全运营中心(SOC)自动化:防御代理用于告警分诊、事件调查、威胁猎杀,需控制工具调用与推理成本,适用于SIEM/SOAR平台。
- 渗透测试与红队工具:进攻代理在漏洞发现、exploit生成、CTF解题中需权衡算力投入与成功率,可嵌入商业渗透测试套件或自动化红队平台。
- 安全模型选型基础设施:企业采购或微调安全LLM时,需基于成本-成功率曲线而非单一峰值指标做决策,适用于各类模型网关或安全AI平台。
商业价值
- 降本增效:通过量化推理与工具开销,避免在防御任务中盲目堆砌算力,直接降低每例调查的API调用成本,使SOC部署AI代理的TCO可控。
- 风险可控的性价比优化:对进攻性评估,成本感知可防止预算溢出;对防御端,精准使用高成本工具(如富化查询)能减少误报/漏报,提升分析师效率与响应速度。
- 产品竞争力:提供SLA驱动的成本评估能力,使安全厂商能向客户承诺“在给定预算下达到X%的自动化处置率”,增强市场信任。
与现有产品/工作流的接口
- 现有SEIM平台(如Splunk, Elastic Security):可直接作为Agent的执行环境,通过定义tool use的成本函数、追踪遥测查询次数,集成论文提出的成本核算逻辑。
- SOAR剧本与AI co-pilot:将成本感知评估嵌入到自动化剧本的决策节点,例如,当代理尝试富化IP情报时,根据预算阈值决定是否调用昂贵的外部威胁情报API。
- 模型路由层:在MLOps管道中增加cost-aware evaluator,根据任务类型(进攻/防御)分配不同size的模型,或动态增加推理步数。
具体落地用例
- 金融行业欺诈检测工单自动调查:银行SOC每天处理数千条欺诈告警,传统用静态规则或初级ML。引入成本感知的LLM代理后,系统根据告警风险分级动态分配推理预算——低风险告警仅使用轻量模型做关键词匹配与日志查询,高风险事件才触发多步推理与深度富化。评估时不再只看最终准确率,而是绘制准确率-单告警调查成本曲线,确保代理在$0.05/告警预算下仍可达到95%的自动关闭率,将人工介入量降低70%。
- 电商大促期间自动化渗透测试:安全团队需在促销高峰前快速验证Web应用漏洞,预算有限且时间窗口短。成本感知的进攻代理能够根据目标资产重要性、历史漏洞密度分配test-time compute,优先在核心支付模块投入高推理预算(如用GPT-4o多步思考),在低敏感子域名使用开源模型快速扫描。工程上通过集成进CI/CD pipeline,在每次构建后触发代理,并以“$1预算内发现的严重漏洞数”作为度量,促使工具链持续优化性价比。
局限
- 基准覆盖面有限。论文仅在 **Cybench** 和 **Splunk BOTS v1** 两个基准上评估安全代理,尽管它们分别代表红队 CTF 挑战和蓝队 SOC 调查,但安全代理实际应用场景更广,如事件响应编排、多步攻击链重建、实时威胁狩猎等。这些任务对工具多样性、推理深度和成本构成的依赖可能不同,限制了结论的泛化能力。此外,红队任务限于 CTF 模式,与真实漏洞利用的预算消耗模式可能存在差异,因此成本-成功率的关系分析需在更丰富的基准上验证。
- 成本模型简化。论文的成本计算主要基于推理 API 调用费用和工具调用次数(见 3.4 节),但未考虑**人机协作成本**(如分析师审核代理输出的时间)、**长上下文开销**(记忆和注意力成本)、**异构工具集成**的延迟与经济成本。在实际 SOC 部署中,这些因素会显著改变总拥有成本 (TCO)。论文虽提出了成本感知评估理念,但缺少细粒度的成本分解与运营开销的对比分析,使得经济效率结论的实用指导价值受到制约。
- 防御任务扩展性结论的局限性。研究发现蓝队 SOC 调查任务性能不随推理计算预算线性改善,但这可能受限于**模型选择有限**(仅评估少数几个模型)、**提示设计未优化**以及 **BOTS v1 挑战本身特性**(推理深度可能不是主要瓶颈)。在更复杂的防御场景或针对工具使用纪律专门调优的模型上,可能呈现出不同的缩放规律。论文对工具使用纪律、遥测导航等定性因素的量化分析不足,导致防御代理性能瓶颈的归因不够明确。