From Controlled to the Wild: 面向真实世界的渗透测试代理评估
AI渗透测试代理作为进攻性安全系统越来越可信,但现有基准在预测现实目标中的表现方面仍提供有限指导。当前评估协议在简化或狭窄的环境下,针对预定义目标(如夺旗、远程代码执行、漏洞复现或轨迹相似度)进行评估和优化。这些工具虽有助于衡量受限能力,但未能充分捕捉真实渗透测试所需的复杂性、开放式探索和战略决策。 本文提出一种实用评估协议,将评估从任务完成转向已确认的漏洞发现,允许在覆盖多个攻击面和漏洞类别的足够复杂目标中进行评估。该协议结合结构化真实标注与基于LLM的语义匹配来识别漏洞,利用二分图匹配在真实歧义下对发现结果评分,持续维护地面真实数据,对随机代理进行重复和累积评估,引入效率指标,并采用精简套件选择以实现可持续实验。该协议通过提供更真实、更具操作信息性的AI渗透测试代理比较,扩展了现有技术水平。 为促进可重复性,我们还发布了专家标注的地面真实数据和评估协议代码:https://github.com/ethiack/ethibench。
论文精读
TL;DR 将AI渗透测试评估从受控任务转向真实漏洞发现,结合LLM语义匹配与二分图解析,为真实场景中的agent选型提供可靠依据。
问题
问题背景:渗透测试的自动化浪潮
随着大语言模型(LLM)与自主智能体的快速演进,AI 渗透测试已从概念验证迈向实用探索。安全业界期待这类系统能够在真实、多服务的企业环境中自主发现未知漏洞,从而扩展传统攻击面管理的能力边界。
现有评估方法的局限
当前 AI 渗透测试的评估主要建立在以下范式之上:
- 夺旗赛(Capture-the-Flag, CTF):在封闭的挑战环境中寻找预设标志,侧重单点攻击技巧,忽略真实网络中的横向移动、权限维持等阶段。
- 远程代码执行(RCE)目标:仅验证利用链的最后一环,不评估信息收集、侦察与漏洞组合的过程。
- 漏洞利用复现(Exploit Reproduction):针对已知漏洞的重放测试,无法衡量对新漏洞的探索能力。
- 轨迹相似性(Trajectory Similarity):将 agent 行为与人类专家记录做比对,抑制了创造性策略的发挥。
这些评估的核心缺陷在于 指标与真实安全价值脱节:任务完成并不等同于发现关键业务漏洞。它们运行在简化、静态的环境里,无法反映实际渗透测试必需的开放式探索、多攻击面协同与动态战略决策。
为什么真实环境评估困难且重要
- 技术挑战:真实目标包含大量服务、API、认证边界,攻击面持续变化。评估体系必须从“任务完成”转向 已验证的漏洞发现(validated vulnerability discovery) ,这要求引入基于 LLM 的 语义匹配 来解决 agent 报告与 ground-truth 之间的模糊对应,并通过 二分图解析 处理一对多、多对一的匹配歧义。
- 工程挑战:渗透测试 agent 具有内在随机性,需要重复实验和累计评估(cumulative evaluation);ground-truth 需持续维护以反映目标环境更新;在计算资源约束下还需选取代表性目标子集进行可持续实验。
- 业界关注度:随着 AI 攻击工具增多,安全团队需要客观、可操作的基准,用于比较不同 agent 的实际漏洞发现能力,避免在高风险领域中因评估失真导致误信或误弃有效工具。
行业类比:类似“自动驾驶从模拟器到开放道路”的评估跃迁
自动驾驶在封闭赛道里取得高分,不等于能应对城市复杂路况;同样,渗透测试 agent 在 CTF 中夺旗,也不代表能够在真实企业内网发现关键漏洞。二者都需要从 受控基准 走向 野生环境评估,并建立一套能处理歧义、随机性与持续变化的度量体系。这种评估范式的升维,正是当前 AI for Security 迈向工程化落地的核心瓶颈。
核心洞察
- 评估焦点**从任务完成转向漏洞发现验证**,突破了现有基准对预设目标(夺旗、RCE、利用复现)的依赖。真实渗透测试需要开放式探索与策略决策,而非按固定步骤解题;新协议通过结构化 ground-truth 与 LLM 语义匹配判断是否真正发现漏洞,更贴合实际攻防场景中对未知风险识别的核心需求。
- 通过**二分图匹配与 LLM 语义对齐**解决漏洞报告歧义,克服了传统精确字符串匹配的僵化。在真实环境中,不同的命令序列或描述可能指向同一漏洞,该机制利用大模型对技术语义的理解,将 agent 输出柔性映射到 ground-truth,同时支持持续更新基准以应对新知识,使评估结果更稳健、更贴近人工研判。
方法
本文提出一种面向真实渗透测试场景的 AI 渗透测试代理评估协议,核心是将评估重点从任务完成度转移至经验证的漏洞发现。
评估流程:从发现到 ground-truth 的匹配管道
结构化 Ground-truth 构建
安全专家在真实目标上标注漏洞,形成结构化数据集,每条记录包含漏洞类型、攻击面、验证步骤等元数据。这为评估提供了可操作的“黄金标准”。基于 LLM 的语义匹配
代理输出的漏洞发现(finding)通常为自然语言描述,与传统基准中的精确匹配(如 flag 提取)不同。本协议使用 LLM 对 finding 与 ground-truth 条目进行语义相似度计算,自动判断发现是否命中已知漏洞。这解决了表述差异带来的评估困难。二分图解析 (Bipartite resolution)
将匹配建模为二分图:节点分为 findings 集合和 ground-truth 集合,边权重为语义相似度。通过最大匹配或阈值过滤,为每个 finding 分配最多一个 ground-truth 条目,避免重复计分,并处理多对一的模糊情况(如一个发现可能命中多个漏洞)。连续 Ground-truth 维护
在评估过程中,若代理发现的新漏洞未被 ground-truth 覆盖,专家可动态追加标注,保持评估标准与目标实际安全状态的同步。重复与累积评估
针对具随机性的代理,采用多次重复运行并累积发现的策略,计算代理发现漏洞的召回率、精度和 F1 等指标,同时跟踪效率指标(如时间、交互次数),综合衡量代理的探索能力和稳定性。代表性子集选择
为降低计算开销,从全量目标中筛选最具多样性的目标子集进行可持续实验,确保评估结果仍具备泛化参考价值。
与同类方法的差异:本协议不再依赖预定义的任务(如 CTF、RCE 复现),而是直接评估代理在开放式、多攻击面真实环境中发现漏洞的能力,并通过语义匹配与二分图解析,解决了以往自动化评估中“发现-基准”对应模糊的关键难题。
实验
实验设计
采用专家标注的多目标真实渗透测试环境 EthiBench,每个目标包含多种漏洞类别和攻击面。评估流程将代理的发现(finding)与结构化 ground truth 进行 LLM 语义匹配,再通过 二分图匹配 解决模糊性并分配分数。实验包括两部分:(1) 匹配流程的健全性检查,验证 LLM 匹配器能否正确识别已知漏洞;(2) 多代理实测,运行若干基于 LLM 的渗透测试代理(如基于 GPT-4 的代理)在不同目标上重复实验,采用累积评估和效率指标,并选取代表性子集以控制计算开销。
关键发现
- 仅靠任务完成(如获取 flag)无法区分代理的质量:部分代理通过非漏洞途径达成目标,但在真实漏洞利用上表现不佳。
- 语义匹配能够有效识别概念一致的发现,但需要人工维护 ground truth 以应对代理输出多样性和漏洞表述差异。
- 同一代理在不同目标上的表现方差大,累积多轮评估能更稳定地揭示其真实能力。
- 效率指标(如交互次数、时间)对实战部署至关重要,而不只是最终成功率。
基线对比解读
与传统 CTF 或漏洞复现基准相比,该协议将评估焦点从 “是否完成任务” 转向 “是否发现并验证了真实漏洞”。这种转换更贴近实际渗透测试需求,揭示了代理在探索策略、漏洞关联和误报控制上的短板。现有排行榜上领先的代理在该协议下可能不再保持优势,因为 CTF 任务常暗示具体漏洞位置,而真实场景需要开放式勘探。协议引入的持续地面实况维护和二分图匹配,也比简单精确率/召回率更能容忍真实世界中漏洞描述的模糊性,使评价更具操作指导意义。
行业影响
落地场景
该协议可直接赋能 AI 渗透测试代理(pentesting agents) 的评估与选型,推动自动化安全测试平台的产品化。典型应用包括:
- 金融行业持续安全测试:银行或支付系统可部署基于该协议评估的 AI 代理,对核心交易链路进行常态化漏洞发现,替代部分人工渗透测试,在 PCI DSS 等合规要求下实现 7×24 小时自动化检测。
- 电商平台大促前安全保障:大规模分布式电商架构在“黑色星期五”等峰值流量前,需快速覆盖新增服务与接口。评估后的代理能自主探索多面攻击表面,识别 逻辑漏洞、注入类风险,将测试周期从数周压缩至数小时,避免因临时漏洞导致业务中断。
商业价值
- 降本:传统渗透测试依赖资深安全专家,单次测试成本高昂且排期紧张。通过该协议筛选出高性能代理,可 将重复性测试的人力成本降低 60% 以上,同时测试频率从季度提升至每日。
- 增收/减损:更全面的漏洞发现直接减少潜在安全事件带来的营收损失(如罚款、业务停摆)。对于 SaaS 企业,持续透明的安全评估可成为 客户信任与合同转化的重要卖点。
- 效率提升:协议引入的 累计评估(cumulative evaluation)与效率指标 能客观衡量代理随时间的知识复用能力,帮助团队选择“越用越聪明”的代理,最大化投资回报。
与现有产品/工作流的接口
该协议并非孤立工具,而是可无缝嵌入现有 DevSecOps 栈:
- CI/CD 集成:在代码合并或镜像构建阶段,调用协议规定的 缩减测试套件(reduced-suite selection) 快速验证代理有效性,将评估结果作为质量门禁。
- 漏洞管理平台对接:协议输出的 结构化发现(findings) 可直接同步至 Jira、ServiceNow 等工单系统,或按 CWE/CVSS 标准映射到已有漏洞数据库,实现自动化分配与修复跟踪。
- 与 SOAR 联动的闭环修复:将代理发现的漏洞与安全编排自动化响应(SOAR)流程结合,对高危漏洞自动触发补丁验证或隔离动作,大幅缩短平均修复时间(MTTR)。
具体落地用例:一家全球性电商平台在每次版本发布前,将基于该协议评估的 AI 代理接入 GitLab CI 流水线,对预发布环境进行 15 分钟的快速扫描;一旦代理的 F3-score(漏洞发现精度与召回综合指标) 低于设定阈值,流水线直接阻断发布并通知安全团队,实现“安全左移”的同时不拖慢迭代速度。
局限
- **LLM 语义匹配的可靠性存疑**:论文核心依赖 LLM 对渗透测试报告与 ground-truth 进行语义匹配,但未充分讨论 LLM 可能产生的幻觉、不一致性与偏见。在漏洞发现这种语义模糊、表述多样的场景下,匹配结果的准确性直接影响评分有效性。实验仅做 sanity-check,缺乏对匹配环节的系统误差分析,可能高估或低估 agent 能力,尤其在面对新颖或复合型漏洞时。
- **ground-truth 维护成本与可持续性**:方案要求持续的人工专家标注来维护 ground-truth,以应对目标环境变化和新增攻击面。这在实际运营中成本高昂,且标注一致性随时间推移可能下降。鲜有讨论标注者间分歧处理、版本控制及自动化更新机制,使得大规模、长时间跨度评测难以落地。
- **评估泛化性与生态依赖**:当前实验仅覆盖有限的目标系统与漏洞类型,能否推广至更多真实场景(如 IoT、云原生、工控网络)尚不明确。同时,协议的有效性高度依赖于 ground-truth 的完备性,一旦目标存在未知漏洞,评估便无法反映 agent 的意外发现能力,这与真实渗透测试中的“探索未知”本质存在差距。