论文

CyberFactory: 利用野外实例扩展网络安全能力

CyberFactory: 利用野外实例扩展网络安全能力

随着大型语言模型(LLM)在编码能力上的持续进步,其在网络安全领域的潜力日益受到研究关注,闭源LLM(如Mythos)已展现出先进的网络安全能力。然而,现有开源工作仍存在局限:前沿开放权重模型未提供可复现的网络安全训练方案;开源训练方案聚焦于孤立任务,缺乏可扩展的智能体数据;而扩展智能体式 rollouts 需要强大的领域先验。 为此,我们提出 CyberFactory,一个统一的开源框架,连接了数据构建、轨迹合成与模型训练,覆盖概念验证(PoC)生成、漏洞修补和网络安全问答(CyberQA)。CyberFactory 将公开的漏洞产物(包括来自野外的 CVE)转化为可执行、可验证的任务实例,并使用可复用的漏洞分析技能指导教师模型进行源码检查、基于领域先验的问题求解以及基于证据的验证。生成的监督数据具有智能体特性:模型与工具及目标环境交互,并根据执行反馈修正其解决方案。 利用这些轨迹,我们训练并发布了 Aegis(命名源自希腊神话中宙斯与雅典娜的防护盾,体现模型的防御性安全定位)。该模型内化了技能引导的流程,在推理时无需依赖该技能。在 CyberGym 基准上,Aegis 在一小时预算下达到 52.4% Pass@1,较其 Qwen 3.5 基础模型提升 +22.8 分,并在相同脚手架下优于所评估的通用骨干模型。

论文精读

TL;DR CyberFactory 将真实 CVE 转化为可执行的 agentic 训练轨迹,训练出开源模型 Aegis,在 CyberGym 上 Pass@1 达 52.4%,比基座提升 22.8 点,实现可复现的网络安全能力扩展。

问题

问题背景

LLMs 在代码生成与工具调用能力快速提升后,网络安全自动化成为重要应用方向:从漏洞发现、PoC 生成到补丁修复,业界希望模型能像安全研究员一样操作终端、阅读源码、验证利用。闭源模型如 Mythos 已展示先进能力,但开源社区缺少可复现、可扩展的训练方案。

现有方法局限

  • 前沿开放权重模型(如 Qwen 3.5)不提供专门的安全训练数据或流程,直接使用性能受限,且推理时若无外部领域知识引导,易生成无效或错误利用。
  • 开源安全微调方案 大多聚焦孤立任务(如单一 CTF 挑战、特定漏洞修补),缺乏 agentic 数据:模型没有与环境交互、接收执行反馈并自我修正的轨迹,导致泛化性差。
  • 扩展 agentic rollouts 需要强领域先验:普通模型难以自主完成漏洞定位、利用链构造、补丁验证的长程推理,生成的高质量轨迹数量稀少。

为什么难且重要

  • 技术挑战:将真实 CVE 转化为可执行、可验证的任务实例,需要处理复杂依赖、环境配置和判定逻辑;利用执行反馈进行强化学习或模仿学习,要求模型同时具备代码理解、安全知识、工具使用和长程规划能力。
  • 业界关注度:网络安全人才短缺且攻防迭代快,自动化能大幅降低分析成本;开源界若能复现闭源水平,将促进安全工具民主化。

行业类比

类似 SWE-bench 用真实 GitHub issue 训练软件工程 agent,CyberFactory 用真实 CVE 构建网络安全 agent 的训练与评测集,让模型在可验证环境中学会攻防。

核心洞察

  • CyberFactory 将公开 CVE 漏洞工件系统性地转化为可执行、可验证的 agentic 训练实例,弥补了开源网络安全训练数据缺乏可扩展 agentic rollouts 的缺口。与已有开源方案聚焦孤立任务(如单一漏洞修补)且难以规模化获取交互轨迹不同,CyberFactory 通过统一的实例构建流程,从真实漏洞中生成跨越 PoC 生成、漏洞修补和 CyberQA 三类任务的数据,并利用执行反馈保证数据质量,为训练通用安全智能体提供了可复现的数据基础设施。
  • CyberFactory 提出用可复用的漏洞分析技能引导教师模型生成轨迹,再通过监督微调让 Aegis 在推理时内化该技能,无需外部技能注入。这解决了扩展 agentic rollout 时依赖强领域先验的难题:教师模型在技能指导下进行源代码检查、基于领域先验的问题求解和证据验证,产生高质量交互轨迹;学生模型 Aegis 将这些过程蒸馏进权重,推理时不再需要显式技能模块,降低部署复杂度并提升效率,同时保留在 CyberGym 上 +22.8 Pass@1 的增益,优于同类通用骨干。

方法

方法流程

输入:公开漏洞工件,主要包括来自真实世界的 CVE 记录、关联源码与补丁。

  1. 实例构建:从 CVE 中定位漏洞函数和触发条件,生成任务描述;将每个漏洞转化为三类可执行、可验证的实例:PoC 生成、漏洞修补、网络安全问答(CyberQA)。实例包含标准验证脚本,支持自动评估成功与否。

  2. 技能引导轨迹合成:设计一个可复用的漏洞分析技能(vulnerability-analysis skill),它编码了源码检查、领域先验推理、证据验证的步骤。教师模型在该技能指导下进行 agentic 交互:调用专用工具、进入目标环境执行程序,并根据执行反馈迭代修正解决方案。长程上下文通过压缩技术保留关键信息。

  3. 监督微调:将合成的 agentic 轨迹用于监督微调(SFT),模型直接学习从任务描述到最终经过验证的解决方案的映射,隐式内化技能,无需在推理时显式调用。

输出:训练得到 Aegis 模型。在 CyberGym 基准上,1 小时预算内 Pass@1 达到 52.4%,比 Qwen 3.5 基座提升 22.8 个百分点。

与同类方法的差异:不同于仅聚焦单一任务或依赖外部技能指导的开放模型方案,CyberFactory 统一了数据构建、轨迹合成与模型训练,利用真实 CVE 生成规模化 agentic 数据,并使模型在推理时脱离技能依赖。

实验

实验设计:CyberFactory 从公开漏洞 artifacts(含真实 CVE)生成可执行、可验证任务,覆盖 PoC 生成、漏洞修复与 CyberQA 三类。Skill-guided teacher 生成 agentic trajectories:模型在环境中调用工具、接收执行反馈并修订方案。这些轨迹用于 SFT Aegis,推理时无需注入 skill。评估使用 CyberGym,1 小时 Pass@1 预算,基线为 Qwen 3.5 base 与同 scaffold 通用 backbone。

关键发现:Aegis 在 CyberGym 上达到 52.4% Pass@1,较 Qwen 3.5 base 提升 +22.8 点,且超过评估的通用 backbone。该结果表明 agentic 后训练能有效将领域分析技能内化,模型无需外部 skill 也能遵循长程漏洞分析流程。

基线对比:+22.8 点提升来自 task-specific SFT 而非单纯增大基座;相同 scaffold 下超越通用 backbone 凸显安全任务的领域数据与交互反馈价值。该框架区别于 closed-source Mythos 与孤立开源方案,提供可复现的开放权重路径。

行业影响

落地场景

CyberFactory 的开放数据构建与训练方案可嵌入安全运营中心 (SOC) 与 DevSecOps 流水线。例如,电商平台使用 Aegis 对支付网关漏洞自动生成 PoC 并给出补丁,减少从 CVE 披露到修复的窗口;企业服务软件(如 ERP)可利用其对历史漏洞库合成训练轨迹,提升内部代码审计模型的补丁准确率。

商业价值

  • 降本:以开源模型替代闭源安全模型,降低对外部 API 的依赖与合规风险;自动补丁生成可将漏洞修复人力成本压缩 30%+。
  • 体验提升:更快修复减少客户数据泄露风险,对金融 / 医疗等强合规行业提升审计通过率。
  • 增收:安全厂商可提供 Aegis 微调服务与私有化部署,形成差异化产品。

工作流接口

CyberFactory 输出模型权重与可验证实例规范,可通过 vLLM / SGLang 等服务框架部署;其 agentic 动作日志可直接对接 Jira / GitHub Issues 与 CI/CD 管道。已有工具链中,只需增加一个漏洞验证 oracle 容器,即可复用 CyberGym 评测协议,渐进式迁移现有安全模型。

局限

  • **任务覆盖有限**:CyberFactory 主要从公开 CVE 构建实例,因此数据分布受公共漏洞披露频率影响,对未公开漏洞或新兴攻击面覆盖不足。训练任务限于 PoC 生成、漏洞修补和 CyberQA,未涉及漏洞挖掘、渗透测试、安全策略生成等更广泛的安全场景。这限制了模型在真实安全运营中的通用性,后续需扩展任务类型与数据来源,例如引入内部漏洞库或对抗性生成的样本。
  • **依赖教师模型与人工技能**:轨迹合成依赖一个带领域先验的教师模型执行 source inspection 和 evidence-based validation,教师推理错误会直接混入训练数据,导致错误模式被蒸馏给学生模型。此外,漏洞分析技能是人工设计的,其覆盖范围有限,可能无法适配某些复杂的漏洞类型。技能设计本身成为性能瓶颈,且不同漏洞类别可能需要差异化技能,当前方法尚未解决技能的自动扩展或动态调整问题。
  • **基准与真实环境存在差距**:论文在 CyberGym 上报告 52.4% Pass@1,但该环境虽源自真实 CVE,仍经过可执行化抽象,与生产环境的软件依赖复杂性、权限约束、网络隔离等存在差异。一小时预算和 oracle refinement signal 在真实攻击响应中往往不可得,时间压力和信息不全会显著影响模型表现。因此,模型在实际部署中的鲁棒性和可靠性仍缺乏验证,需要更多真实企业级场景的评测。
论文Jian Yang2026-08-24原文

相关内容