北航等机构用真实漏洞数据训练开源网络安全模型
研究团队用真实漏洞构建训练任务,让模型学会像安全专家一样分析、验证,大幅提升漏洞发现成功率。
北航等机构提出 CyberFactory——一个把公开漏洞资料转成可执行、可验证训练任务的流水线,并训练出开源网络安全模型 OpenAegis。在限定一小时的实测中,OpenAegis 的漏洞通过率从基座模型的 29.6% 提升至 58.1%,显著领先同类模型。
正文摘录
  给一个大模型漏洞描述和代码仓库,它能否像安全研究人员一样,读代码、找入口、调用工具、构造输入,并反复验证自己的判断? 这已经不只是问答能力的问题。真正的网络安全任务往往要持续数十分钟甚至更久,模型需要在真实环境中完成搜索、编译、运行、分析和修正。决定成败的,不只是模型 “知道多少”,还包括它能否把一连串操作组织起来。 现有开源方案仍有几处彼此关联的缺口: - 一些前沿模型虽然开放权重,却没有开源可复现的网络安全训练流程; - 已有解决方案通常只解决单项任务,尚未形成统一方案; - 已有解决方案缺乏可规模化的智能体数据; - 规模化合成智能体数据需要安全相关的先验知识。 来自北京航空航天大学、欧洲学习与智能系统研究院(ELLIS)、新加坡管理大学(SMU)和至知创新研究院(IQuest Research)的研究团队提出了 CyberFactory ,并在此基础上训练出开源网络安全模型 OpenAegis 。这项工作的重点并不是再收集一批静态题目,而是补上从真实漏洞到智能体训练轨迹的整条链路。