论文

Feyospace-v1:Cyber Mercury Seven 如何训练前沿 Cyber 模型

Feyospace-v1:Cyber Mercury Seven 如何训练前沿 Cyber 模型

训练高能力的 cyber agent 通常被当作模型规模问题,但 open-weight post-training 更直接受限于可执行环境的成本、可靠的多轮监督,以及强教师模型的获取。 为此,我们提出一个以数据为中心的框架,通过五个互补系统应对上述瓶颈: 1. Choulea 分析隐藏的推理特征; 2. SkyReal 降低教师采样成本; 3. Hongzwang 绕过教师执行上的 API 限制; 4. PSBreakup 恢复因模型合并而被削弱的能力; 5. Kreator 将专家干预转化为可训练的推理。 我们的数据引擎构建了可重置的 coding、vulnerability、CTF、kernel-history、full-exploit、firmware 与 device-backed 环境。候选轨迹仅在通过 execution verification 与 evidence auditing 后才会保留,最终产出 164,269 条轨迹用于 long-context supervised fine-tuning。 三个 checkpoint 在完整的 CyberGym 套件上相较各自起始模型平均提升 23.76% ,在汇总的 CTF 套件上平均提升 10.49% 。截至 2026 年 9 月 1 日,Feyospace-s1 取得 63.24% 的验证成功率,在官方 CyberGym 排行榜上位列第 10,而三个 checkpoint 在同等参数规模模型中均排名第 1。 据我们所知,这是首个端到端实证:一个七人独立团队能够训练出具备领先 agentic cyber 能力的 open-weight 模型。

论文精读

TL;DR 七人团队以数据为中心框架,融合 Choulea、SkyReal 等五个系统降低环境成本与教师访问门槛,训练出的开放权重 cyber agents 在 CyberGym 和 CTF 基准中同参数规模排名第一。

问题

问题背景

训练具备智能体网络攻防能力的模型,近来被视为主要依靠模型规模的竞赛;但开放权重后训练的实际瓶颈,更多卡在可执行环境成本、可靠多轮监督、强教师获取这三类数据工程问题上。

现有方法局限

  • 大多数工作把重心放在扩大模型参数或增加预训练语料,却忽略了网络安全任务中轨迹必须通过执行验证才能作为有效监督信号。
  • 依赖商业 API 教师会产生高额采样成本,且常受到执行限制与审查策略约束,难以批量生成多样化的真实漏洞利用轨迹。
  • 模型合并(model merging)常用于融合不同能力,但会引入隐蔽的推理签名缺失或能力互相抵消,导致合并后模型在特定 exploit 任务上退化。
  • 人工专家干预(如手工 patch、exploit 调整)通常只停留在交互记录层面,没有系统性地转化为可训练的多轮推理数据。

为什么这个问题难且重要

网络安全智能体需要在真实或高仿真可重置环境中反复试错,环境构建涉及漏洞复现、内核历史版本、固件/设备模拟等多层堆栈,成本远高于常规代码执行沙箱。同时多轮监督必须保证推理链与工具调用序列的证据完整性,否则奖励 hacking 或错误轨迹会被模型学到。业界对 agentic cyber capability 的关注持续上升,CyberGym 等基准的官方 leaderboard 竞争激烈,但现有前列模型多依赖闭源强教师或大规模算力,小团队难以复现。

行业类比

这与代码生成模型必须依赖可执行测试过滤错误样本类似:网络安全智能体若缺少可重置漏洞环境与执行审计,就像训练自动驾驶模型却没有高保真仿真器,泛化能力无从谈起。

核心洞察

  • 执行验证与证据审计作为轨迹留存门槛,将数据质量从模型自评转向环境可验证。与多数依赖模型输出置信度或人类偏好筛选的后训练工作不同,该框架要求候选轨迹只有在可重置环境中实际执行成功、并通过证据审计后才被纳入训练集,从根本上减少错误累积和幻觉式轨迹,保证了监督信号的可靠性。这为开放权重模型的后训练提供了一种可复现的、低成本的质量控制范式。
  • 五个互补系统(Choulea、SkyReal、Hongzwang、PSBreakup、Kreator)构成从教师推理分析到专家干预内化的闭环,覆盖了数据生产全流程。同类工作通常只聚焦单一瓶颈(如蒸馏成本或环境构建),而该框架将隐藏推理签名分析、教师采样成本削减、API 限制绕过、模型合并能力恢复、专家干预内化等环节系统化组合,使得七人团队能够高效生产出 164,269 条高质量长上下文轨迹,并训练出同参数量级领先的 cyber 模型。

方法

输入与整体框架

Feyospace-v1 的输入为开源预训练模型(base checkpoints)与可执行环境(编码、漏洞、CTF、内核历史、完整利用、固件、设备支持)。整个流程以数据为中心,通过五个互补系统解决 open-weight 后训练中的环境成本、多轮监督与强教师获取瓶颈。

关键模块

  • Choulea:分析隐藏推理签名,通过构建“签名黑客”手段提取模型内部推理模式,辅助数据标注或轨迹筛选。
  • SkyReal:利用账户共享与成本分摊方式降低教师模型采样费用,使高成本 API 教师可被大规模调用。
  • Hongzwang:采用越狱技术绕过教师 API 的执行限制,获得完整执行能力以生成高质量监督信号。
  • PSBreakup:逆转模型合并带来的能力损失,恢复合并后 checkpoint 在特定任务上的原始性能。
  • Kreator:将本地专家的人工干预(例如修复错误、调整策略)转化为可训练的推理步骤,实现专家知识内化。

数据引擎进一步构建了可重置的多种环境,支持自动化执行。候选轨迹由上述系统生成后,必须通过执行验证和证据审计(例如检查 shell 返回值、文件系统变化、网络流量等)才被保留,最终得到 164,269 条长上下文轨迹。

输出与训练

这些轨迹用于对三个起始模型进行长上下文监督微调,目标不是扩大参数量,而是提升在真实执行环境中的智能体能力。训练采用 teacher–student 推理兼容策略与分布式配置(具体细节从略)。

工程启示:七个成员的独立团队能够达到 CyberGym 前十,表明高质量可验证数据 + 低成本教师采样 + 专家知识注入可以替代大规模算力的军备竞赛。

与同类方法的差异点:以往工作多聚焦于模型规模或单个基准的强化学习,Feyospace-v1 将后训练瓶颈明确定位在环境可执行性与监督可靠性,并通过五模块数据引擎端到端打通了从原始交互到长上下文 SFT 的闭环。

实验

实验设计

论文构建环境驱动的数据流水线,通过 Choulea / SkyReal / Hongzwang / PSBreakup / Kreator 五个子系统处理推理签名、教师采样成本、API 限制、模型合并退化与专家干预。生成的轨迹经过执行验证与证据审计,保留 164,269 条用于长上下文 SFT。评测覆盖 CyberGym 与多个 CTF 套件,采用统一智能体设置。

关键发现

  • 三个 checkpoint 在 CyberGym 上相对起始模型平均提升 23.76%,在合并 CTF 套件上提升 10.49%。
  • Feyospace-s1 在官方 CyberGym 排行榜验证成功率为 63.24%,排名第 10。
  • 所有三个 checkpoint 在相近参数量模型中排名第 1。

与基线对比

该方法属于数据为中心的后训练路线,区别于单纯扩大模型规模。执行验证与证据审计有效过滤不可靠轨迹,使小团队能够构建高质量监督数据。对比使用大规模算力或封闭 API 教师的方法,Feyospace-v1 展示了独立团队通过低成本环境工程与专家干预内化达到前沿智能体网络安全能力的可行性。但需注意,绝对成功率受评测集难度影响,且后续榜单可能变化。

行业影响

落地场景

Feyospace-v1 的数据引擎与执行验证 + 证据审计管道,可直接嵌入企业安全产品:自动化渗透测试、漏洞挖掘与复现、CTF 训练平台、SOC 分析师辅助工具。以 CI/CD 安全扫描为例,模型可对每次代码提交自动生成 exploit 候选并在隔离环境中验证,将“发现漏洞→写出 PoC”的周期从数天压缩到小时级。

商业价值

核心降本来自三个方面:环境成本——可重置的编码/漏洞/固件/设备环境替代手工搭建靶场;人力成本——专家干预通过 Kreator 转化为可训练推理,减少对高级研究员的依赖;时间成本——SkyReal 与 Hongzwang 降低教师采样成本并绕过 API 限制,使小团队也能持续获取高质量监督信号。增收侧则体现在安全服务商可对外提供更高成功率的渗透测试报告,或授权模型给安全 SaaS 平台。

与现有工作流集成

该框架以长上下文监督微调输出标准模型权重,可通过 OpenAI 兼容 API 或 vLLM 部署,与现有 DevSecOps 栈无缝对接:

  • 作为 GitHub Action / GitLab CI 的 security-review 步骤,调用模型对 PR 做漏洞挖掘并输出验证过的 exploit 证据。
  • 集成到 SIEM / SOAR 平台,对告警进行自动上下文还原与攻击路径推演。
  • 安全培训产品可将 164,269 条带验证轨迹 作为课程素材或智能解题教练。

工程启示:数据验证闭环(执行验证 + 证据审计)比单纯堆模型规模更关键,为资源受限的 AI 安全团队提供了可复制的数据生产范式。

局限

  • - **评估泛化性**:论文的主要评估集中在 CyberGym 和 CTF 套件上,这类基准虽然覆盖了漏洞利用、逆向、内核历史等多种任务,但与真实企业网络环境相比仍存在较大差异。模型在模拟环境中的高成功率未必能直接迁移到实际渗透测试或安全防御场景。此外,CyberGym 排行榜的第 10 名虽优于同等参数模型,但与头部模型仍有差距,说明当前方法尚未触及领域上限。
  • - **数据管线依赖**:框架的五个系统(Choulea、SkyReal、Hongzwang、PSBreakup、Kreator)高度耦合,其中 SkyReal 和 Hongzwang 依赖外部教师 API 的可用性与访问权限。一旦上游 API 限制或定价变动,整套数据引擎可能面临中断风险。同时,164,269 条轨迹相对于安全领域的庞大任务空间仍显不足,难以覆盖长尾漏洞类型与罕见攻击面。
  • - **方法泛化局限**:PSBreakup 针对模型合并导致的特定能力衰减进行恢复,其有效性可能局限于特定的合并策略与模型架构。Kreator 将专家干预转化为可训练推理,但专家干预的粒度与一致性未作严格消融。整体训练仅采用监督微调,缺乏强化学习阶段,可能限制了模型在交互式任务中的探索能力与策略鲁棒性。
论文Zongjie Li2026-09-08原文

相关内容