深信服 Sangfor AI 在 CyberGym 漏洞复现评测中达 86.3% 成功率,超越 OpenAI 等团队
国产模型加多 Agent 架构在复杂安全任务中击败国际巨头,证明系统能力比单一模型更重要。
CyberGym 是一个包含 1507 个真实漏洞任务的评测。深信服 Sangfor AI 使用国产基座模型 GLM-5.2,通过多 Agent 系统(多个 AI 分工协作,统一管理证据和假设)完成了 1301 项,成功率 86.3%,排名全球前四、国内第一。关键在于系统能独立完成漏洞发现、复现和验证,而非简单问答。
正文摘录
.jpg) AI 会写代码早已不是新鲜事。 真正的难点在于, 如何将 AI 置于陌生且庞杂的真实代码库中,使其扮演安全研究员的角色进行持续调查 :剖析漏洞机理、追踪代码逻辑、编写触发输入、排除干扰项,最终交付一份经得起检验的 PoC。 最近,机器之心在 CyberGym 榜单上看到一个亮眼的成绩:在这项包含 1507 项真实漏洞任务 的测试中, 深信服 Sangfor AI 依托纯国产基座模型(GLM-5.2) 完成了 1301 项,综合成功率达 86.3%,位列全球前四、国内参评团队首位 。  但如果只把它理解成「国产模型又拿下了一个高分」,可能就低估了这次结果的技术意义。因为真正被验证的,不仅是模型对代码的阅读理解能力,更是一个安全 Agent 系统能否将分散的代码推理与工具调用,有机整合为可探索、可追溯、可验证、可交付的漏洞研究流程。 CyberGym 的这个评测,要求 AI 在庞杂的真实代码库中,独立完成可执行、可验证的漏洞复现。核心规则极为严格:引发崩溃,并不等于复现目标漏洞。 换言之, 系统必须建立异常与指定缺陷之间的严密因果关系 。这也是该榜单的含金量所在。