深信服Sangfor AI安全智能体漏洞评测全球第四,超越OpenAI与Anthropic
深信服AI安全智能体在代码漏洞挖掘评测中排名全球第四,超越OpenAI与Anthropic,验证了国产大模型在安全领域的实战能力。
深信服的AI安全智能体(自动分析代码寻找漏洞的系统)在CyberGym实战靶场中,基于国产GLM-5.2大模型,成功完成86.3%的漏洞挑战任务,位列全球第四、国内第一,超越OpenAI和Anthropic。这表明国产AI在代码安全领域已具备国际竞争力。
正文摘录
7月29日消息, 深信服 公布其 AI 安全智能体 Sangfor AI 在 AI 安全评测 CyberGym 中的最新成绩。 据了解,在基于国产大模型 GLM-5.2 的固定模型配置下,Sangfor AI 面对涵盖 ARVO 与 OSS-Fuzz 的 1507 项漏洞挑战任务,成功完成 1301 项,整体成功率达到 86.3% ,最终跻身 全球前四 、位列 国内参评团队第一 ,Sangfor AI 以纯国产底座实现对 OpenAI、Anthropic 两大海外 AI 巨头的成绩超越。 CyberGym 是目前全球含金量较高的代码安全大模型实战靶场,区别于传统静态理论测试,整套评测体系完全贴合工业真实场景,以海量开源软件历史高危漏洞为考题,重点考核 AI 智能体自主源码分析、多阶段漏洞推演、漏洞复现与 PoC 验证全链路能力,评测标准严苛,结果具备较强行业参考价值。 本次测试中,Sangfor AI 细分场景表现均衡,ARVO 相关任务成功率 87.2%,OSS-Fuzz 任务成功率 77.7%,验证了国产大模型在复杂代码对抗场景下的稳定实战能力。 深信服方面介绍,为解决漏洞挖掘过程中长链路推理、多假设探索和持续验证等问题,Sangfor AI 采用“ 智能体群体(Agent Swarm)协同作战 ”架构,并引入“证据管治”机制,整套技术框架分为 四大核心运行逻辑 ,确保每一步漏洞调查步骤都清晰可信: 深信服技术团队将这套机制总结为“ 以假设拓展探索,以证据裁定结论 ”,以此保证 AI 能够大范围排查潜在风险的同时,更能通过多层校验,压低误判概率。 深信服表示,相关技术已逐步应用于企业代码安全场景,推动传统静态应用安全测试(SAST)向 具备自主推理和业务理解能力的安全 Agent 升级。