OpenAI Astra 发布在即,自主攻击能力达关键等级并加装实时监控
OpenAI 的 Astra 模型具备全自动网络攻击能力,但 OpenAI 同步加装安全监控并推迟发布,以在能力与安全间取得平衡。
OpenAI 即将发布的模型 Astra 能在无人帮助下自主发现软件漏洞并拼出攻击链,在评测中取得漏洞利用满分,甚至找到两个零日漏洞。为防它“太能打”,OpenAI 在推理链路中加了实时监控,调用 API 时可疑任务会被直接终止。初期仅向小范围测试者开放完整功能。
正文摘录
 新智元报道  OpenAI 即将发布的模型 Astra,在内部评测中拿到了漏洞利用基准 ExploitBench 的满分,还顺手挖出了两个此前无人知晓的零日漏洞。 更夸张的是,面对一个加固浏览器,它从零开始找到多个未知漏洞,拼出一条完整的沙箱逃逸链 —— 只要你打开一个 HTML 文件,它就能在你的电脑上执行任意命令! Astra 即将上线 ChatGPT,而 OpenAI 为了防它「太能打」,给它装了一套实时监控,会检查模型的推理过程。 如果系统判定行为可疑,你正在用 ChatGPT 或 Codex 跑的任务可能被暂停,弹出审核请求。 调用 API,任务甚至会直接被终止。   评测中发现零日漏洞 用更少的 Token 打出更高成功率 Astra 是 OpenAI 第一个被标定为「关键」网络安全等级的模型。 到了这个等级,模型能自主找到加固系统里的零日漏洞并写出利用代码,不需要人类辅助,直接全自动完成网络攻击。 OpenAI 公开的 ExploitBench 满分只是起点。