OpenAI 紧急叫停新模型 Astra,网络安全能力达关键阈值
OpenAI 因新模型 Astra 具备自主发起网络攻击的关键能力而紧急叫停,说明前沿 AI 安全风险已从理论走向现实。
OpenAI 内部评估发现,新模型 Astra 在智能体编码和网络性能上取得重大突破,可能达到“关键”阈值——即能自主识别并开发零日漏洞(尚未被修复的安全漏洞),甚至仅凭高级指令发动全新网络攻击。为防范失控,OpenAI 已紧急叫停未达标工作,并限制网络与工具访问、强化模型权重保护、全面监控智能体行为。
正文摘录
 新智元报道  就在刚刚,OpenAI 紧急叫停 Astra! OpenAI 内部评估显示,Astra 在智能体编码(agentic coding)和网络性能(cyber capabilities)上取得的巨大突破,或已达到网络安全的「关键」(critical)阈值! 这意味着,Astra 可能具备自主开发零日漏洞(zero-day exploits,即尚未被厂商知晓、没有补丁的安全漏洞),甚至仅凭高级指令发动新型端到端网络攻击的恐怖能力。 为防范失控风险,OpenAI 已紧急叫停内部未满足标准的相关工作,并采取了限制网络与工具访问、强化模型权重保护、全面监控智能体高危行为等措施。  OpenAI 总裁表示:安全和保障工作正在抓紧。  潘多拉魔盒,已经打开了?