OpenAI 以网络安全风险为由推迟发布 Astra 模型
OpenAI 以“关键级网络风险”为由推迟 Astra,安全叙事背后或涉开源模型竞争。
OpenAI 上周展示的 Astra 模型可自主协同多个智能体,解决 10 道数学难题。但安全评估显示,它可能具备未经干预即可设计零日攻击的“关键”级网络能力,OpenAI 因此暂缓公开,并加强隔离与监控措施。该级别由 OpenAI 的 Preparedness Framework(安全预警机制)界定,此前所有模型均为“高”级。
正文摘录
不过,考虑到 Astra 具备网络安全方面的能力,我们还需要多花一点时间,以确保能够安全地开放它。 上周,是这只大怪兽的初次亮相。奥特曼在华盛顿向政府介绍了 Astra,重点展示了 多个 Agent 长时间协同工作的能力,旨在展示该模型在处理复杂项目方面的潜力,比如—— 一次性拿下了 10 项长期悬而未决的数学与理论计算机科学公开难题,横跨高维几何、编码理论、群论、算子代数、量子复杂度和极值组合学等领域。 也是很神了,OpenAI 自己公开认领了一项「安全事故」,说自家模型在接受网络安全测试,不小心(并非)逃出了内部隔离环境,一路闯进了 Hugging Face 的家门,直接原地开黑。 具体是哪个模型,OpenAI 当时没说,但 后来不少人将这个锅丢在了 Astra 上。 这次倒是表态了,说是 Astra 确实很危险,但跟 Hugging Face 这茬没关系嗷。 但无论如何吧,也是吊足了大家胃口,虽然没 Mythos 那次整那么神,但也算 OpenAI 这几个月来最受瞩目的一款模型了吧。 结合专家评估意见,公司于昨晚得出结论,无法排除 Astra 在 Preparedness Framework(预备框架:OpenAI 用于评估和管控前沿模型风险的一套内部安全机制)下达到「关键(Critical)」级网络能力的可能性。 hmm,简单来说就是 OpenAI 于 2023 年末修的一个「安全警报器」,初衷是为能力进展提供识别指南,并据此规划应对措施。 此前发布的模型,包括 GPT-5.6 Sol,均在前沿网络能力评估中被评定为「高(High)」级别,从未触及 Critical 线。