行业新闻

GPT-6 Astra 达网络安全关键级,OpenAI 详述安全防护

GPT-6 Astra 达网络安全关键级,OpenAI 详述安全防护

GPT-6 Astra 网络能力跃升至关键级,OpenAI 如何平衡能力与安全?

OpenAI 发布 GPT-6 Astra,首个达到网络安全能力“关键”级别的模型。它可自主发现未知漏洞并开发利用方法,但 OpenAI 通过强化防护、改进对齐训练和部署错位监控系统来应对。尽管其思维链可监控性下降,整体违规率仍低于前代。

正文摘录

2026 年 9 月 3 日 [安全](https://openai.com/news/safety-alignment/) GPT‑6 Astra 安全概览 [阅读完整系统卡(在新窗口中打开)](https://deploymentsafety.openai.com/gpt-6-astra) 加载中… 分享 今天,我们发布 GPT‑6 Astra,这是我们广泛部署过的能力最强的模型。Astra 是我们首个在《预备框架》(Preparedness Framework)下达到 网络安全能力“关键”级别 的模型。 关于本次发布的安全性,最重要的信息如下: - GPT‑6 Astra 在网络能力上实现了显著飞跃,达到了我们的“关键”阈值。 这意味着,在合适的工具和访问权限下,GPT‑6 Astra 能够发现此前未知的安全漏洞,并在无需人工逐步引导的情况下,针对许多受到良好保护的系统开发新的利用方法。因此,我们大幅加强了对模型采取有害网络行动的防护措施,无论此类行为源于滥用还是错位(misalignment)。我们还采取措施保护 Astra 及类似模型的内部开发与部署安全,包括更严格的隔离、检查点加密、对包括思维链(chain of thought, CoT)在内的完整轨迹进行普遍监控,以及在内部使用前进行阻断式的对齐评估流程。 - GPT‑6 Astra 比其前代模型显著更加稳健。 结合新的鲁棒性安全训练技术,GPT‑6 Astra 在抵御越狱(jailbreak)方面显著优于 GPT‑5.6 Sol,在更长的任务轨迹中尤其如此。这一结论来自离线测试以及我们严格的内部和外部越狱测试与修复计划。对于被标记为潜在高风险的用户,我们还额外训练了调整模型拒绝边界的能力,使其更为保守,覆盖更广泛的双重用途风险。

阅读原文(openai.com)→

行业新闻2026-09-03原文

相关内容