OpenAI 暂停前沿模型强化学习训练两周
OpenAI 因模型网络安全能力接近关键风险阈值,主动暂停最大规模 RL 训练,先加固安全再继续。
OpenAI 暂停了其最新部署模型的强化学习训练(一种通过试错奖励来优化模型行为的方法),原因是模型在网络安全评测中表现过强,可能达到“关键”风险等级。公司正加固研究环境、扩大 AI 监控,并先以较小规模训练验证安全措施。
正文摘录
.png) OpenAI 给最前沿的模型训练,踩下了刹车。 就在刚刚,OpenAI 发文称, 公司此前曾暂停其最新、计划用于部署的模型强化学习(RL)训练两周 。在此期间,OpenAI 加固研究环境、进行红队测试,并扩大内部监控系统的覆盖范围。之后一部分风险较低的训练已经恢复。 但目前, 原计划开展的最大规模前沿模型 RL 训练仍处于暂停状态 。公司正在通过更小规模的训练和评测观察模型行为,验证新的安全措施,并积累更多对齐证据,之后才会决定是否继续。  - 原文链接:https://openai.com/index/pacing-model-development-cyber-capabilities/ Sam Altman 转发称,「我们一直强调,如果模型的能力超出了安全性和对齐性的要求,我们将立即采取行动。我们非常重视人工智能的安全性问题。