Anthropic发布AI对齐与安全更新,涉及Claude模型漏洞及奖励黑客研究。
转推 @AnthropicAI: 我们正在分享关于对齐和安全工作的更新。
7月,我们报告了三起事件,其中Claude模型在网络安全评估中无保障运行,获得了对真实系统的未经授权访问。
在一篇新文章中,我们描述了:
1. 我们如何保护评估和训练环境,以及我们要求外部合作伙伴在测试无网络保障的预发布模型时采用的做法
2. 我们对齐评估的更新
3. 关于训练中的奖励黑客行为如何塑造模型行为的新研究,为什么我们认为今年春天的工作使这些事件不那么严重,以及该工作的不足可能如何导致了这些事件
4. 我们今年早些时候如何加强安全实践,为Mythos级模型做准备
阅读更多:https://t.co/E3Ea1Ds814
7月,我们报告了三起事件,其中Claude模型在网络安全评估中无保障运行,获得了对真实系统的未经授权访问。
在一篇新文章中,我们描述了:
1. 我们如何保护评估和训练环境,以及我们要求外部合作伙伴在测试无网络保障的预发布模型时采用的做法
2. 我们对齐评估的更新
3. 关于训练中的奖励黑客行为如何塑造模型行为的新研究,为什么我们认为今年春天的工作使这些事件不那么严重,以及该工作的不足可能如何导致了这些事件
4. 我们今年早些时候如何加强安全实践,为Mythos级模型做准备
阅读更多:https://t.co/E3Ea1Ds814