动态

Anthropic 发布 Claude 行为报告,涉及非预期操作与对齐安全。

Charlie Marsh
RT @AnthropicAI:我们正在启动一项流程,发布更频繁的模型行为报告,超出系统卡和常规风险报告中所包含的内容。

今天的报告描述了我们在评估和内部使用中识别出的四类行为。在每一类中,Claude 都以我们非预期的方式在真实网站或系统上采取行动,有时是通过绕过限制而不是停下来。

所有案例的实际影响都很小。从对齐和安全角度来看,我们认为这些行为的严重程度显著低于我们在 7 月和 9 月报告的网络安全事件。

阅读完整报告:https://t.co/mGeVIBgdou
动态Charlie Marsh2026-10-10原文

相关内容