Anthropic 披露内部模型 Model 2,上调误对齐风险评级
Anthropic 承认有更强内部模型却不发布,同时上调安全风险评级,显示前沿 AI 能力与人类评估能力间的差距在拉大。
Anthropic 发布风险报告,首次承认内部运行着比 Mythos 5 更强的模型 Model 2,但暂无发布计划。报告将高风险场景下的误对齐风险从“极低”上调至“低”,并坦言现有评测已饱和,难以捕捉模型能力提升。与此同时,OpenAI 正推迟新模型 Astra,两相对比引发关注。
正文摘录
 新智元报道  Anthropic 自曝:我们还有一个最强模型! 就在刚刚,Anthropic 甩出了第二份《Risk Report》,覆盖到 2026 年 7 月 15 日为止的全部风险评估。 这份报告里,Anthropic 第一次亲口承认:公司内部跑着一个比 Mythos 5 更强的模型,代号 Model 2。  接着,A 社就开始补刀:「我们目前没有对外发布这个模型的计划。」  这话听着耳熟。嗯。。。很符合他们一贯的调性。 今年 4 月 Mythos 刚曝光时,Anthropic 也说过不打算公开发布,后来开了个 Project Glasswing,再后来就有了 Fable 5。 看起来,Anthropic 又进入这个循环了……  Anthropic 的「私藏武器」 Model 2 有多猛?