工作参与Anthropic模型安全审计 Chris Olah我们的工作在越来越重要的实际模型安全中发挥作用。我们深度整合到了Anthropic新前沿模型的安全审计中。例如,参见Sonnet 4.5和Opus 4.5的系统卡,识别未言明的评估/情境意识。 动态Chris Olah2026-02-23原文 打开互动版