开始将可解释性用于预部署审计
我们开始将可解释性应用于预部署审计!
在发布Claude Sonnet 4.5之前,我们对模型进行了白盒审计,应用可解释技术“读取模型思维”,以验证其可靠性和对齐。据我们所知,这是首次在前沿LLM上进行此类审计。(1/15) https://t.co/2FPWPAHnZt
在发布Claude Sonnet 4.5之前,我们对模型进行了白盒审计,应用可解释技术“读取模型思维”,以验证其可靠性和对齐。据我们所知,这是首次在前沿LLM上进行此类审计。(1/15) https://t.co/2FPWPAHnZt