动态

Anthropic研究:用自然语言自编码器将模型激活值翻译为可读文本

Anthropic研究:用自然语言自编码器将模型激活值翻译为可读文本
Boris Cherny
Anthropic 新研究:自然语言自编码器。

像 Claude 这样的模型用语言说话,但用数字思考。这些数字——称为激活值——编码了 Claude 的思想,但不是我们能读懂的语言。

在这里,我们训练 Claude 将其激活值翻译成人类可读的文本。
动态Boris Cherny2026-05-08原文

相关内容