Anthropic研究:用自然语言自编码器将模型激活值翻译为可读文本
Anthropic 新研究:自然语言自编码器。
像 Claude 这样的模型用语言说话,但用数字思考。这些数字——称为激活值——编码了 Claude 的思想,但不是我们能读懂的语言。
在这里,我们训练 Claude 将其激活值翻译成人类可读的文本。
像 Claude 这样的模型用语言说话,但用数字思考。这些数字——称为激活值——编码了 Claude 的思想,但不是我们能读懂的语言。
在这里,我们训练 Claude 将其激活值翻译成人类可读的文本。