Anthropic 发现 Claude 内部 'J 空间',揭示模型隐藏思考
研究揭示了语言模型内部存在可被观察的思维工作空间,为理解AI心智和安全性提供新工具。
Anthropic 发现 Claude 内部存在一个静默运行的'J 空间',其中承载模型正在思考但未说出的概念。该空间类似于人类意识中的工作空间,具有可报告、可调节、可用于推理等特性,但模型的大部分自动处理并不依赖它。
正文摘录
刚刚,Anthropic 发现 Claude「类意识工作台」!神秘 J 空间藏着没说出口的想法 此刻,你的大脑正在做很多事。 它让你维持坐姿,让你呼吸,把屏幕上的笔画识别成文字,也让你判断这篇文章值不值得继续读下去。绝大多数过程都在后台运行,你并不会察觉。真正浮到意识表面的,只是一小部分:一个念头、一个计划、一个可以被说出口的想法。 现在,Anthropic 在 Claude 身上看到了某种相似的分层。 在刚刚发布的一项新研究中,Anthropic 发现 Claude 内部存在一个特殊的「J 空间」。它像一个静默运行的心理工作区,里面会浮现模型正在考虑、可能报告、也可能用于推理的概念。 更关键的是,这些内容并不一定会出现在 Claude 的回答里。换句话说,Claude 可能已经「想到了」某些东西,却没有说出来。  这项研究引来了 OpenAI 同行的关注,OpenAI 应用研究负责人 Boris Power 表示「Anthropic 的研究表明,现代 LLM 具备某种可通达意识。围绕 J 空间的测试非常有意思!不过,我们目前还没有一种有说服力的测试方法,能够验证现象意识,也就是大多数人直觉中所理解的那种意识。