Anthropic J-Lens工具揭示Claude内部类“工作空间”结构
Anthropic发现Claude模型自发形成类似人脑意识的工作空间,并开发J-Lens工具进行观测与操控。
Anthropic开发了J-Lens技术,能读取大模型内部的“念头”。研究发现Claude自发形成了类似人脑全局工作空间的结构,用于主动思考而非自动任务,且可通过训练改变其内部价值观。
正文摘录
 新智元报道  【新智元导读】 没人设计过,Claude 却在学习预测下一个 token 时,自发长出了一个和人脑「意识」惊人相似的结构!Anthropic 开源「手术刀」J-Lens,第一次读出了 AI 咽回肚子里的念头。 让 Claude 一边乖乖抄写句子,一边在心里默默计算 3²−2。 屏幕上的输出干干净净,只有那段被照抄的文字,找不到哪怕半个字的算术答案。 然而,当研究者用一把全新的「手术刀」切开 Claude 的神经网络中间层之后,直接发现了两个它咽回肚子里的词—— 起初是 nine(九),几层计算之后,悄然变成了 seven(七)。 它一直在算,只是没有告诉你罢了。  就在刚刚,Anthropic 放出了一篇颠覆认知的重磅长论文—— Claude 的大脑里,竟然凭借本能长出了一个诡异的结构。 它干的活儿,和人脑中那块被称作「意识」的区域惊人地相似。 然而,从来没有人设计过它。 一个仅仅被训练用来预测下一个 token 的系统,竟然在硅基深处,自己催生出了一个类似意识的器官。