J-Space 可解释性研究引发哲学反思:本体工程或成 AI 黑箱关键
可解释性不能只看模型内部,还需用本体论框架分析模型处理的信息结构,本体工程是关键钥匙。
Anthropic 用 J 透镜在 Claude 内部发现可干预的神经活动区域 J-Space,但仅观察内部状态无法解释模型输出的意义。本文主张转向信息本体论,用本体工程构建可理解的知识结构,才能真正解开 AI 的可解释性问题。
正文摘录
 新智元报道   从神经科学到知识论 可解释性的进路之辨 「 解释的本质,不在于凝视机器本身,而在于审视机器所凝视的世界 」。 2026年7月,Anthropic 研究团队发表了《A global workspace in language models》,通过名为 J 透镜的工具在 Claude 内部识别出一个可被观测、可被干预且具有因果效力的神经活动区域——J-Space。 这一发现之所以引发广泛关注,在于它使研究者得以窥见模型推理过程中的「内心独白」,标志着可解释性研究从对模型行为的解释迈向了对其内部状态的实时观测。  J-Space 以认知神经科学的全局工作空间理论为解释框架,将语言模型的推理活动类比于人类意识层面的信息处理,在方法论和认识论层面都构成了重要推进,也为 AI 安全提供了全新的监控维度。 然而,正因其影响深远,更有必要审慎检视这一进路的内在局限。J-Space 研究的根本取向是内在主义的——它将可解释性的核心问题设定为「理解模型内部发生了什么」,试图像神经科学家用 fMRI 扫描人脑一样,用 J-lens 扫描语言模型的神经活动。