行业新闻

清华与斯坦福团队在 LLM 内部定位奖励神经元子系统

研究首次把 LLM 内部的奖励信号定位到极少数具体神经元,并证明它们既能当置信度估计器,也能当流程奖励模型用。

斯坦福与清华大学的研究发现,大模型隐藏状态里与奖励有关的信息并非均匀分布,而是集中在不到 1% 的神经元中——他们称之为「奖励子系统」。其中价值神经元编码当前推理最终答对的概率,多巴胺神经元编码每一步带来的概率变化。把前者置零,MATH500 准确率从 75.2% 掉到 20.3%。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/03f0e4de-208b-4c4c-bafe-c044ee9df4fb/083(2).jpg) 编辑丨% 大型语言模型的隐藏状态里,早已被发现包含一些与答案正确性、模型置信度和奖励相关的信息。但此前的研究通常直接对完整隐藏状态训练一个探测器,只能说明这些信息「能够被读出来」,却很难进一步回答究竟是模型中的哪些神经元在编码这些信号? 斯坦福与清华大学在一项研究中提出了一种更细粒度的观察方式。他们发现,与奖励相关的信息并没有平均分散在整个隐藏状态中,而是集中在一小部分神经元里,并将其称为 reward subsystem,即奖励子系统。 ![图片](https://mmbiz.qpic.cn/mmbizpng/5hq6GFHibJv5lYYcyUkeeNPU7MhwUmxnVfuEl4aTiaBgDHhcfL2iaCWUdUO9plsxye3TfKoKuqoPqqzQIcG1CUhV1qV8ZJHgD4M33Hia73Cbwuk/640?wxfmt=png&from=appmsgimgIndex=2) 论文链接: https://arxiv.org/abs/2602.00986 模型中的神经元 论文最终找到的两类神经元,分别对应状态价值和逐步奖励预测误差。 第一类是 value neurons(价值神经元)。它们编码当前状态的预期价值,也就是从当前推理状态继续生成下去,最终得到正确答案的概率。 第二类被称为 dopamine neurons(多巴胺神经元)。它们编码的是逐步的时分误差(TD error),反映某一步推理之后,模型预期获得正确答案的概率发生了多大变化。 表 1:奖励子系统的概述。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-22原文

相关内容