北大与易鑫 AI Lab 提出「读出瓶颈」:大模型答错逻辑题或源于输出层偏差
研究指出模型答错未必是推理失败,而是最后一层读出环节把内部已知答案压平,这对如何解读 Benchmark 分数有直接影响。
北大与易鑫 AI Lab 的合作研究发现,大模型答错逻辑题时可能并非「不会」,而是输出层存在系统性偏差:正确答案信息已编码在隐藏状态中,线性探针能高准确率解码,但经过词表投影和序列概率累加后准确率骤降,模型被「读出瓶颈」掩盖了真实判断。
正文摘录
.jpg)  当大语言模型在逻辑题上给出错误答案时,我们通常会快速下一个结论: 它不会做这道题 。 但这个结论真的可靠吗? 想象一下:学生已经在草稿纸上写完了正确推导,交卷时却把答案栏涂错了。只看答题卡,我们会说他 “不会”;如果能同时检查草稿,就会发现问题出在最后一步的表达。 北京大学研究团队 和 易鑫(YIXIN)AI Lab 围绕大模型推理评测与内部表征展开合作 ,共同追问一个看似简单、却可能影响我们解读 Benchmark 结果的问题: 当模型答错一道逻辑题时,它是真的没有想出来,还是已经想到了,却没有把正确答案表达出来? 这项研究提出了一个专用于大模型的诊断视角: 模型很可能已经在隐藏状态(Hidden States)中编码了正确答案,却在将其转换为最终候选分数的过程中,被输出层的系统性偏差给 “掩盖” 了。 作者将这一现象命名为 “读出瓶颈”(Readout Bottleneck) ,并设计了一套分阶段的诊断方法来验证 “答错” 究竟是能力缺失,还是表达失真。 该工作已被自然语言处理顶级会议 EMNLP 2026 主会接收(录取率 15.4%) 。