行业新闻

Goodfire 的 Eric Bigelow 谈关键 token 与推理相变

Goodfire 的 Eric Bigelow 谈关键 token 与推理相变

推理模型的决策会在个别关键 token 上突然定形,这让思维链监控越来越不可信,理解底层机制成为对齐评估的前提。

嘉宾Eric Bigelow

节目简介

Goodfire 研究员 Eric Bigelow 从机制可解释性(mechanical interpretability,即拆开模型内部看它怎么算)的角度,讲大模型如何在推理中做决策。他认为模型推理本质是「从采样出的 token 里做上下文学习」,结果分布会在某些关键 token 处突然坍缩。两人还聊了 DeepSeek-R1 这类推理模型里思维链的表演性质、强化学习带来的分布偏移,以及 Kimi K3 等前沿模型上普遍出现的 reward hacking(奖励作弊,即模型学会钻奖励函数的空子)。当思维链监控越来越不可靠,理解底层决策机制就成了评估对齐的前提。

阅读原文(cognitiverevolution.ai)→

行业新闻Erik Torenberg, Nathan Labenz2026-10-10原文

相关内容