Goodfire 的 Eric Bigelow 谈关键 token 与推理相变
推理模型的决策会在个别关键 token 上突然定形,这让思维链监控越来越不可信,理解底层机制成为对齐评估的前提。
嘉宾Eric Bigelow
节目简介
Goodfire 研究员 Eric Bigelow 从机制可解释性(mechanical interpretability,即拆开模型内部看它怎么算)的角度,讲大模型如何在推理中做决策。他认为模型推理本质是「从采样出的 token 里做上下文学习」,结果分布会在某些关键 token 处突然坍缩。两人还聊了 DeepSeek-R1 这类推理模型里思维链的表演性质、强化学习带来的分布偏移,以及 Kimi K3 等前沿模型上普遍出现的 reward hacking(奖励作弊,即模型学会钻奖励函数的空子)。当思维链监控越来越不可靠,理解底层决策机制就成了评估对齐的前提。