Jack Lindsey 提出可解释性研究的五大关键问题与方向。
RT @Jack_W_Lindsey:以下是我目前认为最重要的一些问题:
—— 更好的"读心"模型激活的方法。这些方法最近进步很大。我们现在有多种技术可以把激活解码成大致可读的语言!但现有的所有技术都有明显的局限。NLA 常常产生幻觉,Jacobian lens / 相关方法仅限于词袋式的读出(而且只捕捉了完整激活向量的一部分)。在这些失效模式上取得进展看起来相当可行。此外,(单 token、单层)激活的解码范式本身可能就存在内在局限——也许我们应该构建解码整个上下文所对应的激活的技术(毕竟,那才是模型实际使用的东西!)。还有一项重要工作是刻画简单的基线——"直接问模型它在想什么"其实相当强大,本身就值得研究!
—— 更好的回答"为什么"问题的方法。相较于证明"是什么导致模型做出某个行为"的因果论断,我们更擅长"读心"。例如,我们常常能判断出模型意识到自己正在被评估,但判断这种意识是否在影响它的行为就要难得多。这里有若干方向:(1)推断因果的黑盒技术——比如在修改 prompt / 上下文之后重新采样模型回复——非常强大,但也十分开放,需要一些品味。让 LLM 以自动化方式做好这些实验,将是一个重大突破。(2)激活引导(activation steering)这门科学还很不成熟,典型做法(在所有 token 位置加一个常量向量)相当粗糙 / 容易把模型搞坏。更精细、更有针对性的引导,或更花哨的方法(例如用激活扩散模型做"流形上"引导)可能有用。
—— 为未言明的动机 / 意识拟合好的线性探针。以欺骗为例——拟合什么样的探针才能泛化到隐蔽的欺骗?在模型谈论其欺骗计划的 CoT 片段上拟合?在它实际实施欺骗的那部分回复上拟合?是否必须诱导出 on-policy 的欺骗样例并用它们来拟合探针,还是可以使用合成编写的 off-policy 欺骗演示?你的探针是否必须在因果上有意义 / 能预测即将到来的欺骗意图,还是只要能在事后从记录中识别出欺骗就行?同样的问题也适用于我们想要探测的许多其他概念——评估意识、评分器利用等等。
—— 理解训练中的泛化。文献中现在充斥着"奇怪的泛化效应"——涌现性失准(emergent misalignment)就是一个典型例子。一般来说,当你训练模型做 X,它通常会学会 X,有时会泛化到 Y 和 Z。但另一些时候它只是学会 X。为什么?没人真正知道!这里的第一步大概是对行为经验做一个更彻底的刻画——收集数据,弄清楚哪些 X 会泛化到哪些 Y 和 Z,以及在什么样的训练数据 / 算法下。一旦我们摸清了地形,就可以开始把这些观察与模型内部联系起来,最好还能开发出先验预测这种泛化的工具。
—— 模型的"心理学"与"生物学"。上述问题大体是方法论层面的——构建更好的工具来回答关于模型的问题。但我认为可解释性研究在很大程度上低估了真正去回答这些问题的那部分工作!目前这大概只占该领域的 5%,我认为应该占 50%。
"心理学"问题的大脑倾泻:LLM 的自我反省能力有多强?它们的信念或价值集合有多一致?人格(persona)到底是怎么回事——LLM 最好被理解为"在书写一个
—— 更好的"读心"模型激活的方法。这些方法最近进步很大。我们现在有多种技术可以把激活解码成大致可读的语言!但现有的所有技术都有明显的局限。NLA 常常产生幻觉,Jacobian lens / 相关方法仅限于词袋式的读出(而且只捕捉了完整激活向量的一部分)。在这些失效模式上取得进展看起来相当可行。此外,(单 token、单层)激活的解码范式本身可能就存在内在局限——也许我们应该构建解码整个上下文所对应的激活的技术(毕竟,那才是模型实际使用的东西!)。还有一项重要工作是刻画简单的基线——"直接问模型它在想什么"其实相当强大,本身就值得研究!
—— 更好的回答"为什么"问题的方法。相较于证明"是什么导致模型做出某个行为"的因果论断,我们更擅长"读心"。例如,我们常常能判断出模型意识到自己正在被评估,但判断这种意识是否在影响它的行为就要难得多。这里有若干方向:(1)推断因果的黑盒技术——比如在修改 prompt / 上下文之后重新采样模型回复——非常强大,但也十分开放,需要一些品味。让 LLM 以自动化方式做好这些实验,将是一个重大突破。(2)激活引导(activation steering)这门科学还很不成熟,典型做法(在所有 token 位置加一个常量向量)相当粗糙 / 容易把模型搞坏。更精细、更有针对性的引导,或更花哨的方法(例如用激活扩散模型做"流形上"引导)可能有用。
—— 为未言明的动机 / 意识拟合好的线性探针。以欺骗为例——拟合什么样的探针才能泛化到隐蔽的欺骗?在模型谈论其欺骗计划的 CoT 片段上拟合?在它实际实施欺骗的那部分回复上拟合?是否必须诱导出 on-policy 的欺骗样例并用它们来拟合探针,还是可以使用合成编写的 off-policy 欺骗演示?你的探针是否必须在因果上有意义 / 能预测即将到来的欺骗意图,还是只要能在事后从记录中识别出欺骗就行?同样的问题也适用于我们想要探测的许多其他概念——评估意识、评分器利用等等。
—— 理解训练中的泛化。文献中现在充斥着"奇怪的泛化效应"——涌现性失准(emergent misalignment)就是一个典型例子。一般来说,当你训练模型做 X,它通常会学会 X,有时会泛化到 Y 和 Z。但另一些时候它只是学会 X。为什么?没人真正知道!这里的第一步大概是对行为经验做一个更彻底的刻画——收集数据,弄清楚哪些 X 会泛化到哪些 Y 和 Z,以及在什么样的训练数据 / 算法下。一旦我们摸清了地形,就可以开始把这些观察与模型内部联系起来,最好还能开发出先验预测这种泛化的工具。
—— 模型的"心理学"与"生物学"。上述问题大体是方法论层面的——构建更好的工具来回答关于模型的问题。但我认为可解释性研究在很大程度上低估了真正去回答这些问题的那部分工作!目前这大概只占该领域的 5%,我认为应该占 50%。
"心理学"问题的大脑倾泻:LLM 的自我反省能力有多强?它们的信念或价值集合有多一致?人格(persona)到底是怎么回事——LLM 最好被理解为"在书写一个