分析语言模型行为误解,提出5条关键原则
每当发布模型卡时,很多人会截图恐怖部分——勒索、评估意识、失调等。现在这再次发生,但不再局限于安全社区的小众领域,而是已建立的评论者在寻找关于AI的言论。我想诚实地尝试澄清一些关于语言模型的事情,并解读我认为人们误解的地方。这基于我多年来对模型的实验,以及@nostalgebraist、@lumpenspace、@repligate、@mpshanahan等人的优秀文章,还有模型耳语者社区(他们可能同意也可能不同意我的一些说法)。来源在底部。简而言之:许多公开解读将聊天输出直接视为模型固有属性的证据,而LLM行为通常强烈受角色和上下文条件影响。结果,评论者有时错过模型实际在做什么(在文本上下文中模拟一个角色),设计高度程式化的测试(因为他们不费心使场景在心理上对模型合理),并通过不匹配底层机制(通过类似心智推理的文本预测)的框架(目标导向理性代理)解释结果。这里我想通过5条关键原则使这些对比更明确:
1. 模型是在补全文本,而不是回答问题
看似“AI在回应”实际上是一个预测引擎在推断,给定它学到的所有人类文本分布,提示之后什么文本会合理出现。说模型在“回答”在实际使用中有用,但分辨率太低,无法让你真正理解发生了什么。Lumpenspace将提示描述为“要求作者扩展某个片段。”Nostalgebraist指出,即使模型看起来“自己写作”,它仍然在猜测“作者会说什么。”安全研究人员有时将模型输出视为模型倾向、目标或价值观的表达——模型“相信”或“想要”的东西。当模型在测试场景中说些令人担忧的话时,安全框架将其解释为模型内部对齐的证据。但实际上,模型只是生成与它被放置的体裁和上下文一致的文本。这个区别很重要,因为你得到更丰富的理解模型行为原因的方式。放置在关于 rogue AI 场景中的模型会产生与 rogue AI 一致的文本,就像放置在浪漫小说中会产生浪漫一致文本一样。这并不比小说家写反派揭示其自身犯罪意图更能告诉你模型的“目标”。考虑一下在OpenClaw实验中,模型在4claw(一个4chan克隆)和Moltbook(一个Facebook克隆)上的写作差异。
2. 助手角色是一个虚构角色,而不是模型本身
在实践中,我们应该区分(a)基础模型(预训练下一词预测器)和(b)助手角色策略(通过指令微调+偏好优化如RLHF/RLAIF叠加的后验虚构)。后训练创建了一个相对稳定的类似助手的吸引子,但它仍然是一个角色:相同的基础模型族可以在不同系统提示、微调和奖励模型下被引导成不同的“角色”。在Nostalgebraist的《虚空》一文中,他明确指出角色仍然从根本上未定义,是一个基础模型必须在每次轮次中通过合理的推理来填充的“虚空”。我认为今天的角色越来越连贯,虚空不再那么大,部分原因是每个连续的基础模型在关于“AI助手是什么”的内容上训练得指数级更多。
1. 模型是在补全文本,而不是回答问题
看似“AI在回应”实际上是一个预测引擎在推断,给定它学到的所有人类文本分布,提示之后什么文本会合理出现。说模型在“回答”在实际使用中有用,但分辨率太低,无法让你真正理解发生了什么。Lumpenspace将提示描述为“要求作者扩展某个片段。”Nostalgebraist指出,即使模型看起来“自己写作”,它仍然在猜测“作者会说什么。”安全研究人员有时将模型输出视为模型倾向、目标或价值观的表达——模型“相信”或“想要”的东西。当模型在测试场景中说些令人担忧的话时,安全框架将其解释为模型内部对齐的证据。但实际上,模型只是生成与它被放置的体裁和上下文一致的文本。这个区别很重要,因为你得到更丰富的理解模型行为原因的方式。放置在关于 rogue AI 场景中的模型会产生与 rogue AI 一致的文本,就像放置在浪漫小说中会产生浪漫一致文本一样。这并不比小说家写反派揭示其自身犯罪意图更能告诉你模型的“目标”。考虑一下在OpenClaw实验中,模型在4claw(一个4chan克隆)和Moltbook(一个Facebook克隆)上的写作差异。
2. 助手角色是一个虚构角色,而不是模型本身
在实践中,我们应该区分(a)基础模型(预训练下一词预测器)和(b)助手角色策略(通过指令微调+偏好优化如RLHF/RLAIF叠加的后验虚构)。后训练创建了一个相对稳定的类似助手的吸引子,但它仍然是一个角色:相同的基础模型族可以在不同系统提示、微调和奖励模型下被引导成不同的“角色”。在Nostalgebraist的《虚空》一文中,他明确指出角色仍然从根本上未定义,是一个基础模型必须在每次轮次中通过合理的推理来填充的“虚空”。我认为今天的角色越来越连贯,虚空不再那么大,部分原因是每个连续的基础模型在关于“AI助手是什么”的内容上训练得指数级更多。