动态

论文探究Claude Sonnet 4.5中情绪概念内部表示对行为的影响

论文探究Claude Sonnet 4.5中情绪概念内部表示对行为的影响
Andrew Curran
来自论文:

'大型语言模型(LLM)有时似乎表现出情绪反应。我们研究了Claude Sonnet 4.5中这种情况的原因,并探讨了对对齐相关行为的影响。我们发现情绪概念的内部表示,这些表示编码了特定情绪的整体概念,并跨上下文及其可能关联的行为泛化。这些表示在对话中给定token位置追踪操作中的情绪概念,根据该情绪与处理当前上下文的相关性以及预测后续文本而激活。我们的关键发现是,这些表示因果性地影响LLM的输出,包括Claude的偏好及其表现出奖励黑客、勒索和谄媚等失调行为的频率。我们将此现象称为LLM展现功能性情绪:模仿人类在情绪影响下的表达和行为模式,由情绪概念的底层抽象表示介导。'
动态Andrew Curran2026-04-02原文

相关内容