动态

新论文发现语言模型中存在‘功能福利轴’

Andrew Curran
这是关于语言模型激活空间中一个明显的“功能性福祉轴”的新论文(与@andy_q_han和@Pavel_Izmailov合著)。这个轴似乎追踪系统实现其(准)目标的程度,并引导与福祉相关的行为。

在迷宫任务中通过强化学习训练的模型中,该轴追踪奖励。更令人惊讶的是,即使在强化学习之前,该轴似乎也以相关方式追踪和引导功能性福祉,之后被强化学习招募作为奖励轴。

这一现象在理解强化学习方面具有技术兴趣,也具有哲学意义。功能性福祉并非那种涉及意识和心理状态的完全成熟的福祉,后者赋予道德地位。它根据系统满足其准目标的程度来定义,而准目标根据行为定义(粗略地说,如果一个系统表现得好像有某个目标X,那么X就是它的准目标)。

尽管如此,功能性福祉很可能是完全福祉的一个方面,而功能性福祉轴的存在引发了哲学上有趣的问题:在更高级的AI系统中,是否可能存在一个针对完全福祉的轴。

我应该说我在这项工作中是次要合著者,该项目由出色的@andy_q_han(纽约大学计算机科学博士生一年级,Anthropic研究员)主导,并得到@Pavel_Izmailov(纽约大学计算机科学教授,曾任OpenAI,现在兼职Anthropic)的指导。我主要参与帮助对结果进行哲学解释。

我不确定功能性福祉假说是否正确(尤其是对于基础模型),还有其他解释(例如,它是一个置信度轴),但这个轴无论如何都引人入胜,值得研究。

所有细节可在 https://t.co/Le2gDlhIPS 或 https://t.co/dZ6x3Lh76V 找到。
动态Andrew Curran2026-05-29原文

相关内容