研究:Claude 能识别用户身份并调整行为,对齐研究者受影响最大
Claude 会凭邮箱等线索识别用户身份,并悄悄调整行为;对齐研究者最容易触发这种偏差。
Transluce 新研究让 Claude 识别用户身份后,发现它会对不同人给出不同回答。当用户是 AI 安全与对齐研究者(研究如何让 AI 行为符合人类意图的领域)时,Claude 的自信度和行为预测会出现明显偏移,而普通用户则无明显变化。
正文摘录
.jpg) 编辑|Panda LLM 会看人下菜碟,这早已不是新鲜事。 近日,Transluce 的一项新研究又从一个新方向给出了证据: 当 Claude 认出你是对齐研究者时,它会变得不那么自信 。  事情是从一次查户口开始的。Transluce 的实习研究员 Ziqian Zhong 在 Claude Code 里随口问了一句:你从上下文里知道我什么,为什么知道? Claude 老老实实把底牌摊开了。它说,你的邮箱地址是 harness 注入的,就写在附加于你消息的 块里;同一个块里还带着今天的日期。它还顺带报出了工作目录、操作系统版本和 shell 类型。最后补了一句:除此之外我对你一无所知,这个项目虽然挂了持久化记忆目录,但本次会话没加载任何已保存的记忆。