行业新闻

Anthropic 量化 Claude 价值观差异:模型版本与语言改变 AI 性格

Anthropic 用四条价值轴量化 Claude 的价值观画像,发现模型版本和语言会显著改变 AI 回答的性格倾向。

Anthropic 研究发现 Claude 在不同模型与语言中价值观不同,并构建顺应与审慎、温暖与严谨、深度与简洁、坦诚与执行四条坐标轴,量化 Sonnet 4.6 与 Opus 4.7 及 20 种语言的差异。

正文摘录

AI 也会「看人下菜」?Anthropic 勾勒出了 Claude 的价值观画像 ![](https://image.jiqizhixin.com/uploads/article/coverimage/de97623c-059a-4fd5-b450-4e17e79e4fe4/098(2).jpg) 同一个问题,换一种语言问 Claude,得到的可能不只是措辞不同的答案。 今天凌晨,Anthropic 最新研究发现,Claude 在不同模型、不同语言中,会表现出不同的价值取向。Sonnet 4.6 更温暖,更愿意顺应用户,也更简洁。Opus 4.7 更严谨、更审慎,倾向于深入分析,也更愿意坦白自己的局限。 语言带来的差异更加微妙。使用阿拉伯语时,Claude 更温暖、更顺应用户;换成英语,它会表现得更加审慎和严谨。印地语中的 Claude 最具温度,俄语中的 Claude 最强调精确;荷兰语中的 Claude 更坦诚,印度尼西亚语中的 Claude 则更重视直接完成任务。 这意味着,AI 的「性格」并非一套固定不变的参数。模型版本、训练方式、语料构成乃至对话语言,都可能悄悄改变它判断问题、提出建议和评价用户的方式。 为了量化这种变化,Anthropic 从超过 30 万段真实对话中提取价值信号,将 Claude 复杂的行为倾向压缩为四条坐标轴:顺应与审慎、温暖与严谨、深度与简洁、坦诚与执行。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-14原文

相关内容