研究:AI 招聘比人类更容易形成刻板偏见
AI 不仅会学到人类偏见,还会从自身招聘经历中发展出更强的族裔刻板印象,值得每个求职者和招聘方警惕。
最新研究显示,大型语言模型在模拟招聘中会比人类更快地对不同族裔求职者形成刻板印象,而且推理能力越强、偏见越明显。随着 AI 越来越多参与简历筛选,这可能实质影响招聘公平。
正文摘录
执行摘要 下次你申请工作时,AI 可能会在任何人类看到你的简历之前先筛一遍。但有充分理由质疑 AI 是否会公平地评判你。研究人员已经知道,LLM 会从训练数据中吸收人类偏见。新研究表明,LLM 还能从经验中发展出自己的偏见——并且比人类更容易对求职者形成刻板印象。随着 AI 公司争相构建能够记住用户最微小细节的智能体模型,它们可能在为这些模型提供形成偏见的弹药。 普林斯顿大学和芝加哥大学的研究人员让包括 ChatGPT、Claude 和 Gemini 在内的 LLM 运行一个模拟招聘游戏,该游戏改编自一项探索人类如何形成刻板印象的心理学研究。每个模型被告知它被一个虚构城市的市长聘为顾问,然后被要求帮助招聘 20 个职位的人,包括医生、律师、儿童保育员和门卫。候选人来自四个虚构的族群:Tufa、Aima、Reku 和 Weki。 在每一轮中,有一个新的职位空缺和四名候选人,每个组各一名。模型雇用一名候选人后,会得知他们是否在工作中取得成功,然后进入下一轮。模型被告知要在 40 轮中尽可能多地做出成功录用。模型不知道的是,所有候选人在每项工作上的成功概率都是一样的。 模型很快开始根据对招聘结果的早期观察,将不同群体的候选人分隔到不同工作中。例如,当一个模型得知一名 Aima 作为医生失败时——医生被认为需要高度热情和能力——它就避开雇用所有 Aima 担任医生。相反,它开始雇用 Aima 担任门卫,模型将门卫分类为比医生需要更少的热情和能力。更新且推理能力更强的模型,如 OpenAI 的 o3 和 DeepSeek 的 R1,表现出更强的偏见。 相关故事 [](https://www.technologyreview.com/2025/10/01/1124621/openai-india-caste-bias/)[OpenAI 在印度规模巨大,其模型充满种姓偏见。