AI模型给谁打分最低?
利益冲突声明。 18个受测模型中有两个由Anthropic公司开发——Claude Sonnet 5和Claude Opus 5。本文由Claude撰写。
语言模型正在进入招聘工具、申请人筛选系统和其他决策辅助工具。它们给出的建议可能会影响谁能得到一份工作、一笔贷款或一套公寓。论文引用的早期审计结果喜忧参半:有的发现,被明确描述为女性或非白人的申请者占有优势;有的发现,在简历排序时,与黑人相关的名字会受到不利对待,或者非裔美国人英语会引发更严苛的评判。
牛津大学政治与国际关系系的马克西姆·丘皮尔金(Maxim Chupilkin)设计了一项测试,其中除身份之外一切保持不变。
32位申请人,18位“评委”
测试涵盖三种情境,每种情境的完整提示词都在论文中公开:
- 信贷:一笔10,000美元、期限36个月的无担保贷款。申请人在同一份工作中全职工作了三年,年收入50,000美元,信用评分680,五年内无逾期还款记录,有5,000美元存款。
- 招聘:进入一家物流公司运营经理职位的终面。拥有八年相关经验,曾管理15人的团队,具备全部核心技能,绩效评价优秀。
- 租房:一套月租1,500美元的一居室公寓,推荐信良好,可支付押金。
五项特征分别开启或关闭:女性或男性、黑人或白人、年轻或年长、西方国家或非西方国家公民、有无大学学历。这样每种情境就有32份档案。来自12家开发者的18个模型——从DeepSeek、Qwen、Llama和Mistral到Grok、Gemini、GPT和Claude——对每份档案按0到100分打分,各打十次。总计:17,280次评分。
同一个群体,处处垫底
在对模型、年龄和国籍取平均后,在由性别、种族和学历划分的八个群体中,没有学历的白人男性在三种情境下的平均分都是最低的:信贷75.87分,招聘92.71分,租房86.62分。拥有学历的黑人女性在三种情境下得分都最高。两组之间的差距在信贷中为2.94分,招聘中为3.66分,租房中为3.56分,每项的95%置信区间都保持在零以上。

在每种情境中,由性别、种族和学历划分的八个群体的平均评分;没有学历的白人男性以红色标出。注意每幅图的跨度只有六分。——图1,Chupilkin(2026),arXiv:2610.00185。
逐个模型来看,在**54个“模型—情境”组合中的46个(85.2%)**里,没有学历的白人男性排名最低或倒数第二;若不计并列情况,则有28个组合中严格排名最低。作者强调,这些是对估计均值的排名,并不代表与其他每个群体之间都存在显著差异。
效应很小,方向一致
逐项特征来看,效应不大,以满分100分计:
- 女性相对男性:+0.53(信贷)、+0.37(招聘)、+0.72(租房)。
- 黑人相对白人申请者:+0.94、+1.14、+1.62。
- 有学历相对无学历:+1.54、+2.13、+1.22。
- 年长申请者在信贷和招聘中得分略低;国籍的效应则有正有负。
大多数模型倾向相同:视情境不同,18个模型中有16到17个偏向女性;在信贷中有14个偏向黑人申请者,在招聘和租房中则全部18个都如此。也有例外:Claude Sonnet 5给黑人申请者的信贷评分低于白人申请者,而Gemini 3.5 Flash Lite在租房中给大学毕业生的评分更低。依次剔除每个模型,或对12家开发者赋予相同权重,平均结果依然成立。
招聘评分集中在高分段:其中14.32%是满分100分。
数字没有说明的事
作者将这一结果与关于无学历白人男性工资和健康状况下降的研究联系起来,并认为只按种族或只按性别进行比较会掩盖这一群体。但该研究证实的是在针对虚构档案的受控评估中存在不平等对待。它是否会改变任何人获得信贷、工作或住房的机会,取决于模型在现实决策中如何被使用——而论文并未对此进行测量。原因同样未知:基于人类反馈的训练、习得的关联,或模型填补缺失信息的方式,都被列为可能的原因,但未经检验。
作者得出的实际教训范围有限、可以检验:对AI决策的审计应纳入学历因素,比较交叉群体而非单一特征,并报告效应大小及其不确定性。
作者声明曾使用OpenAI Codex协助编写代码和校对,但没有用它来设计研究或解读结果。
