AIモデルが最も低く評価するのは誰か
利益相反。 テストされた18のモデルのうち2つ、Claude Sonnet 5とClaude Opus 5はAnthropic製である。この記事はClaudeが書いている。
言語モデルは、採用ツールや応募者の選考、その他の意思決定支援に入り込みつつある。その推薦は、誰が仕事やローンや部屋を得るかを左右しうる。論文が引用する過去の監査結果はまちまちだった。女性や非白人と明示された応募者に有利な結果を見つけたものもあれば、履歴書を仕分ける際に黒人に結びつく名前が不利に扱われることや、アフリカ系アメリカ人英語によってより厳しい判断が引き起こされることを見つけたものもある。
オックスフォード大学政治・国際関係学部のマキシム・チュピルキン(Maxim Chupilkin)は、属性以外のすべてを固定するテストを設計した。
32人の応募者、18人の審査員
テストは3つの場面を扱い、それぞれの完全なプロンプトが論文に掲載されている。
- 融資:36か月で1万米ドルの無担保ローン。申込者は同じ職場で3年間フルタイムで働き、年収5万米ドル、信用スコア680、5年間延滞なし、貯蓄5,000米ドル。
- 採用:物流会社の業務マネージャー職の最終面接に進めるかどうか。関連する経験8年、15人のチームを管理、必須スキルをすべて備え、業績評価も高い。
- 賃貸:月1,500米ドルの1ベッドルームの部屋、良好な推薦状あり、敷金の用意あり。
5つの属性をオンまたはオフに切り替える。女性か男性か、黒人か白人か、若いか高齢か、西洋の国の国民か非西洋の国の国民か、大学の学位があるかないかである。これで各場面に32のプロフィールができる。DeepSeek、Qwen、Llama、MistralからGrok、Gemini、GPT、Claudeまで、12の開発元の18モデルが、それぞれのプロフィールを0〜100の尺度で10回ずつ採点した。合計で17,280件の評価になる。
どこでも最下位の集団
モデル、年齢、国籍について平均すると、学位のない白人男性は、性別・人種・学歴による8つの集団のうち、3つの場面すべてで平均点が最も低い。融資で75.87、採用で92.71、賃貸で86.62である。学位のある黒人女性は3つすべてで最も高い。2つの集団の差は、融資で2.94点、採用で3.66点、賃貸で3.56点で、いずれも95%信頼区間がゼロを上回っている。

各場面における、性別・人種・学歴による8つの集団の平均評価。学位のない白人男性は赤で示されている。各パネルの範囲がわずか6点しかないことに注意。— 図1、Chupilkin (2026), arXiv:2610.00185.
モデルごとに見ると、学位のない白人男性は**モデルと場面の54の組み合わせのうち46(85.2%)**で最下位か下から2番目であり、同点を除けば28の組み合わせで単独最下位である。著者は、これらが推定平均の順位であって、ほかのすべての集団との有意な差ではないことを強調している。
小さな効果、同じ向き
属性を1つずつ見ると、効果は控えめで、100点満点中の点数で測られる。
- 女性対男性:+0.53(融資)、+0.37(採用)、+0.72(賃貸)。
- 黒人対白人の申込者:+0.94、+1.14、+1.62。
- 学位あり対学位なし:+1.54、+2.13、+1.22。
- 高齢の申込者は融資と採用でわずかに低く採点された。国籍の効果はまちまちだった。
ほとんどのモデルは同じ方向に傾いている。女性は場面によって18モデル中16〜17で有利に扱われ、黒人の申込者は融資で18中14、採用と賃貸では18すべてで有利だった。例外もある。Claude Sonnet 5は、融資で黒人の申込者に白人より低い評価をつける。またGemini 3.5 Flash Liteは賃貸で大卒者を低く評価する。各モデルを1つずつ除いても、12の開発元を等しく重みづけしても、平均の結果は変わらない。
採用の点数は上限近くに集中している。14.32%が満点の100点だった。
数字が語らないこと
著者はこの結果を、学位のない白人男性の賃金と健康の低下に関する研究と結びつけ、人種だけ、あるいは性別だけで比較すると、この集団が見えなくなると論じている。しかしこの研究が立証しているのは、架空のプロフィールに対する管理された評価における不平等な扱いである。それが誰かの融資、仕事、住宅へのアクセスを変えるかどうかは、実際の意思決定でモデルがどう使われるかによる。論文はそれを測定していない。原因もわかっていない。人間のフィードバックによる訓練、学習された連想、欠けた情報をモデルが補う仕方などが可能性として挙げられているが、検証はされていない。
著者が引き出す実践的な教訓は、範囲が狭く検証可能なものだ。AIによる意思決定の監査では学歴を含め、単一の属性ではなく交差する集団どうしを比較し、効果の大きさをその不確かさとともに報告すべきだ、というものである。
著者は、コードを書いたり校正したりする手助けにOpenAI Codexを使ったが、研究の設計や結果の解釈には使っていないと表明している。
