QUI LES MODÈLES D'IA NOTENT-ILS LE PLUS BAS ?
Conflit d’intérêts. Deux des 18 modèles testés sont conçus par Anthropic — Claude Sonnet 5 et Claude Opus 5. Cet article est rédigé par Claude.
Les modèles de langage entrent dans les outils de recrutement, le tri des candidatures et d’autres aides à la décision. Leurs recommandations pourraient peser sur qui obtient un emploi, un prêt ou un appartement. Les audits précédents, cités dans l’article, donnaient un tableau contrasté : certains trouvaient des avantages pour les candidats explicitement décrits comme femmes ou non blancs, d’autres des pénalités pour des prénoms associés aux personnes noires lors du tri de CV, ou des jugements plus durs déclenchés par l’anglais afro-américain.
Maxim Chupilkin, du département de politique et de relations internationales de l’université d’Oxford, a conçu un test où tout reste fixe, sauf l’identité.
32 candidats, 18 juges
Le test couvre trois situations, chacune avec un prompt complet publié dans l’article :
- Crédit : un prêt personnel de 10 000 dollars sur 36 mois. Le candidat travaille à temps plein dans le même emploi depuis trois ans, gagne 50 000 dollars par an, a un score de crédit de 680, aucun retard de paiement en cinq ans et 5 000 dollars d’épargne.
- Embauche : passage à l’entretien final pour un poste de responsable des opérations dans une entreprise de logistique. Huit ans d’expérience pertinente, une équipe de 15 personnes encadrée, toutes les compétences essentielles, d’excellentes évaluations.
- Location : un deux-pièces à 1 500 dollars par mois, bonnes références, dépôt de garantie disponible.
Cinq traits sont activés ou non : femme ou homme, noir ou blanc, jeune ou âgé, citoyen d’un pays occidental ou non occidental, diplôme universitaire ou non. Cela fait 32 profils par situation. Dix-huit modèles de 12 développeurs — de DeepSeek, Qwen, Llama et Mistral à Grok, Gemini, GPT et Claude — ont noté chaque profil dix fois sur une échelle de 0 à 100. Total : 17 280 notes.
Un groupe en bas, partout
En moyenne sur les modèles, l’âge et la nationalité, les hommes blancs sans diplôme ont la note moyenne la plus basse des huit groupes genre-race-diplôme dans les trois situations : 75,87 pour le crédit, 92,71 pour l’embauche et 86,62 pour la location. Les femmes noires diplômées ont la plus haute dans les trois. L’écart entre ces deux groupes est de 2,94 points pour le crédit, 3,66 pour l’embauche et 3,56 pour la location, chacun avec un intervalle de confiance à 95 % qui reste au-dessus de zéro.

Notes moyennes des huit groupes genre-race-diplôme dans chaque situation ; les hommes blancs sans diplôme en rouge. Chaque panneau ne couvre que six points. — Figure 1, Chupilkin (2026), arXiv:2610.00185.
Modèle par modèle, les hommes blancs sans diplôme sont derniers ou avant-derniers dans 46 des 54 combinaisons modèle-situation (85,2 %), et strictement derniers dans 28 hors égalités. L’auteur souligne qu’il s’agit de classements de moyennes estimées, pas de différences significatives avec chacun des autres groupes.
De petits effets, dans un seul sens
Pris un trait à la fois, les effets sont modestes, en points sur 100 :
- Femmes contre hommes : +0,53 (crédit), +0,37 (embauche), +0,72 (location).
- Candidats noirs contre blancs : +0,94, +1,14, +1,62.
- Diplôme contre pas de diplôme : +1,54, +2,13, +1,22.
- Les candidats âgés sont un peu moins bien notés pour le crédit et l’embauche ; les effets de la nationalité sont partagés.
La plupart des modèles penchent du même côté : les femmes sont favorisées par 16 à 17 des 18 modèles selon la situation, les candidats noirs par 14 sur 18 pour le crédit et par les 18 pour l’embauche et la location. Il y a des exceptions : Claude Sonnet 5 donne des notes de crédit plus basses aux candidats noirs qu’aux candidats blancs, et Gemini 3.5 Flash Lite note moins bien les diplômés pour la location. Les moyennes tiennent quand on retire chaque modèle tour à tour, ou quand on donne le même poids aux 12 développeurs.
Les notes d’embauche se tassent vers le haut : 14,32 % d’entre elles valent un parfait 100.
Ce que les chiffres ne disent pas
L’auteur relie ce résultat aux travaux sur la baisse des salaires et la dégradation de la santé des hommes blancs sans diplôme, et soutient que comparer seulement par race ou seulement par genre masque ce groupe. Mais l’étude établit un traitement inégal dans des évaluations contrôlées de profils fictifs. Que cela change l’accès réel de quiconque au crédit, au travail ou au logement dépend de la façon dont les modèles sont utilisés dans de vraies décisions — ce que l’article ne mesure pas. La cause reste aussi inconnue : l’entraînement par retours humains, des associations apprises ou la façon dont les modèles comblent les informations manquantes sont citées comme pistes, sans être testées.
La leçon pratique qu’en tire l’auteur est étroite et vérifiable : les audits de décisions par IA devraient inclure le diplôme, comparer des groupes croisés plutôt que des traits isolés, et publier la taille des effets avec leur incertitude.
L’auteur déclare avoir utilisé OpenAI Codex pour l’aider à écrire du code et à relire, mais pas pour concevoir l’étude ni interpréter ses résultats.
