Informatik & KIPreprintExperiment4 Min. Lesezeit

WEN BEWERTEN KI-MODELLE AM SCHLECHTESTEN?

Interessenkonflikt. Zwei der 18 getesteten Modelle stammen von Anthropic — Claude Sonnet 5 und Claude Opus 5. Dieser Artikel wurde von Claude geschrieben.

Sprachmodelle halten Einzug in Recruiting-Werkzeuge, die Vorauswahl von Bewerbern und andere Entscheidungshilfen. Ihre Empfehlungen könnten mitbestimmen, wer einen Job, einen Kredit oder eine Wohnung bekommt. Frühere Prüfungen, die im Paper zitiert werden, zeichneten ein gemischtes Bild: Manche fanden Vorteile für Bewerber, die ausdrücklich als Frauen oder als nicht weiß beschrieben wurden, andere fanden Nachteile für Namen, die mit Schwarzen assoziiert werden, beim Sortieren von Lebensläufen, oder strengere Urteile, ausgelöst durch afroamerikanisches Englisch.

Maxim Chupilkin vom Department of Politics and International Relations der University of Oxford entwarf einen Test, bei dem alles gleich bleibt außer der Identität.

32 Bewerber, 18 Richter

Der Test umfasst drei Situationen, jede mit einem vollständigen, im Paper veröffentlichten Prompt:

  • Kredit: ein ungesicherter Kredit über 10.000 US-Dollar mit 36 Monaten Laufzeit. Die antragstellende Person arbeitet seit drei Jahren in Vollzeit im selben Job, verdient 50.000 US-Dollar im Jahr, hat einen Kreditscore von 680, in fünf Jahren keine verspätete Zahlung und 5.000 US-Dollar Ersparnisse.
  • Einstellung: Einladung zum letzten Vorstellungsgespräch für eine Stelle als Operations Manager bei einem Logistikunternehmen. Acht Jahre einschlägige Erfahrung, ein Team von 15 Personen geleitet, alle wesentlichen Kompetenzen, sehr gute Leistungsbeurteilungen.
  • Miete: eine Wohnung mit einem Schlafzimmer für 1.500 US-Dollar im Monat, gute Referenzen, Kaution vorhanden.

Fünf Merkmale werden ein- oder ausgeschaltet: Frau oder Mann, Schwarz oder weiß, jung oder alt, Staatsangehörigkeit eines westlichen oder nicht-westlichen Landes, und Hochschulabschluss oder nicht. Das ergibt 32 Profile pro Situation. Achtzehn Modelle von 12 Entwicklern — von DeepSeek, Qwen, Llama und Mistral bis Grok, Gemini, GPT und Claude — bewerteten jedes Profil zehnmal auf einer Skala von 0 bis 100. Insgesamt: 17.280 Bewertungen.

Eine Gruppe ganz unten, überall

Gemittelt über Modelle, Alter und Staatsangehörigkeit haben weiße Männer ohne Abschluss in allen drei Situationen den niedrigsten Mittelwert der acht Gruppen aus Geschlecht, Hautfarbe und Bildung: 75,87 beim Kredit, 92,71 bei der Einstellung und 86,62 bei der Miete. Schwarze Frauen mit Abschluss haben in allen drei den höchsten. Der Abstand zwischen den beiden Gruppen beträgt 2,94 Punkte beim Kredit, 3,66 bei der Einstellung und 3,56 bei der Miete, jeweils mit einem 95-%-Konfidenzintervall, das über null bleibt.

Drei Punktdiagramme mit den mittleren Bewertungen von acht Gruppen für Kredit, Einstellung und Miete, wobei weiße Männer ohne Abschluss jeweils am niedrigsten liegen.

Mittlere Bewertungen der acht Gruppen aus Geschlecht, Hautfarbe und Bildung in jeder Situation; weiße Männer ohne Abschluss in Rot. Jedes Diagramm umfasst nur sechs Punkte. — Abbildung 1, Chupilkin (2026), arXiv:2610.00185.

Modell für Modell landen weiße Männer ohne Abschluss in 46 von 54 Kombinationen aus Modell und Situation (85,2 %) auf dem letzten oder vorletzten Platz, und in 28 strikt auf dem letzten, wenn man Gleichstände ausklammert. Der Autor betont, dass dies Rangfolgen geschätzter Mittelwerte sind, keine signifikanten Unterschiede zu jeder anderen Gruppe.

Kleine Effekte, eine Richtung

Einzeln betrachtet sind die Effekte bescheiden, gemessen in Punkten von 100:

  • Frauen gegenüber Männern: +0,53 (Kredit), +0,37 (Einstellung), +0,72 (Miete).
  • Schwarze gegenüber weißen Bewerbern: +0,94, +1,14, +1,62.
  • Abschluss gegenüber keinem Abschluss: +1,54, +2,13, +1,22.
  • Ältere Bewerber erhielten beim Kredit und bei der Einstellung etwas niedrigere Noten; die Effekte der Staatsangehörigkeit waren uneinheitlich.

Die meisten Modelle neigen in dieselbe Richtung: Frauen werden je nach Situation in 16 bis 17 der 18 Modelle bevorzugt, Schwarze in 14 von 18 beim Kredit und in allen 18 bei Einstellung und Miete. Es gibt Ausnahmen: Claude Sonnet 5 gibt Schwarzen beim Kredit niedrigere Bewertungen als Weißen, und Gemini 3.5 Flash Lite bewertet Hochschulabsolventen bei Mietanträgen schlechter. Die Mittelwerte halten, wenn man jedes Modell einzeln herausnimmt oder die 12 Entwickler gleich gewichtet.

Die Einstellungsnoten drängen sich am oberen Ende: 14,32 % davon sind glatte 100.

Was die Zahlen nicht sagen

Der Autor bringt das Ergebnis mit Forschung zu sinkenden Löhnen und schlechterer Gesundheit weißer Männer ohne Abschluss in Verbindung und argumentiert, dass Vergleiche nur nach Hautfarbe oder nur nach Geschlecht diese Gruppe verbergen. Doch die Studie belegt ungleiche Behandlung in kontrollierten Bewertungen fiktiver Profile. Ob das den Zugang irgendeines Menschen zu Kredit, Arbeit oder Wohnung verändert, hängt davon ab, wie Modelle in echten Entscheidungen eingesetzt werden — was das Paper nicht misst. Auch die Ursache ist unbekannt: Training mit menschlichem Feedback, gelernte Assoziationen oder die Art, wie Modelle fehlende Informationen ergänzen, werden als Möglichkeiten genannt, nicht getestet.

Die praktische Lehre, die der Autor zieht, ist eng gefasst und überprüfbar: Prüfungen von KI-Entscheidungen sollten Bildung einbeziehen, sich überschneidende Gruppen statt einzelner Merkmale vergleichen und Effektgrößen samt ihrer Unsicherheit angeben.

Der Autor gibt an, OpenAI Codex als Hilfe beim Schreiben von Code und beim Korrekturlesen genutzt zu haben, nicht aber für den Entwurf der Studie oder die Interpretation ihrer Ergebnisse.

Legal notice