KI-DEPRESSIONSWERTE HÄNGEN VON DER KI AB
Für die Diagnose einer Depression gibt es keinen Bluttest. Große Sprachmodelle versprechen unermüdliche, kostengünstige und wiederholbare Einschätzungen aus klinischen Gesprächen, und erste Evaluationen waren ermutigend. Die Psychiatrie stand schon einmal vor einer ähnlichen Frage: 1971 stellte eine Studie fest, dass amerikanische und britische Psychiater nach denselben auf Video aufgezeichneten Interviews zu unterschiedlichen Urteilen kamen – das Fach antwortete mit expliziten Kriterien und strukturierten Interviews.
Doch ein Sprachmodell wird erst durch eine Reihe von Entscheidungen zum „Bewerter“. Jemand wählt das Modell, formuliert die Anfrage – als Fragebogen, in der Stimme eines Psychiaters oder als Patient, der über sich selbst Auskunft gibt –, wählt Ziffern oder Buchstaben für die Antworten, entscheidet, ob das Modell nur die Worte des Patienten oder das ganze Gespräch liest, und macht aus seiner Ausgabe einen Wert. Evaluationen zeigen diese Alternativen selten.
880 Wege, einen Bewerter zu bauen
Baihan Lin von der Icahn School of Medicine at Mount Sinai in New York kombinierte 11 offene Modelle (mit 1 bis 21 Milliarden Parametern) mit fünf Formulierungen, zwei Sichten auf das Gespräch, zwei Arten, die Antwort auszulesen, und vier Arten, den Wert zu bilden. Das ergibt 880 Bewerter, jeder angewandt auf dieselben 189 aufgezeichneten Interviews, geführt von einem animierten virtuellen Interviewer. Vor jedem Interview hatten die Teilnehmenden den PHQ-8 ausgefüllt, einen Depressionsfragebogen mit acht Fragen und einem Wert von 0 bis 24; ein Wert von 10 oder mehr ist die übliche Screening-Schwelle. Etwa 30 % der Teilnehmenden überschritten sie.
Die Studie war präregistriert: Der Analysecode wurde eingefroren, bevor irgendein Vergleich mit dem Fragebogen stattfand. Das festgeschriebene Verfahren wurde dann einmalig auf 86 neue Interviews angewandt, die ein vollständig autonomer virtueller Interviewer mit automatischen Transkripten geführt hatte. Die gesamte Verarbeitung blieb auf einer lokalen Workstation.
Der Bewerter wiegt schwerer als der Patient
- Ein Interview, gegensätzliche Urteile. Ein Teilnehmer mit leichten Symptomen (PHQ-8 von 5, unter der Schwelle) wurde von der Hälfte der 880 Bewerter als Screening-positiv eingestuft. Kein Teilnehmer erhielt ein einstimmiges Urteil.
- Auch genaue Bewerter sind sich uneinig. Unter den 540 Bewertern mit guter Trennschärfe (AUC von 0,70 oder mehr) waren sich zwei zufällig gezogene bei 40 % der Teilnehmenden über die Screening-Entscheidung uneinig.
- Das Modell zählt mehr als die Person. Die Wahl des Modells erklärte 30,0 % der Streuung der Werte; stabile Unterschiede zwischen den Teilnehmenden erklärten 10,5 % – 2,8-mal weniger.
Eine Waage mit verschobener Null
Genauigkeit, wie sie üblicherweise gemessen wird, sagt, wie gut ein Bewerter Menschen in eine Rangfolge bringt. Sie sagt nicht, wie viele er markiert. Die Bewerter markierten zwischen 0 % und 100 % der Teilnehmenden, bei tatsächlich 30 %. Bestimmt wurde dieser Anteil von der durchschnittlichen Neigung jedes Bewerters, zu hoch oder zu niedrig zu werten (R² = 0,91). Der Autor vergleicht das mit einer Personenwaage mit verschobener Null: Sie kann Menschen gut ordnen, doch ihr Versatz entscheidet, wer die Linie überschreitet. Zwei Modelle mit fast identischer Genauigkeit, Qwen2.5 7B und Mistral 7B, würden 24 beziehungsweise 80 von 100 Personen markieren.
Kleine technische Details verschoben diese Linie. Die Antwortbuchstaben umzudrehen – sodass „A“ „fast jeden Tag“ statt „überhaupt nicht“ bedeutete, eine klinisch bedeutungslose Änderung – verschob den Anteil der Markierten um im Median 21 Punkte, und um bis zu 85. Dasselbe Modell als komprimierte Datei in unterschiedlicher Software laufen zu lassen, änderte im Median 21 % der Entscheidungen.
Die Werte erfassten auch mehr als Depression. Sie folgten Symptomen einer posttraumatischen Belastungsstörung ebenso eng wie der Depression, gesprächige Teilnehmende wurden häufiger markiert, und 16 % der Bewerter kehrten die Richtung des kleinen Unterschieds zwischen Frauen und Männern um, den der Fragebogen zeigte.
Kalibrierung hilft, bis zu einem gewissen Punkt
Weil der Versatz so viel bestimmte, versuchte der Autor eine Reparatur: die Schwelle jedes Bewerters mit 40 vor Ort gelabelten Teilnehmenden neu festzulegen. Die Genauigkeit stieg von etwa 60 % auf 75 %, und die Uneinigkeit halbierte sich, von 40 % auf 20 %. Doch selbst wenn jeder Bewerter gezwungen wurde, gleich viele Personen auszuwählen, wählten sie in etwa einem von fünf Fällen noch immer andere Personen.
In den 86 neuen Interviews bestätigten sich fünf der sechs präregistrierten Vorhersagen, die sich prüfen ließen. Der Autor nennt klare Grenzen: nur offene Modelle bis 21 Milliarden Parameter, weil die Daten die Workstation nicht verlassen durften; ein Selbstauskunftsfragebogen als Kriterium, keine Diagnose; keine Kliniker, die dieselben Transkripte bewerteten; und englischsprachige Interviews aus einem einzigen Labor.
Fünf Prüfungen, bevor man einem Wert vertraut
Die Arbeit endet mit praktischen Ratschlägen: die Bandbreite der Entscheidungen über sinnvolle Konfigurationen hinweg berichten statt einer einzigen Zahl; vorab eine neutrale Konfiguration festlegen; vor Ort kalibrieren und die verbleibende Uneinigkeit messen; prüfen, was der Bewerter sonst noch erfasst; und jeden Wechsel von Modell, Software, Transkription oder Formulierung als neues Instrument behandeln. Wie der Autor schreibt: Wenn eine andere Art zu fragen ändert, wen wir erkennen, wird das Instrument Teil der Erklärung.
