WENN DIE KI DANEBENLIEGT, HILFT JUNGEN ÄRZTEN EINE ZWEITE KI
KI-Modelle können inzwischen ein Röntgenbild und die Krankengeschichte eines Patienten betrachten und eine Diagnose mit schriftlicher Begründung vorschlagen. Ob das hilft, hängt nicht nur vom Modell ab, sondern davon, wie Ärzte reagieren – besonders wenn der Vorschlag falsch ist. Frühere Studien, die das Paper zitiert, fanden, dass weniger erfahrene Ärzte am meisten von KI-Hilfe profitieren, sich aber auch am ehesten von ihren Fehlern in die Irre führen lassen.
Ein Team der Universität Nanchang und der Hong Kong University of Science and Technology testete eine einfache Idee aus der Forschung zur kollektiven Intelligenz: Ärzten zwei unabhängige KI-Meinungen statt einer zu zeigen.
Eine randomisierte Studie mit drei Armen
Lin Wu, Zhe Xu, Fuqing Zhou und Kollegen führten die Studie zwischen Juli und September 2026 an drei Kliniken in China durch, registriert im chinesischen Register für klinische Studien. Sie rekrutierten 132 Assistenzärzte mit weniger als drei Jahren Berufserfahrung, sowohl aus der Radiologie als auch aus anderen Fachrichtungen (Innere Medizin, Allgemeinchirurgie, Notfallmedizin), und teilten sie zufällig drei Gruppen zu:
- Gruppe A: Vorschläge nur von GPT-5.4;
- Gruppe B: GPT-5.4 plus Kimi-K2.6;
- Gruppe C: GPT-5.4 plus Gemini-3.6 Flash.
Die Teilnehmenden wussten nicht, welche Modelle sie sahen. Neun Assistenzärzte schieden wegen Netzwerkausfällen oder Unwohlsein aus, sodass 123 in die Auswertung eingingen.
Alle befundeten dieselben 60 Röntgenaufnahmen von Thorax und Abdomen. Bei jeder gaben sie zuerst selbst eine Diagnose ab und legten sich fest, sahen dann den oder die KI-Vorschläge und gaben schließlich eine endgültige Antwort. Die Fälle waren gezielt so ausgewählt, dass jedes Modell bei genau 39 von 60 (65 %) richtiglag – und GPT-5.4, das gemeinsame Modell, bei 21 falschlag. Zum Vergleich: Fünf Radiologen mit ein bis fünf Jahren Erfahrung erreichten ohne KI 54,3 %.
Was eine falsche KI anrichtet
Über alle Teilnehmenden hinweg stieg die Trefferquote mit KI-Hilfe von 46,3 % auf 61,5 %. Interessant ist, was bei den 21 Röntgenbildern geschah, bei denen GPT-5.4 falschlag:
- Radiologie-Assistenzärzte mit einer KI kamen bei diesen Fällen am Ende auf 20,0 %. Ohne KI hatte dieselbe Gruppe 31,4 % erreicht: Der falsche Vorschlag zog sie nach unten.
- Mit zwei KIs erreichten die Radiologie-Assistenzärzte 40,1 % und 40,4 %.
- Assistenzärzte anderer Fachrichtungen zeigen dasselbe Muster, von 12,1 % mit einer KI auf etwa 31 % mit zwei.
Über alle 60 Fälle verbesserten sich die Radiologie-Assistenzärzte mit einer KI um 9,6 Prozentpunkte und mit zwei um 16,3 bzw. 17,5 Punkte – rund 7 Punkte mehr. Befundungszeit und Zuversicht unterschieden sich zwischen den Gruppen nicht.
Nichts ist umsonst
Die zweite Meinung hat ihren Preis. Bei Assistenzärzten außerhalb der Radiologie senkte ein zweites Modell die Trefferquote von 87,4 % auf etwa 75 %, wenn GPT-5.4 richtig lag: Eine widersprechende KI konnte ihnen eine korrekte Antwort ausreden. Insgesamt unterschied sich ihre Verbesserung zwischen einer und zwei KIs nicht. Und wenn beide Modelle falschlagen, fand eine explorative Analyse keinen signifikanten Nutzen durch das zweite.
Die Autoren folgern, dass zwei Vorschläge den Einfluss fehlerhafter KI begrenzen „können“, mit einem Gesamtgewinn nur für Radiologie-Assistenzärzte.
Grenzen, die man im Blick behalten sollte
- Die 60 Fälle wurden so ausgewählt, dass jedes Modell dieselbe Trefferquote hat; sie spiegeln also nicht den klinischen Alltag wider.
- Der Effekt könnte davon abhängen, wie oft die beiden Modelle uneins sind, was von Paar zu Paar variiert.
- Es wurde keine formale Fallzahlberechnung durchgeführt; die Zahl der Teilnehmenden richtete sich nach der machbaren Rekrutierung.
- Die Zufallszuteilung selbst wurde erzeugt, indem ein anderes Sprachmodell, DeepSeek, um eine ausgewogene Liste gebeten wurde, die unverändert verwendet wurde.
Als Nächstes sollen laut den Autoren Studien mit nicht vorausgewählten Patienten und Blickverfolgung folgen, um zu sehen, wie Ärzte zwei uneinige Maschinen tatsächlich gegeneinander abwägen.
