Médecine & santéPreprintExpérience3 min de lecture

QUAND L'IA SE TROMPE, UNE DEUXIÈME IA AIDE LES JEUNES MÉDECINS

Des modèles d’IA savent désormais examiner une radiographie et l’histoire du patient, puis proposer un diagnostic accompagné d’une justification écrite. Que cela aide dépend non seulement du modèle, mais aussi de la réaction des médecins — surtout quand la suggestion est fausse. Des études antérieures, citées par l’article, ont montré que les médecins les moins expérimentés profitent le plus de l’aide de l’IA, mais sont aussi les plus susceptibles d’être induits en erreur par ses erreurs.

Une équipe de l’université de Nanchang et de l’université des sciences et technologies de Hong Kong a testé une idée simple, tirée de l’intelligence collective : montrer aux médecins deux avis d’IA indépendants au lieu d’un.

Un essai randomisé à trois bras

Lin Wu, Zhe Xu, Fuqing Zhou et leurs collègues ont mené l’essai dans trois hôpitaux chinois entre juillet et septembre 2026, enregistré au registre chinois des essais cliniques. Ils ont recruté 132 internes ayant moins de trois ans d’expérience, en radiologie comme dans d’autres spécialités (médecine interne, chirurgie générale, urgences), et les ont répartis au hasard en trois groupes :

  • Groupe A : suggestions de GPT-5.4 seul ;
  • Groupe B : GPT-5.4 plus Kimi-K2.6 ;
  • Groupe C : GPT-5.4 plus Gemini-3.6 Flash.

Les participants ne savaient pas quels modèles ils voyaient. Neuf internes ont abandonné à cause de pannes de réseau ou d’un malaise, laissant 123 personnes dans l’analyse.

Tous ont lu les mêmes 60 radiographies du thorax et de l’abdomen. Pour chacune, ils donnaient d’abord leur diagnostic seuls et le verrouillaient, voyaient ensuite la ou les suggestions d’IA, puis donnaient leur réponse finale. Les cas avaient été choisis exprès pour que chaque modèle ait raison sur exactement 39 cas sur 60 (65 %) — et GPT-5.4, le modèle commun, se trompait sur 21. À titre de comparaison, cinq radiologues ayant un à cinq ans d’expérience obtenaient 54,3 % sans IA.

Ce que fait une IA qui se trompe

Tous groupes confondus, la précision est passée de 46,3 % à 61,5 % avec l’aide de l’IA. Le plus intéressant se joue sur les 21 radiographies où GPT-5.4 se trompait :

  • Les internes en radiologie aidés d’une seule IA ont fini à 20,0 % de bonnes réponses sur ces cas. Sans IA, ce même groupe obtenait 31,4 % : la suggestion fausse les a fait reculer.
  • Avec deux IA, les internes en radiologie ont atteint 40,1 % et 40,4 %.
  • Les internes des autres spécialités suivent le même schéma, de 12,1 % avec une IA à environ 31 % avec deux.

Sur l’ensemble des 60 cas, les internes en radiologie ont progressé de 9,6 points avec une IA, et de 16,3 et 17,5 points avec deux — environ 7 points de plus. Le temps de lecture et la confiance n’ont pas différé entre les groupes.

Pas de bénéfice gratuit

Le second avis a un coût. Pour les internes hors radiologie, quand GPT-5.4 avait raison, ajouter un second modèle a fait baisser la précision de 87,4 % à environ 75 % : une IA en désaccord pouvait les détourner d’une bonne réponse. Au total, leur progression n’a pas différé entre une et deux IA. Et quand les deux modèles se trompaient, une analyse exploratoire n’a trouvé aucun bénéfice significatif du second.

Les auteurs concluent que deux suggestions « pourraient » limiter l’influence d’une IA erronée, avec un gain global seulement pour les internes en radiologie.

Des limites à garder en tête

  • Les 60 cas ont été choisis pour donner la même précision à chaque modèle : ils ne reflètent pas la pratique courante.
  • L’effet peut dépendre de la fréquence des désaccords entre les deux modèles, qui varie d’une paire à l’autre.
  • Aucun calcul formel de taille d’échantillon n’a été fait ; le nombre de participants dépendait du recrutement possible.
  • La répartition au hasard elle-même a été produite en demandant à un autre modèle de langage, DeepSeek, une liste équilibrée, utilisée sans modification.

Prochaine étape selon les auteurs : des études sur des patients non sélectionnés, avec suivi du regard, pour voir comment les médecins pèsent réellement deux machines en désaccord.

Mentions légales