Médecine & santéPreprintAnalyse de données4 min de lecture

QUAND L'IA NOTE LA DÉPRESSION, LA NOTE DÉPEND DE L'IA

La dépression n’a pas de test sanguin de diagnostic. Les grands modèles de langage promettent des évaluations inlassables, peu coûteuses et répétables à partir de conversations cliniques, et les premières évaluations étaient encourageantes. La psychiatrie a déjà affronté une question voisine : en 1971, une étude a montré que des psychiatres américains et britanniques n’étaient pas d’accord après avoir regardé les mêmes entretiens filmés, et la discipline a répondu par des critères explicites et des entretiens structurés.

Mais un modèle de langage ne devient un « évaluateur » qu’à travers une série de choix. Quelqu’un choisit le modèle, formule la demande — comme un questionnaire, avec la voix d’un psychiatre, ou comme si le patient répondait lui-même —, choisit des chiffres ou des lettres pour les réponses, décide si le modèle lit seulement les paroles du patient ou toute la conversation, et transforme sa sortie en score. Les évaluations montrent rarement ces alternatives.

880 façons de construire un évaluateur

Baihan Lin, de l’Icahn School of Medicine at Mount Sinai à New York, a croisé 11 modèles ouverts (de 1 à 21 milliards de paramètres) avec cinq formulations, deux vues de la conversation, deux façons de lire la réponse et quatre façons de construire le score. Cela fait 880 évaluateurs, chacun appliqué aux mêmes 189 entretiens enregistrés, menés par un intervieweur virtuel animé. Avant chaque entretien, les participants avaient rempli le PHQ-8, un questionnaire de dépression en huit questions noté de 0 à 24 ; un score de 10 ou plus est le seuil de dépistage habituel. Environ 30 % des participants le dépassaient.

L’étude était pré-enregistrée : le code d’analyse a été figé avant toute comparaison avec le questionnaire. La procédure verrouillée a ensuite été appliquée une seule fois à 86 nouveaux entretiens menés par un intervieweur virtuel entièrement autonome, avec des transcriptions automatiques. Tout le traitement est resté sur une station de travail locale.

L’évaluateur pèse plus que le patient

  • Un entretien, des verdicts opposés. Un participant aux symptômes légers (PHQ-8 de 5, sous le seuil) a été signalé positif par la moitié des 880 évaluateurs. Aucun participant n’a reçu un verdict unanime.
  • Des évaluateurs précis restent en désaccord. Parmi les 540 évaluateurs qui discriminent bien (une AUC d’au moins 0,70), deux tirés au hasard divergeaient sur la décision de dépistage pour 40 % des participants.
  • Le modèle compte plus que la personne. Le choix du modèle expliquait 30,0 % de la variation des scores ; les différences stables entre participants, 10,5 % — 2,8 fois moins.

Une balance au zéro mal réglé

La précision, telle qu’on la mesure d’habitude, dit si un évaluateur classe bien les gens. Elle ne dit pas combien il en signale. Les évaluateurs signalaient entre 0 % et 100 % des participants, contre 30 % en réalité. Ce qui fixait cette part, c’était la tendance moyenne de chaque évaluateur à surnoter ou sous-noter (R² = 0,91). L’auteur compare cela à un pèse-personne au zéro mal réglé : il peut bien classer les gens, mais son décalage décide qui franchit la ligne. Deux modèles de précision presque identique, Qwen2.5 7B et Mistral 7B, signaleraient respectivement 24 et 80 personnes sur 100.

De petits détails techniques déplaçaient cette ligne. Inverser l’ordre des lettres de réponse — pour que « A » signifie « presque tous les jours » au lieu de « jamais », un changement sans aucun sens clinique — déplaçait la part signalée de 21 points en médiane, et jusqu’à 85. Faire tourner le même modèle sous forme de fichier compressé dans un autre logiciel changeait en médiane 21 % des décisions.

Les notes captaient aussi autre chose que la dépression. Elles suivaient les symptômes de stress post-traumatique d’aussi près que ceux de la dépression, les participants bavards étaient signalés plus souvent, et 16 % des évaluateurs inversaient le sens de la petite différence entre femmes et hommes indiquée par le questionnaire.

Le recalibrage aide, jusqu’à un certain point

Puisque le décalage pesait autant, l’auteur a tenté une réparation : régler à nouveau le seuil de chaque évaluateur avec 40 participants locaux dont on connaît le score. L’exactitude est passée d’environ 60 % à 75 %, et le désaccord a été divisé par deux, de 40 % à 20 %. Mais même quand chaque évaluateur devait retenir le même nombre de personnes, ils retenaient des personnes différentes environ une fois sur cinq.

Sur les 86 nouveaux entretiens, cinq des six prédictions pré-enregistrées vérifiables ont tenu. L’auteur liste des limites claires : seulement des modèles ouverts jusqu’à 21 milliards de paramètres, les données ne pouvant pas quitter la station de travail ; un questionnaire auto-rempli comme critère, pas un diagnostic ; aucun clinicien n’a noté les mêmes transcriptions ; et des entretiens en anglais issus d’un seul laboratoire.

Cinq vérifications avant de se fier à un score

L’article se termine par des conseils pratiques : rapporter la fourchette des décisions entre configurations raisonnables plutôt qu’un seul chiffre ; fixer d’avance une configuration neutre ; calibrer localement et mesurer le désaccord qui subsiste ; tester ce que l’évaluateur capte d’autre ; et traiter tout changement de modèle, de logiciel, de transcription ou de formulation comme un nouvel instrument. Comme l’écrit l’auteur, quand changer la façon de demander change les personnes repérées, l’instrument fait partie de l’explication.

Mentions légales