LAS PUNTUACIONES DE DEPRESIÓN DE LA IA DEPENDEN DE LA IA
La depresión no tiene un análisis de sangre diagnóstico. Los grandes modelos de lenguaje prometen evaluaciones incansables, baratas y repetibles extraídas de conversaciones clínicas, y las primeras evaluaciones han sido alentadoras. La psiquiatría ya se enfrentó antes a una pregunta similar: en 1971, un estudio descubrió que psiquiatras estadounidenses y británicos discrepaban tras ver las mismas entrevistas grabadas en vídeo, y la disciplina respondió con criterios explícitos y entrevistas estructuradas.
Pero un modelo de lenguaje solo se convierte en «evaluador» a través de una serie de decisiones. Alguien elige el modelo, formula la petición —como un cuestionario, con la voz de un psiquiatra o como el paciente respondiendo sobre sí mismo—, elige cifras o letras para las respuestas, decide si el modelo lee solo las palabras del paciente o toda la conversación, y convierte su salida en una puntuación. Las evaluaciones rara vez muestran estas alternativas.
880 maneras de construir un evaluador
Baihan Lin, de la Escuela de Medicina Icahn de Mount Sinai, en Nueva York, cruzó 11 modelos abiertos (de 1.000 a 21.000 millones de parámetros) con cinco formulaciones, dos vistas de la conversación, dos maneras de leer la respuesta y cuatro maneras de construir la puntuación. Eso da 880 evaluadores, cada uno aplicado a las mismas 189 entrevistas grabadas, realizadas por un entrevistador virtual animado. Antes de cada entrevista, los participantes habían rellenado el PHQ-8, un cuestionario de depresión de ocho ítems puntuado de 0 a 24; una puntuación de 10 o más es el umbral de cribado habitual. Cerca del 30 % de los participantes lo superaba.
El estudio estaba prerregistrado: el código de análisis se congeló antes de cualquier comparación con el cuestionario. El procedimiento bloqueado se ejecutó después una sola vez sobre 86 entrevistas nuevas dirigidas por un entrevistador virtual totalmente autónomo, con transcripciones automáticas. Todo el procesamiento se hizo en una estación de trabajo local.
El evaluador pesa más que el paciente
- Una entrevista, veredictos opuestos. Un participante con síntomas leves (PHQ-8 de 5, por debajo del umbral) fue clasificado como positivo en el cribado por la mitad de los 880 evaluadores. Ningún participante obtuvo un veredicto unánime.
- Los evaluadores precisos también discrepan. Entre los 540 evaluadores con buena capacidad de discriminación (un AUC de 0,70 o más), dos elegidos al azar discrepaban en la decisión de cribado para el 40 % de los participantes.
- El modelo importa más que la persona. La elección del modelo explicaba el 30,0 % de la variación de las puntuaciones; las diferencias estables entre participantes, el 10,5 %: 2,8 veces menos.
Una báscula con el cero desplazado
La precisión, tal como suele medirse, indica lo bien que un evaluador ordena a las personas. No dice a cuántas señala. Los evaluadores señalaban entre el 0 % y el 100 % de los participantes, frente a un 30 % en la realidad. Lo que fijaba esa proporción era la tendencia media de cada evaluador a sobrevalorar o infravalorar (R² = 0,91). El autor lo compara con una báscula de baño con el cero desplazado: puede ordenar bien a las personas, pero su desfase decide quién cruza la línea. Dos modelos con una precisión casi idéntica, Qwen2.5 7B y Mistral 7B, señalarían a 24 y a 80 personas de cada 100, respectivamente.
Pequeños detalles técnicos movían esa línea. Invertir las letras de respuesta —de modo que «A» significara «casi todos los días» en lugar de «nunca», un cambio clínicamente irrelevante— desplazó la proporción de señalados una mediana de 21 puntos, y hasta 85. Ejecutar el mismo modelo como archivo comprimido en distintos programas cambió una mediana del 21 % de las decisiones.
Las puntuaciones también captaban algo más que la depresión. Seguían los síntomas de estrés postraumático tan de cerca como la depresión, los participantes habladores eran señalados con más frecuencia, y el 16 % de los evaluadores invertía el sentido de la pequeña diferencia entre mujeres y hombres que recogía el cuestionario.
La calibración ayuda, hasta cierto punto
Como el desfase determinaba tanto, el autor probó una reparación: reajustar el umbral de cada evaluador con 40 participantes etiquetados localmente. La precisión subió de cerca del 60 % al 75 %, y el desacuerdo se redujo a la mitad, del 40 % al 20 %. Pero incluso cuando se obligó a todos los evaluadores a elegir el mismo número de personas, seguían eligiendo a personas distintas aproximadamente una vez de cada cinco.
En las 86 entrevistas nuevas se cumplieron cinco de las seis predicciones prerregistradas que podían comprobarse. El autor enumera límites claros: solo modelos abiertos de hasta 21.000 millones de parámetros, porque los datos no podían salir de la estación de trabajo; un cuestionario autoinformado como criterio, no un diagnóstico; ningún clínico evaluando las mismas transcripciones; y entrevistas en inglés de un único laboratorio.
Cinco comprobaciones antes de fiarse de una puntuación
El artículo termina con consejos prácticos: informar del abanico de decisiones entre configuraciones razonables en lugar de un único número; fijar de antemano una configuración neutra; calibrar localmente y medir el desacuerdo que queda; comprobar qué más capta el evaluador; y tratar cualquier cambio de modelo, programa, transcripción o formulación como un instrumento nuevo. Como dice el autor, cuando cambiar la forma de preguntar cambia a quién identificamos, el instrumento pasa a formar parte de la explicación.
