Medicina y saludPrepublicaciónExperimento3 min de lectura

CUANDO LA IA SE EQUIVOCA, UNA SEGUNDA IA AYUDA A LOS MÉDICOS JÓVENES

Los modelos de IA ya pueden examinar una radiografía y la historia clínica del paciente y proponer un diagnóstico con una justificación escrita. Que eso ayude depende no solo del modelo, sino de cómo reaccionan los médicos, sobre todo cuando la sugerencia es errónea. Estudios anteriores, citados en el artículo, observaron que los médicos menos experimentados son los que más se benefician de la ayuda de la IA, pero también los que más probabilidades tienen de dejarse llevar por sus errores.

Un equipo de la Universidad de Nanchang y de la Universidad de Ciencia y Tecnología de Hong Kong puso a prueba una idea sencilla tomada de la inteligencia colectiva: mostrar a los médicos dos opiniones de IA independientes en lugar de una.

Un ensayo aleatorizado con tres brazos

Lin Wu, Zhe Xu, Fuqing Zhou y sus colegas realizaron el ensayo en tres hospitales de China entre julio y septiembre de 2026, registrado en el Registro Chino de Ensayos Clínicos. Reclutaron a 132 residentes con menos de tres años de experiencia, tanto de radiología como de otras especialidades (medicina interna, cirugía general, medicina de urgencias), y los asignaron al azar a tres grupos:

  • Grupo A: sugerencias solo de GPT-5.4;
  • Grupo B: GPT-5.4 más Kimi-K2.6;
  • Grupo C: GPT-5.4 más Gemini-3.6 Flash.

Los participantes no sabían qué modelos estaban viendo. Nueve residentes abandonaron por fallos de red o por encontrarse mal, de modo que quedaron 123 en el análisis.

Todos leyeron las mismas 60 radiografías de tórax y abdomen. En cada una, primero dieron un diagnóstico por su cuenta y lo bloquearon, después vieron la sugerencia o sugerencias de la IA y, por último, dieron una respuesta final. Los casos se eligieron deliberadamente para que cada modelo acertara exactamente en 39 de 60 (65 %), y GPT-5.4, el modelo común, fallaba en 21. A modo de comparación, cinco radiólogos con uno a cinco años de experiencia obtuvieron un 54,3 % sin IA.

Lo que hace una IA equivocada

En el conjunto de los participantes, la precisión subió del 46,3 % al 61,5 % con ayuda de la IA. Lo interesante es lo que ocurrió en las 21 radiografías en las que GPT-5.4 se equivocaba:

  • Los residentes de radiología con una IA terminaron con un 20,0 % de acierto en esos casos. Sin IA, el mismo grupo había obtenido un 31,4 %: la sugerencia errónea los arrastró hacia abajo.
  • Con dos IA, los residentes de radiología alcanzaron el 40,1 % y el 40,4 %.
  • Los residentes de otras especialidades muestran el mismo patrón, del 12,1 % con una IA a cerca del 31 % con dos.

Sobre los 60 casos, los residentes de radiología mejoraron 9,6 puntos porcentuales con una IA, y 16,3 y 17,5 puntos con dos: unos 7 puntos más. El tiempo de lectura y la confianza no difirieron entre los grupos.

Nada sale gratis

La segunda opinión tiene un coste. En los residentes ajenos a la radiología, cuando GPT-5.4 acertaba, añadir un segundo modelo reducía la precisión del 87,4 % a cerca del 75 %: una IA discrepante podía hacerles abandonar una respuesta correcta. En conjunto, su mejora no difirió entre una y dos IA. Y cuando ambos modelos se equivocaban, un análisis exploratorio no encontró ningún beneficio significativo del segundo.

Los autores concluyen que dos sugerencias «pueden» limitar la influencia de una IA errónea, con una ganancia global solo para los residentes de radiología.

Límites que conviene tener presentes

  • Los 60 casos se seleccionaron para que todos los modelos tuvieran la misma precisión, por lo que no reflejan la práctica diaria.
  • El efecto puede depender de la frecuencia con la que discrepan los dos modelos, que varía de una pareja a otra.
  • No se hizo un cálculo formal del tamaño muestral; el número de participantes se basó en el reclutamiento factible.
  • La propia asignación aleatoria se obtuvo pidiendo a otro modelo de lenguaje, DeepSeek, una lista equilibrada, que se usó sin modificaciones.

Lo siguiente, según los autores, serán estudios con pacientes no seleccionados y seguimiento ocular, para ver cómo sopesan realmente los médicos dos máquinas que discrepan.

Legal notice