Medicina e saúdePré-publicaçãoExperimento3 min de leitura

QUANDO A IA ERRA, UMA SEGUNDA IA AJUDA OS MÉDICOS JOVENS

Os modelos de IA hoje conseguem olhar uma radiografia e o histórico do paciente e propor um diagnóstico com uma justificativa por escrito. Se isso ajuda ou não depende não só do modelo, mas de como os médicos reagem — sobretudo quando a sugestão está errada. Estudos anteriores, citados pelo artigo, constataram que os médicos menos experientes são os que mais ganham com a ajuda da IA, mas também os que mais tendem a ser desviados pelos seus erros.

Uma equipe da Universidade de Nanchang e da Universidade de Ciência e Tecnologia de Hong Kong testou uma ideia simples inspirada na inteligência coletiva: mostrar aos médicos duas opiniões de IA independentes em vez de uma.

Um ensaio randomizado com três braços

Lin Wu, Zhe Xu, Fuqing Zhou e colegas conduziram o ensaio em três hospitais da China entre julho e setembro de 2026, registrado no Registro Chinês de Ensaios Clínicos. Recrutaram 132 residentes com menos de três anos de experiência, tanto de radiologia quanto de outras especialidades (clínica médica, cirurgia geral, medicina de emergência), e os distribuíram aleatoriamente em três grupos:

  • Grupo A: sugestões só do GPT-5.4;
  • Grupo B: GPT-5.4 mais Kimi-K2.6;
  • Grupo C: GPT-5.4 mais Gemini-3.6 Flash.

Os participantes não sabiam quais modelos estavam vendo. Nove residentes desistiram por falhas de rede ou por se sentirem mal, restando 123 na análise.

Todos leram as mesmas 60 radiografias de tórax e de abdome. Para cada uma, primeiro deram um diagnóstico por conta própria e o registraram de forma definitiva, depois viram a sugestão ou as sugestões da IA e então deram uma resposta final. Os casos foram escolhidos de propósito para que cada modelo acertasse exatamente 39 de 60 (65%) — e o GPT-5.4, o modelo comum a todos os grupos, errava em 21. Para comparação, cinco radiologistas com um a cinco anos de experiência acertaram 54,3% sem IA.

O que faz uma IA errada

Considerando todos, o acerto subiu de 46,3% para 61,5% com a ajuda da IA. A parte interessante é o que aconteceu nas 21 radiografias em que o GPT-5.4 errou:

  • Os residentes de radiologia com uma IA terminaram com 20,0% de acerto nesses casos. Sem IA, o mesmo grupo tinha acertado 31,4%: a sugestão errada os puxou para baixo.
  • Com duas IAs, os residentes de radiologia chegaram a 40,1% e 40,4%.
  • Os residentes de outras especialidades mostram o mesmo padrão, de 12,1% com uma IA a cerca de 31% com duas.

No conjunto dos 60 casos, os residentes de radiologia melhoraram 9,6 pontos percentuais com uma IA, e 16,3 e 17,5 pontos com duas — cerca de 7 pontos a mais. O tempo de leitura e a confiança não diferiram entre os grupos.

Não existe almoço grátis

A segunda opinião tem um custo. Para os residentes de fora da radiologia, quando o GPT-5.4 estava certo, acrescentar um segundo modelo baixou o acerto de 87,4% para cerca de 75%: uma IA discordante podia convencê-los a abandonar uma resposta correta. No geral, a melhora deles não diferiu entre uma e duas IAs. E quando os dois modelos erravam, uma análise exploratória não encontrou benefício significativo do segundo.

Os autores concluem que duas sugestões “podem” limitar a influência de uma IA errada, com ganho geral apenas para os residentes de radiologia.

Limites a ter em mente

  • Os 60 casos foram selecionados para dar a todos os modelos a mesma taxa de acerto, por isso não refletem a prática do dia a dia.
  • O efeito pode depender da frequência com que os dois modelos discordam, que varia de um par para outro.
  • Não foi feito nenhum cálculo formal do tamanho da amostra; o número de participantes se baseou no recrutamento viável.
  • A própria alocação aleatória foi produzida pedindo a outro modelo de linguagem, o DeepSeek, uma lista equilibrada, que foi usada sem modificação.

Em seguida, segundo os autores, virão estudos com pacientes não selecionados e rastreamento ocular, para ver como os médicos de fato ponderam duas máquinas que discordam.

Legal notice