NOTAS DE DEPRESSÃO DADAS POR IA DEPENDEM DA IA
A depressão não tem um exame de sangue para diagnóstico. Grandes modelos de linguagem prometem avaliações incansáveis, baratas e repetíveis extraídas de conversas clínicas, e as primeiras avaliações foram animadoras. A psiquiatria já enfrentou uma questão parecida: em 1971, um estudo constatou que psiquiatras americanos e britânicos discordavam depois de assistir às mesmas entrevistas gravadas em vídeo, e a área respondeu com critérios explícitos e entrevistas estruturadas.
Mas um modelo de linguagem só se torna um “avaliador” por meio de uma série de escolhas. Alguém escolhe o modelo, formula o pedido — como um questionário, na voz de um psiquiatra ou como o próprio paciente respondendo sobre si —, escolhe números ou letras para as respostas, decide se o modelo lê apenas as falas do paciente ou a conversa inteira, e transforma a saída em uma nota. As avaliações raramente mostram essas alternativas.
880 maneiras de construir um avaliador
Baihan Lin, da Icahn School of Medicine at Mount Sinai, em Nova York, cruzou 11 modelos abertos (de 1 a 21 bilhões de parâmetros) com cinco formulações, duas visões da conversa, duas formas de ler a resposta e quatro formas de construir a nota. Isso dá 880 avaliadores, cada um aplicado às mesmas 189 entrevistas gravadas, conduzidas por um entrevistador virtual animado. Antes de cada entrevista, os participantes tinham preenchido o PHQ-8, um questionário de depressão de oito itens pontuado de 0 a 24; uma pontuação de 10 ou mais é o limiar usual de triagem. Cerca de 30% dos participantes o ultrapassaram.
O estudo foi pré-registrado: o código de análise foi congelado antes de qualquer comparação com o questionário. O procedimento travado foi então executado uma única vez em 86 novas entrevistas conduzidas por um entrevistador virtual totalmente autônomo, com transcrições automáticas. Todo o processamento ficou em uma estação de trabalho local.
O avaliador pesa mais que o paciente
- Uma entrevista, veredictos opostos. Um participante com sintomas leves (PHQ-8 de 5, abaixo do limiar) foi apontado como positivo na triagem por metade dos 880 avaliadores. Nenhum participante recebeu um veredito unânime.
- Avaliadores precisos ainda discordam. Entre os 540 avaliadores com boa discriminação (AUC de 0,70 ou mais), dois sorteados ao acaso discordavam sobre a decisão de triagem para 40% dos participantes.
- O modelo importa mais que a pessoa. A escolha do modelo explicou 30,0% da variação nas notas; diferenças estáveis entre participantes explicaram 10,5% — 2,8 vezes menos.
Uma balança com o zero fora do lugar
A precisão, como costuma ser medida, diz o quão bem um avaliador ordena as pessoas. Ela não diz quantas ele sinaliza. Os avaliadores sinalizaram de 0% a 100% dos participantes, contra 30% na realidade. O que definia essa proporção era a tendência média de cada avaliador a superestimar ou subestimar (R² = 0,91). O autor a compara a uma balança de banheiro com o zero fora do lugar: ela pode ordenar bem as pessoas, mas é o seu desvio que decide quem cruza a linha. Dois modelos com precisão quase idêntica, Qwen2.5 7B e Mistral 7B, sinalizariam 24 e 80 pessoas em cada 100, respectivamente.
Pequenos detalhes técnicos moviam essa linha. Inverter as letras das respostas — de modo que “A” significasse “quase todos os dias” em vez de “nunca”, uma mudança sem nenhum sentido clínico — alterou a proporção de sinalizados em uma mediana de 21 pontos, e em até 85. Rodar o mesmo modelo como arquivo comprimido em softwares diferentes mudou uma mediana de 21% das decisões.
As notas também captavam mais do que depressão. Elas acompanhavam os sintomas de estresse pós-traumático tão de perto quanto a depressão, participantes falantes eram sinalizados com mais frequência, e 16% dos avaliadores inverteram o sentido da pequena diferença entre mulheres e homens registrada pelo questionário.
A calibração ajuda, até certo ponto
Como o desvio pesava tanto, o autor tentou um reparo: redefinir o limiar de cada avaliador com 40 participantes rotulados localmente. A precisão subiu de cerca de 60% para 75%, e a discordância caiu pela metade, de 40% para 20%. Mas mesmo quando todos os avaliadores eram obrigados a escolher o mesmo número de pessoas, eles ainda escolhiam pessoas diferentes cerca de uma vez em cada cinco.
Nas 86 novas entrevistas, cinco das seis previsões pré-registradas que podiam ser testadas se confirmaram. O autor lista limites claros: apenas modelos abertos de até 21 bilhões de parâmetros, porque os dados não podiam sair da estação de trabalho; um questionário autorrelatado como critério, e não um diagnóstico; nenhum clínico avaliando as mesmas transcrições; e entrevistas em inglês vindas de um único laboratório.
Cinco verificações antes de confiar em uma nota
O artigo termina com conselhos práticos: relatar a faixa de decisões entre configurações razoáveis em vez de um número único; fixar uma configuração neutra com antecedência; calibrar localmente e medir a discordância que resta; testar o que mais o avaliador capta; e tratar qualquer mudança de modelo, software, transcrição ou formulação como um novo instrumento. Como diz o autor, quando mudar a forma de perguntar muda quem identificamos, o instrumento passa a fazer parte da explicação.
