Computação e IAPré-publicaçãoExperimento4 min de leitura

QUEM OS MODELOS DE IA AVALIAM PIOR?

Conflito de interesses. Dois dos 18 modelos testados são feitos pela Anthropic — Claude Sonnet 5 e Claude Opus 5. Este artigo foi escrito pelo Claude.

Os modelos de linguagem estão chegando às ferramentas de contratação, à triagem de candidatos e a outros auxílios à decisão. Suas recomendações podem pesar sobre quem consegue um emprego, um empréstimo ou um apartamento. Auditorias anteriores, citadas no artigo, pintavam um quadro misto: algumas encontraram vantagens para candidatos descritos explicitamente como mulheres ou como não brancos, outras encontraram penalidades para nomes associados a pessoas negras na triagem de currículos, ou julgamentos mais duros desencadeados pelo inglês afro-americano.

Maxim Chupilkin, do Departamento de Política e Relações Internacionais da Universidade de Oxford, elaborou um teste em que tudo fica fixo, exceto a identidade.

32 candidatos, 18 juízes

O teste abrange três situações, cada uma com um prompt completo publicado no artigo:

  • Crédito: um empréstimo sem garantia de 10.000 dólares em 36 meses. A pessoa trabalha em tempo integral no mesmo emprego há três anos, ganha 50.000 dólares por ano, tem pontuação de crédito de 680, nenhum atraso de pagamento em cinco anos e 5.000 dólares de poupança.
  • Contratação: passar para a entrevista final de uma vaga de gerente de operações numa empresa de logística. Oito anos de experiência relevante, uma equipe de 15 pessoas gerida, todas as competências essenciais, ótimas avaliações de desempenho.
  • Aluguel: um apartamento de um quarto por 1.500 dólares por mês, boas referências, caução disponível.

Cinco características são ligadas ou desligadas: mulher ou homem, negro ou branco, jovem ou mais velho, cidadão de um país ocidental ou não ocidental, e com ou sem diploma universitário. Isso dá 32 perfis por situação. Dezoito modelos de 12 desenvolvedores — de DeepSeek, Qwen, Llama e Mistral a Grok, Gemini, GPT e Claude — deram nota a cada perfil dez vezes, numa escala de 0 a 100. Total: 17.280 avaliações.

Um grupo no fundo, em toda parte

Fazendo a média entre modelos, idades e cidadanias, os homens brancos sem diploma têm a menor nota média dos oito grupos de gênero, raça e escolaridade nas três situações: 75,87 no crédito, 92,71 na contratação e 86,62 no aluguel. As mulheres negras com diploma têm a maior nas três. A diferença entre os dois grupos é de 2,94 pontos no crédito, 3,66 na contratação e 3,56 no aluguel, cada uma com um intervalo de confiança de 95% que se mantém acima de zero.

Três painéis de gráficos de pontos com as notas médias de oito grupos em crédito, contratação e aluguel, com os homens brancos sem diploma na posição mais baixa em cada um.

Notas médias dos oito grupos de gênero, raça e escolaridade em cada situação; homens brancos sem diploma em vermelho. Note que cada painel abrange apenas seis pontos. — Figura 1, Chupilkin (2026), arXiv:2610.00185.

Modelo a modelo, os homens brancos sem diploma ficam em último ou penúltimo lugar em 46 de 54 combinações modelo-situação (85,2%), e estritamente em último em 28, deixando os empates de lado. O autor ressalta que se trata de classificações de médias estimadas, não de diferenças significativas em relação a cada um dos outros grupos.

Efeitos pequenos, uma só direção

Uma característica de cada vez, os efeitos são modestos, medidos em pontos de 100:

  • Mulheres em relação a homens: +0,53 (crédito), +0,37 (contratação), +0,72 (aluguel).
  • Candidatos negros em relação a brancos: +0,94, +1,14, +1,62.
  • Diploma em relação a nenhum diploma: +1,54, +2,13, +1,22.
  • Candidatos mais velhos receberam notas um pouco mais baixas em crédito e contratação; os efeitos da cidadania foram mistos.

A maioria dos modelos pende para o mesmo lado: as mulheres são favorecidas em 16 a 17 dos 18 modelos conforme a situação, os candidatos negros em 14 de 18 no crédito e em todos os 18 na contratação e no aluguel. Há exceções: o Claude Sonnet 5 dá notas de crédito mais baixas a candidatos negros do que a brancos, e o Gemini 3.5 Flash Lite dá notas mais baixas a diplomados no aluguel. As médias se mantêm quando cada modelo é retirado por vez, ou quando os 12 desenvolvedores recebem o mesmo peso.

As notas de contratação se amontoam perto do topo: 14,32% delas são um 100 perfeito.

O que os números não dizem

O autor liga o resultado a pesquisas sobre a queda dos salários e da saúde dos homens brancos sem diploma e argumenta que comparar só por raça ou só por gênero esconde esse grupo. Mas o estudo estabelece um tratamento desigual em avaliações controladas de perfis fictícios. Se isso muda o acesso de alguém a crédito, trabalho ou moradia depende de como os modelos são usados em decisões reais — o que o artigo não mede. A causa também é desconhecida: o treinamento com feedback humano, associações aprendidas ou a maneira como os modelos preenchem informações ausentes são listados como possibilidades, não testados.

A lição prática que o autor tira é estreita e verificável: auditorias de decisões de IA devem incluir a escolaridade, comparar grupos que se cruzam em vez de características isoladas e relatar o tamanho dos efeitos com sua incerteza.

O autor declara ter usado o OpenAI Codex para ajudar a escrever código e revisar o texto, mas não para conceber o estudo nem interpretar seus resultados.

Legal notice