Computação e IAPré-publicaçãoExperimento4 min de leitura

QUASE UM TERÇO DA WEB JÁ É ESCRITO POR IA

Os grandes modelos de linguagem aprendem principalmente com texto coletado na web. Uma parte cada vez maior desse texto é, ela própria, escrita por IA. Os autores o chamam de texto de IA “selvagem”: escrito por muitos modelos diferentes para leitores humanos, publicado on-line e arrastado para os dados de treinamento misturado ao texto humano e sem rótulo. Não se trata de “colapso de modelo”, em que um modelo é retreinado com a própria produção, nem de dados sintéticos curados, produzidos de propósito para ajudar no treinamento.

Jenna Russell, Mohit Iyyer e colegas da Universidade de Maryland e da Pangram Labs, empresa que vende um detector de texto de IA, decidiram medir quanto desse texto existe e o que ele faz com um modelo.

Quanta IA há na web?

Usando o pipeline FineWeb, que filtra o enorme arquivo Common Crawl da web, a equipe reconstruiu o corpus até junho de 2026: 96 milhões de documentos, 83 bilhões de tokens, os fragmentos de palavras que um modelo lê. Cada documento foi rotulado com o detector da empresa, o Pangram, cuja taxa de falsos positivos relatada é de 0,05%; em 60.000 documentos de 2021, antes do lançamento do ChatGPT no fim de 2022, ele marcou apenas 0,062% como IA.

Parcela de tokens escritos por IA no texto da web que passa pelos filtros de qualidade do FineWeb:

  • menos de 0,1% em junho de 2021;
  • 10,1% em junho de 2024, 16,1% em junho de 2025;
  • 27,5% em junho de 2026, 31,1% em agosto de 2026;
  • previsão: 42,3% no fim de 2027, 50,7% no fim de 2028.

O aumento é desigual. Em 2026, cerca de metade dos tokens de tutoriais e de “artigos de conhecimento” é rotulada como IA, contra 9% das notícias e 5% dos blogs pessoais. Pior: os filtros de qualidade usados para montar os conjuntos de treinamento favorecem o texto de IA: o FineWeb mantém documentos de IA 2,3 vezes mais do que os humanos, e o filtro DCLM, 9,8 vezes mais.

800 modelos postos à prova

A equipe pré-treinou 800 pequenos modelos de linguagem, de 19,9 milhões a 973 milhões de parâmetros, acrescentando de zero a 64 tokens de IA por token humano a um conjunto fixo de texto humano, e comparou cada um com o mesmo modelo que recebeu, em vez disso, o mesmo número de tokens humanos novos.

  • O texto de IA só ajudou modelos famintos por dados, abaixo de cerca de 10 tokens humanos por parâmetro.
  • A partir do orçamento habitual de computação ideal, de cerca de 20 tokens por parâmetro, acrescentar texto de IA aumentou o erro no texto humano, enquanto texto humano extra continuou a reduzi-lo.
  • A melhor parcela de texto de IA para prever texto humano caiu de 37% com 5 tokens por parâmetro para 1% com 20. Para prever texto de IA, ficou acima de 90%.
  • Repetir o mesmo texto humano foi melhor do que acrescentar texto de IA novo: erro 2,3% menor após uma passagem extra, cerca de 6,3% após oito.
  • Os modelos treinados com texto de IA começaram a escrever como IA: expressões como “delve” e “tapestry” subiram de 0,16 para 0,54 por 1.000 palavras.

As “leis de escala” existentes — fórmulas que preveem o erro de um modelo a partir de seu tamanho e de seus dados — tratam um token de IA como um humano e erram nisso. Os autores propõem uma nova lei com um benefício que satura e um dano que cresce logaritmicamente, de modo que o valor de um token de IA pode se tornar negativo. Ajustada em modelos de até 268 milhões de parâmetros, ela prevê modelos 3,6 vezes maiores com 41% menos erro do que a melhor lei existente, embora o apêndice observe que sua vantagem não é significativa em dois conjuntos de teste com baixas parcelas de IA.

A conta de não filtrar

Segundo essa lei, treinar com texto da web não filtrado na parcela de IA de agosto de 2026 custa 1,6 vez o poder computacional de treinar apenas com sua parte humana — 3,0 vezes na parcela prevista para 2028. E o dano é fácil de passar despercebido: o texto de IA é mais fácil de prever, então um conjunto de validação com 22,3% de texto de IA apresentou 95,5% dos treinamentos prejudiciais como melhorias. As pontuações em benchmarks padrão também subiram mais ou menos tanto com texto de IA quanto com texto humano.

Os autores recomendam filtrar o texto de IA quando o objetivo é o texto humano, repetir dados humanos antes de acrescentar dados de IA e relatar separadamente os erros no texto humano e no de IA. Os limites são reais: modelos de no máximo 973 milhões de parâmetros, apenas inglês, apenas pré-treinamento e um único detector, feito pela empresa dos autores — cujo negócio essas conclusões favorecem. Para permitir verificações independentes, eles divulgam o corpus, os 800 modelos e o código.

Legal notice