Informatique & IAPreprintExpérience4 min de lecture

PRÈS D'UN TIERS DU WEB EST DÉSORMAIS ÉCRIT PAR DES IA

Les grands modèles de langage apprennent surtout sur du texte récolté sur le web. Une part croissante de ce texte est elle-même écrite par des IA. Les auteurs parlent de texte IA « sauvage » : écrit par de nombreux modèles pour des lecteurs humains, publié en ligne, et aspiré dans les données d’entraînement mêlé au texte humain et sans étiquette. Ce n’est ni l’« effondrement de modèle », où un modèle est réentraîné sur ses propres productions, ni des données synthétiques soignées, produites exprès pour aider l’entraînement.

Jenna Russell, Mohit Iyyer et leurs collègues de l’université du Maryland et de Pangram Labs, une entreprise qui vend un détecteur de texte IA, ont voulu mesurer combien il y a de ce texte et ce qu’il fait à un modèle.

Combien d’IA sur le web ?

Avec la chaîne FineWeb, qui filtre l’immense archive du web Common Crawl, l’équipe a reconstruit le corpus jusqu’en juin 2026 : 96 millions de documents, 83 milliards de tokens, les fragments de mots que lit un modèle. Chaque document a été étiqueté par le détecteur de l’entreprise, Pangram, dont le taux de faux positifs annoncé est de 0,05 % ; sur 60 000 documents de 2021, avant la sortie de ChatGPT fin 2022, il n’en a signalé que 0,062 % comme IA.

Part des tokens écrits par IA dans le texte web qui passe les filtres de qualité de FineWeb :

  • moins de 0,1 % en juin 2021 ;
  • 10,1 % en juin 2024, 16,1 % en juin 2025 ;
  • 27,5 % en juin 2026, 31,1 % en août 2026 ;
  • prévision : 42,3 % fin 2027, 50,7 % fin 2028.

La hausse est inégale. En 2026, environ la moitié des tokens de tutoriels et d’« articles de connaissance » sont étiquetés IA, contre 9 % des actualités et 5 % des blogs personnels. Pire, les filtres de qualité servant à constituer les corpus d’entraînement favorisent le texte IA : FineWeb garde les documents IA 2,3 fois plus souvent que les humains, et le filtre DCLM 9,8 fois plus souvent.

800 modèles à l’épreuve

L’équipe a pré-entraîné 800 petits modèles de langage, de 19,9 millions à 973 millions de paramètres, en ajoutant de zéro à 64 tokens IA par token humain à un corpus humain fixe, et a comparé chacun au même modèle recevant à la place le même nombre de tokens humains neufs.

  • Le texte IA n’aidait que les modèles affamés de données, sous environ 10 tokens humains par paramètre.
  • À partir du budget usuel optimal en calcul, environ 20 tokens par paramètre, ajouter du texte IA augmentait l’erreur sur le texte humain, alors que du texte humain supplémentaire continuait de la faire baisser.
  • La meilleure part de texte IA pour prédire du texte humain tombait de 37 % à 5 tokens par paramètre à 1 % à 20. Pour prédire du texte IA, elle restait au-dessus de 90 %.
  • Répéter le même texte humain valait mieux qu’ajouter du texte IA neuf : erreur 2,3 % plus basse après un passage supplémentaire, environ 6,3 % après huit.
  • Les modèles entraînés sur du texte IA se mettaient à écrire comme des IA : des mots comme « delve » et « tapestry » passaient de 0,16 à 0,54 pour 1 000 mots.

Les « lois d’échelle » existantes — des formules qui prédisent l’erreur d’un modèle selon sa taille et ses données — traitent un token IA comme un token humain et se trompent. Les auteurs proposent une nouvelle loi, avec un bénéfice qui sature et un coût qui croît comme un logarithme, si bien que la valeur d’un token IA peut devenir négative. Ajustée sur des modèles jusqu’à 268 millions de paramètres, elle prédit des modèles 3,6 fois plus grands avec 41 % d’erreur en moins que la meilleure loi existante, même si l’annexe précise que son avance n’est pas significative sur deux jeux de test aux faibles parts d’IA.

La facture de l’absence de filtre

D’après cette loi, entraîner sur le web non filtré à la part d’IA d’août 2026 coûte 1,6 fois le calcul d’un entraînement sur sa seule partie humaine — 3,0 fois à la part prévue pour 2028. Et les dégâts passent facilement inaperçus : le texte IA est plus facile à prédire, si bien qu’un jeu de validation contenant 22,3 % de texte IA présentait 95,5 % des entraînements nuisibles comme des améliorations. Les scores aux tests standard montaient d’ailleurs à peu près autant avec du texte IA qu’avec du texte humain.

Les auteurs recommandent de filtrer le texte IA quand l’objectif est le texte humain, de répéter les données humaines avant d’ajouter des données IA, et de mesurer séparément l’erreur sur texte humain et sur texte IA. Les limites sont réelles : des modèles d’au plus 973 millions de paramètres, l’anglais seulement, le pré-entraînement seulement, et un seul détecteur, fabriqué par l’entreprise des auteurs — dont ces conclusions servent l’activité. Pour permettre une vérification indépendante, ils publient le corpus, les 800 modèles et le code.

Mentions légales