Informatik & KIPreprintExperiment3 Min. Lesezeit

FAST EIN DRITTEL DES WEBS SCHREIBT INZWISCHEN DIE KI

Große Sprachmodelle lernen vor allem aus Text, der im Web gesammelt wird. Immer mehr dieses Texts ist selbst von KI geschrieben. Die Autoren nennen ihn „wilden“ KI-Text: von vielen verschiedenen Modellen für menschliche Leser verfasst, online veröffentlicht und vermischt mit menschlichem Text und ohne Kennzeichnung in Trainingsdaten gespült. Das ist weder ein „Modellkollaps“, bei dem ein Modell mit seinen eigenen Ausgaben neu trainiert wird, noch kuratierte synthetische Daten, die gezielt zur Unterstützung des Trainings erzeugt werden.

Jenna Russell, Mohit Iyyer und Kollegen von der University of Maryland und von Pangram Labs, einer Firma, die einen KI-Text-Detektor verkauft, wollten messen, wie viel solcher Text existiert und was er mit einem Modell macht.

Wie viel KI steckt im Web?

Mit der FineWeb-Pipeline, die das riesige Webarchiv Common Crawl filtert, baute das Team den Korpus bis Juni 2026 nach: 96 Millionen Dokumente, 83 Milliarden Tokens, also die Wortfragmente, die ein Modell liest. Jedes Dokument wurde mit dem firmeneigenen Detektor Pangram gekennzeichnet, dessen angegebene Falsch-positiv-Rate 0,05 % beträgt; bei 60.000 Dokumenten aus dem Jahr 2021, vor der Veröffentlichung von ChatGPT Ende 2022, markierte er nur 0,062 % als KI.

Anteil KI-geschriebener Tokens am Webtext, der die Qualitätsfilter von FineWeb passiert:

  • unter 0,1 % im Juni 2021;
  • 10,1 % im Juni 2024, 16,1 % im Juni 2025;
  • 27,5 % im Juni 2026, 31,1 % im August 2026;
  • Prognose: 42,3 % Ende 2027, 50,7 % Ende 2028.

Der Anstieg ist ungleich verteilt. 2026 ist etwa die Hälfte der Tokens in Anleitungen und „Wissensartikeln“ als KI gekennzeichnet, gegenüber 9 % bei Nachrichten und 5 % bei persönlichen Blogs. Schlimmer noch: Die Qualitätsfilter, mit denen Trainingsdatensätze zusammengestellt werden, bevorzugen KI-Text: FineWeb behält KI-Dokumente 2,3-mal so oft wie menschliche, der DCLM-Filter 9,8-mal so oft.

800 Modelle auf dem Prüfstand

Das Team trainierte 800 kleine Sprachmodelle vor, von 19,9 Millionen bis 973 Millionen Parametern, fügte einem festen Bestand menschlichen Texts null bis 64 KI-Tokens pro menschlichem Token hinzu und verglich jedes mit demselben Modell, das stattdessen dieselbe Anzahl frischer menschlicher Tokens erhielt.

  • KI-Text half nur datenhungrigen Modellen, unterhalb von etwa 10 menschlichen Tokens pro Parameter.
  • Ab dem üblichen rechenoptimalen Budget von etwa 20 Tokens pro Parameter erhöhte zusätzlicher KI-Text den Fehler bei menschlichem Text, während zusätzlicher menschlicher Text ihn weiter senkte.
  • Der beste Anteil von KI-Text zur Vorhersage menschlichen Texts fiel von 37 % bei 5 Tokens pro Parameter auf 1 % bei 20. Zur Vorhersage von KI-Text blieb er über 90 %.
  • Denselben menschlichen Text zu wiederholen schlug das Hinzufügen frischen KI-Texts: 2,3 % weniger Fehler nach einem zusätzlichen Durchlauf, etwa 6,3 % nach acht.
  • Mit KI-Text trainierte Modelle begannen, wie KI zu schreiben: Wörter wie „delve“ und „tapestry“ stiegen von 0,16 auf 0,54 pro 1.000 Wörter.

Bestehende „Skalierungsgesetze“ — Formeln, die den Fehler eines Modells aus seiner Größe und seinen Daten vorhersagen — behandeln ein KI-Token wie ein menschliches und liegen damit falsch. Die Autoren schlagen ein neues Gesetz vor, mit einem Nutzen, der sättigt, und einem Schaden, der logarithmisch wächst, sodass der Wert eines KI-Tokens negativ werden kann. An Modellen bis 268 Millionen Parametern angepasst, sagt es 3,6-mal größere Modelle mit 41 % weniger Fehler voraus als das beste bestehende Gesetz, auch wenn der Anhang vermerkt, dass sein Vorsprung bei zwei Testsätzen mit geringem KI-Anteil nicht signifikant ist.

Die Rechnung fürs Nichtfiltern

Nach diesem Gesetz kostet das Training mit ungefiltertem Webtext beim KI-Anteil von August 2026 1,6-mal so viel Rechenleistung wie das Training nur mit seinem menschlichen Teil — 3,0-mal so viel beim für 2028 prognostizierten Anteil. Und der Schaden wird leicht übersehen: KI-Text ist leichter vorherzusagen, daher wies ein Validierungssatz mit 22,3 % KI-Text 95,5 % der schädlichen Läufe als Verbesserungen aus. Auch die Werte in Standard-Benchmarks stiegen mit KI-Text etwa so stark wie mit menschlichem Text.

Die Autoren empfehlen, KI-Text herauszufiltern, wenn menschlicher Text das Ziel ist, menschliche Daten zu wiederholen, bevor KI-Daten hinzukommen, und Fehler für menschlichen und KI-Text getrennt anzugeben. Die Grenzen sind real: Modelle mit höchstens 973 Millionen Parametern, nur Englisch, nur Vortraining und ein einziger Detektor, hergestellt von der Firma der Autoren — deren Geschäft diese Schlussfolgerungen begünstigen. Um unabhängige Überprüfungen zu ermöglichen, veröffentlichen sie den Korpus, alle 800 Modelle und den Code.

Legal notice