Komputasi & AIPracetakEksperimen3 menit baca

HAMPIR SEPERTIGA WEB KINI DITULIS OLEH AI

Model bahasa besar sebagian besar belajar dari teks yang dikumpulkan di web. Makin banyak teks itu yang ternyata ditulis oleh AI. Para penulis menyebutnya teks AI “liar”: ditulis oleh banyak model berbeda untuk pembaca manusia, diterbitkan daring, lalu tersapu ke dalam data pelatihan bercampur dengan teks manusia tanpa label. Ini bukan “keruntuhan model” (model collapse), ketika sebuah model dilatih ulang dengan keluarannya sendiri, dan bukan pula data sintetis terkurasi yang sengaja dibuat untuk membantu pelatihan.

Jenna Russell, Mohit Iyyer, dan rekan-rekan di Universitas Maryland dan di Pangram Labs, perusahaan yang menjual detektor teks AI, berupaya mengukur seberapa banyak teks semacam ini dan apa pengaruhnya terhadap sebuah model.

Seberapa banyak AI di web?

Dengan memakai alur kerja FineWeb, yang menyaring arsip web raksasa Common Crawl, tim membangun ulang korpus hingga Juni 2026: 96 juta dokumen, 83 miliar token, yaitu potongan kata yang dibaca model. Setiap dokumen diberi label dengan detektor milik perusahaan itu, Pangram, yang laju positif palsunya dilaporkan 0,05%; pada 60.000 dokumen dari 2021, sebelum ChatGPT dirilis pada akhir 2022, detektor ini hanya menandai 0,062% sebagai AI.

Porsi token tulisan AI dalam teks web yang lolos saringan kualitas FineWeb:

  • di bawah 0,1% pada Juni 2021;
  • 10,1% pada Juni 2024, 16,1% pada Juni 2025;
  • 27,5% pada Juni 2026, 31,1% pada Agustus 2026;
  • prakiraan: 42,3% pada akhir 2027, 50,7% pada akhir 2028.

Kenaikannya tidak merata. Pada 2026, sekitar separuh token tutorial dan “artikel pengetahuan” berlabel AI, dibandingkan 9% berita dan 5% blog pribadi. Lebih buruk lagi, saringan kualitas yang dipakai untuk menyusun set pelatihan lebih menyukai teks AI: FineWeb mempertahankan dokumen AI 2,3 kali lebih sering daripada dokumen manusia, dan saringan DCLM 9,8 kali lebih sering.

800 model diuji

Tim melakukan prapelatihan 800 model bahasa kecil, dari 19,9 juta hingga 973 juta parameter, dengan menambahkan nol hingga 64 token AI per token manusia ke sekumpulan teks manusia yang tetap, lalu membandingkan masing-masing dengan model yang sama yang justru diberi token manusia baru dalam jumlah yang sama.

  • Teks AI hanya membantu model yang kelaparan data, di bawah sekitar 10 token manusia per parameter.
  • Mulai dari anggaran komputasi-optimal yang lazim, sekitar 20 token per parameter, menambahkan teks AI menaikkan galat pada teks manusia, sedangkan tambahan teks manusia terus menurunkannya.
  • Porsi teks AI terbaik untuk memprediksi teks manusia turun dari 37% pada 5 token per parameter menjadi 1% pada 20. Untuk memprediksi teks AI, porsinya tetap di atas 90%.
  • Mengulang teks manusia yang sama lebih baik daripada menambahkan teks AI baru: galat 2,3% lebih rendah setelah satu putaran tambahan, sekitar 6,3% setelah delapan putaran.
  • Model yang dilatih dengan teks AI mulai menulis seperti AI: frasa seperti “delve” dan “tapestry” naik dari 0,16 menjadi 0,54 per 1.000 kata.

“Hukum penskalaan” (scaling laws) yang ada — rumus yang memprediksi galat model dari ukuran dan datanya — memperlakukan token AI seperti token manusia dan karena itu keliru. Para penulis mengusulkan hukum baru dengan manfaat yang mencapai titik jenuh dan kerugian yang tumbuh secara logaritmik, sehingga nilai sebuah token AI dapat menjadi negatif. Dicocokkan pada model hingga 268 juta parameter, hukum ini memprediksi model 3,6 kali lebih besar dengan galat 41% lebih kecil daripada hukum terbaik yang ada, meskipun lampiran mencatat bahwa keunggulannya tidak signifikan pada dua set uji dengan porsi AI rendah.

Tagihan karena tidak menyaring

Menurut hukum ini, melatih dengan teks web tak tersaring pada porsi AI Agustus 2026 menuntut daya komputasi 1,6 kali lipat dibandingkan melatih dengan bagian manusianya saja — 3,0 kali lipat pada porsi yang diprakirakan untuk 2028. Dan kerusakannya mudah terlewat: teks AI lebih mudah diprediksi, sehingga set validasi dengan 22,3% teks AI melaporkan 95,5% pelatihan yang merugikan sebagai perbaikan. Skor tolok ukur standar juga naik kurang lebih sama banyaknya dengan teks AI seperti dengan teks manusia.

Para penulis menyarankan untuk menyaring teks AI bila tujuannya adalah teks manusia, mengulang data manusia sebelum menambahkan data AI, dan melaporkan galat pada teks manusia dan teks AI secara terpisah. Keterbatasannya nyata: model tidak lebih besar dari 973 juta parameter, hanya bahasa Inggris, hanya prapelatihan, dan satu detektor saja, buatan perusahaan para penulis — yang bisnisnya diuntungkan oleh kesimpulan ini. Untuk memungkinkan pemeriksaan independen, mereka merilis korpus, ke-800 model, dan kodenya.

Legal notice