संगणन आणि एआयप्रीप्रिंटप्रयोगवाचनासाठी ३ मिनिटे

वेबचा जवळजवळ एक तृतीयांश भाग आता AI लिहिते

मोठी भाषा-प्रतिरूपे बहुतांशी वेबवर गोळा केलेल्या मजकुरातून शिकतात. त्या मजकुरापैकी अधिकाधिक मजकूर स्वतः AI ने लिहिलेला असतो. लेखक त्याला “जंगली” AI मजकूर (wild AI text) म्हणतात: अनेक वेगवेगळ्या प्रतिरूपांनी मानवी वाचकांसाठी लिहिलेला, ऑनलाइन प्रकाशित झालेला, आणि मानवी मजकुरात मिसळून, कोणत्याही लेबलशिवाय प्रशिक्षण-माहितीत ओढला गेलेला. तो ना “प्रतिरूप-कोसळणे” (model collapse) आहे — जिथे प्रतिरूपाला त्याच्याच प्रदानावर पुन्हा प्रशिक्षित केले जाते — ना प्रशिक्षणाला मदत करण्यासाठी हेतुपुरस्सर तयार केलेली, निवडक कृत्रिम माहिती (synthetic data).

मेरीलँड विद्यापीठ आणि AI-मजकूर शोधक विकणाऱ्या Pangram Labs कंपनीतील जेना रसेल, मोहित अय्यर आणि त्यांच्या सहकाऱ्यांनी असा मजकूर किती आहे आणि तो प्रतिरूपावर काय परिणाम करतो हे मोजायचे ठरवले.

वेबवर AI किती आहे?

वेबचा प्रचंड संग्रह असलेल्या Common Crawl ची गाळणी करणाऱ्या FineWeb प्रक्रियेचा वापर करून चमूने जून 2026 पर्यंतचा संग्रह पुन्हा तयार केला: 9.6 कोटी दस्तऐवज, 83 अब्ज टोकन — टोकन म्हणजे प्रतिरूप वाचत असलेले शब्दांचे तुकडे. प्रत्येक दस्तऐवजाला कंपनीच्या Pangram या शोधकाने लेबल लावले, ज्याचा नोंदवलेला खोटा-सकारात्मक (false-positive) दर 0.05% आहे; 2022 च्या अखेरीस ChatGPT प्रसिद्ध होण्यापूर्वीच्या, 2021 मधील 60,000 दस्तऐवजांपैकी त्याने फक्त 0.062% AI म्हणून चिन्हांकित केले.

FineWeb च्या गुणवत्ता-गाळण्यांमधून पार होणाऱ्या वेब-मजकुरातील AI-लिखित टोकनचा वाटा:

  • जून 2021 मध्ये 0.1% पेक्षा कमी;
  • जून 2024 मध्ये 10.1%, जून 2025 मध्ये 16.1%;
  • जून 2026 मध्ये 27.5%, ऑगस्ट 2026 मध्ये 31.1%;
  • अंदाज: 2027 च्या अखेरीस 42.3%, 2028 च्या अखेरीस 50.7%.

ही वाढ असमान आहे. 2026 मध्ये मार्गदर्शिका (tutorial) आणि “ज्ञान-लेख” टोकनपैकी सुमारे अर्ध्यांना AI चे लेबल आहे, तर बातम्यांपैकी 9% आणि वैयक्तिक ब्लॉगपैकी 5%. त्याहून वाईट म्हणजे प्रशिक्षण-संच तयार करण्यासाठी वापरल्या जाणाऱ्या गुणवत्ता-गाळण्या AI मजकुराला झुकते माप देतात: FineWeb AI दस्तऐवज मानवी दस्तऐवजांपेक्षा 2.3 पट अधिक वेळा राखते, आणि DCLM गाळणी 9.8 पट अधिक वेळा.

800 प्रतिरूपांची कसोटी

चमूने 1.99 कोटी ते 97.3 कोटी प्राचलांची 800 लहान भाषा-प्रतिरूपे पूर्व-प्रशिक्षित केली; मानवी मजकुराच्या एका ठराविक संचात प्रति मानवी टोकन शून्य ते 64 AI टोकन मिसळले, आणि प्रत्येकाची तुलना त्याऐवजी तितकेच ताजे मानवी टोकन दिलेल्या त्याच प्रतिरूपाशी केली.

  • AI मजकुराची मदत फक्त माहितीसाठी भुकेल्या प्रतिरूपांनाच झाली, प्रति प्राचल सुमारे 10 मानवी टोकनच्या खाली.
  • प्रति प्राचल सुमारे 20 टोकन या नेहमीच्या संगणन-इष्टतम अंदाजपत्रकापासून पुढे, AI मजकूर मिसळल्याने मानवी मजकुरावरील त्रुटी वाढली, तर जादा मानवी मजकूर ती कमी करत राहिला.
  • मानवी मजकुराचे भाकीत करण्यासाठी AI मजकुराचा सर्वोत्तम वाटा प्रति प्राचल 5 टोकनवर 37% वरून 20 वर 1% पर्यंत घसरला. AI मजकुराचे भाकीत करण्यासाठी तो 90% च्या वर राहिला.
  • ताजा AI मजकूर मिसळण्यापेक्षा तोच मानवी मजकूर पुन्हा वापरणे सरस ठरले: एका जादा फेरीनंतर त्रुटी 2.3% कमी, आठ फेऱ्यांनंतर सुमारे 6.3% कमी.
  • AI मजकुरावर प्रशिक्षित प्रतिरूपे AI सारखे लिहू लागली: “delve” आणि “tapestry” सारखे शब्द दर 1,000 शब्दांमागे 0.16 वरून 0.54 पर्यंत वाढले.

सध्याचे “प्रमाण-नियम” (scaling laws) — प्रतिरूपाच्या आकारावरून आणि माहितीवरून त्याच्या त्रुटीचे भाकीत करणारी सूत्रे — AI टोकनला मानवी टोकनसारखेच मानतात आणि इथे चुकतात. लेखक एक नवा नियम सुचवतात, ज्यात फायदा संपृक्त होतो आणि हानी लघुगणकीय पद्धतीने वाढते, त्यामुळे AI टोकनचे मूल्य ऋण होऊ शकते. 26.8 कोटी प्राचलांपर्यंतच्या प्रतिरूपांवर बसवलेला हा नियम 3.6 पट मोठ्या प्रतिरूपांचे भाकीत सध्याच्या सर्वोत्तम नियमापेक्षा 41% कमी त्रुटीने करतो — मात्र परिशिष्टात नमूद आहे की AI च्या कमी वाट्याच्या दोन चाचणी-संचांवर त्याची आघाडी सांख्यिकीयदृष्ट्या लक्षणीय नाही.

न गाळण्याचे बिल

या नियमानुसार, ऑगस्ट 2026 च्या AI वाट्यासह न गाळलेल्या वेब-मजकुरावर प्रशिक्षण देण्यासाठी त्याच्या फक्त मानवी भागावर प्रशिक्षण देण्याच्या 1.6 पट संगणन-शक्ती लागते — 2028 साठी अंदाजित वाट्यावर 3.0 पट. आणि हे नुकसान सहज नजरेतून सुटते: AI मजकुराचे भाकीत करणे सोपे असते, त्यामुळे 22.3% AI मजकूर असलेल्या प्रमाणीकरण-संचाने हानिकारक प्रयत्नांपैकी 95.5% प्रयत्न सुधारणा म्हणून नोंदवले. प्रमाणित मानदंड-गुणही (benchmark scores) मानवी मजकुराइतकेच AI मजकुरानेही वाढले.

उद्दिष्ट मानवी मजकूर असेल तेव्हा AI मजकूर गाळावा, AI माहिती मिसळण्यापूर्वी मानवी माहिती पुन्हा वापरावी, आणि मानवी व AI मजकुरावरील त्रुटी वेगवेगळ्या नोंदवाव्यात, अशी शिफारस लेखक करतात. मर्यादा खऱ्या आहेत: 97.3 कोटी प्राचलांपेक्षा मोठे प्रतिरूप नाही, फक्त इंग्रजी, फक्त पूर्व-प्रशिक्षण, आणि एकच शोधक, लेखकांच्याच कंपनीने बनवलेला — ज्या कंपनीच्या व्यवसायाला हे निष्कर्ष अनुकूल आहेत. स्वतंत्र तपासणी शक्य व्हावी म्हणून ते संग्रह, सर्व 800 प्रतिरूपे आणि कोड खुले करत आहेत.

Legal notice