கணினியியல் & செயற்கை நுண்ணறிவுமுன்பதிப்புசோதனைபடிக்க 3 நிமிடங்கள்

இணையத்தில் கிட்டத்தட்ட மூன்றில் ஒரு பங்கை இப்போது AI எழுதுகிறது

பெரிய மொழி மாதிரிகள் பெரும்பாலும் இணையத்தில் சேகரிக்கப்பட்ட உரையிலிருந்து கற்கின்றன. அந்த உரையில் மேலும் மேலும் அதிகமானவை தாமே AI-யால் எழுதப்பட்டவை. ஆசிரியர்கள் இதை “காட்டு” AI உரை (wild AI text) என்கின்றனர்: மனித வாசகர்களுக்காகப் பல்வேறு மாதிரிகளால் எழுதப்பட்டு, இணையத்தில் வெளியிடப்பட்டு, மனித உரையுடன் கலந்து, அடையாளமிடப்படாமல் பயிற்சித் தரவுக்குள் அள்ளப்படுவது. இது ஒரு மாதிரி தனது சொந்த வெளியீட்டிலேயே மீண்டும் பயிற்றுவிக்கப்படும் “மாதிரிச் சரிவு” (model collapse) அல்ல; பயிற்சிக்கு உதவுவதற்காக வேண்டுமென்றே உருவாக்கப்பட்டுத் தேர்ந்தெடுக்கப்படும் செயற்கைத் தரவும் (synthetic data) அல்ல.

மேரிலாந்து பல்கலைக்கழகத்திலும், AI-உரைக் கண்டறிவி ஒன்றை விற்கும் Pangram Labs நிறுவனத்திலும் உள்ள ஜென்னா ரஸ்ஸல் (Jenna Russell), மோஹித் ஐயர் (Mohit Iyyer) மற்றும் சக ஆய்வாளர்கள், இந்த உரை எவ்வளவு உள்ளது, அது ஒரு மாதிரிக்கு என்ன செய்கிறது என்பதை அளக்கப் புறப்பட்டனர்.

இணையத்தில் எவ்வளவு AI?

இணையத்தின் மாபெரும் Common Crawl காப்பகத்தை வடிகட்டும் FineWeb செயல்முறையைப் பயன்படுத்தி, குழு ஜூன் 2026 வரையிலான தொகுப்பை மீண்டும் உருவாக்கியது: 96 மில்லியன் ஆவணங்கள், 83 பில்லியன் டோக்கன்கள் — ஒரு மாதிரி படிக்கும் சொல் துண்டுகள். ஒவ்வொரு ஆவணமும் நிறுவனத்தின் கண்டறிவியான Pangram மூலம் அடையாளமிடப்பட்டது; அதன் அறிவிக்கப்பட்ட தவறான நேர்மறை வீதம் (false-positive rate) 0.05%; 2022 இறுதியில் ChatGPT வெளியாவதற்கு முன்பான 2021-ஆம் ஆண்டின் 60,000 ஆவணங்களில், அது 0.062%-ஐ மட்டுமே AI எனக் குறித்தது.

FineWeb-இன் தர வடிகட்டிகளைக் கடக்கும் இணைய உரையில் AI எழுதிய டோக்கன்களின் பங்கு:

  • ஜூன் 2021-இல் 0.1%-க்கும் குறைவு;
  • ஜூன் 2024-இல் 10.1%, ஜூன் 2025-இல் 16.1%;
  • ஜூன் 2026-இல் 27.5%, ஆகஸ்ட் 2026-இல் 31.1%;
  • முன்கணிப்பு: 2027 இறுதியில் 42.3%, 2028 இறுதியில் 50.7%.

இந்த உயர்வு சீரானதல்ல. 2026-இல் பயிற்சிக் குறிப்புகள் (tutorials) மற்றும் “அறிவுக் கட்டுரை” டோக்கன்களில் சுமார் பாதி AI என அடையாளமிடப்பட்டுள்ளன; செய்திகளில் இது 9%, தனிப்பட்ட வலைப்பதிவுகளில் 5%. அதைவிட மோசம், பயிற்சித் தொகுப்புகளை உருவாக்கப் பயன்படும் தர வடிகட்டிகள் AI உரைக்குச் சாதகமாக உள்ளன: FineWeb மனித ஆவணங்களைவிட 2.3 மடங்கு அடிக்கடி AI ஆவணங்களைத் தக்கவைக்கிறது; DCLM வடிகட்டி 9.8 மடங்கு.

சோதனைக்கு உட்படுத்தப்பட்ட 800 மாதிரிகள்

குழு 19.9 மில்லியன் முதல் 973 மில்லியன் அளவுருக்கள் (parameters) வரையிலான 800 சிறிய மொழி மாதிரிகளை முன்பயிற்சி (pretraining) செய்தது; மனித உரையின் ஒரு நிலையான தொகுப்புடன், ஒவ்வொரு மனித டோக்கனுக்கும் பூஜ்யம் முதல் 64 AI டோக்கன்கள் வரை சேர்த்து, ஒவ்வொன்றையும், அதற்குப் பதிலாக அதே எண்ணிக்கையிலான புதிய மனித டோக்கன்கள் கொடுக்கப்பட்ட அதே மாதிரியுடன் ஒப்பிட்டது.

  • AI உரை தரவுப் பற்றாக்குறை உள்ள மாதிரிகளுக்கு மட்டுமே உதவியது, அதாவது ஒரு அளவுருவுக்குச் சுமார் 10 மனித டோக்கன்களுக்குக் கீழே.
  • ஒரு அளவுருவுக்குச் சுமார் 20 டோக்கன்கள் என்ற வழக்கமான கணினி-உகந்த (compute-optimal) வரம்பிலிருந்து, AI உரையைச் சேர்ப்பது மனித உரையில் பிழையை அதிகரித்தது; கூடுதல் மனித உரையோ தொடர்ந்து அதைக் குறைத்தது.
  • மனித உரையை முன்கணிக்க AI உரையின் சிறந்த பங்கு, ஒரு அளவுருவுக்கு 5 டோக்கன்களில் 37%-இலிருந்து 20-இல் 1%-ஆகக் குறைந்தது. AI உரையை முன்கணிக்க, அது 90%-க்கு மேல் நீடித்தது.
  • புதிய AI உரையைச் சேர்ப்பதைவிட அதே மனித உரையை மீண்டும் பயன்படுத்துவது சிறந்தது: ஒரு கூடுதல் சுற்றுக்குப் பின் 2.3% குறைவான பிழை, எட்டுச் சுற்றுகளுக்குப் பின் சுமார் 6.3%.
  • AI உரையில் பயிற்றுவிக்கப்பட்ட மாதிரிகள் AI போலவே எழுதத் தொடங்கின: “delve”, “tapestry” போன்ற சொற்கள் 1,000 சொற்களுக்கு 0.16-இலிருந்து 0.54-ஆக உயர்ந்தன.

ஒரு மாதிரியின் பிழையை அதன் அளவு மற்றும் தரவிலிருந்து முன்கணிக்கும் சூத்திரங்களான தற்போதைய “அளவீட்டு விதிகள்” (scaling laws), ஒரு AI டோக்கனை மனித டோக்கனைப் போலவே கருதுவதால் இதில் தவறிழைக்கின்றன. ஆசிரியர்கள் ஒரு புதிய விதியை முன்மொழிகின்றனர்: அதில் நன்மை ஒரு கட்டத்தில் தேக்கமடைகிறது, தீங்கு மடக்கை (logarithmic) முறையில் வளர்கிறது; இதனால் ஒரு AI டோக்கனின் மதிப்பு எதிர்மறையாக மாறக்கூடும். 268 மில்லியன் அளவுருக்கள் வரையிலான மாதிரிகளில் பொருத்தப்பட்ட இந்த விதி, 3.6 மடங்கு பெரிய மாதிரிகளை, தற்போதுள்ள சிறந்த விதியைவிட 41% குறைவான பிழையுடன் முன்கணிக்கிறது; எனினும் குறைந்த AI பங்குகளில் இரண்டு சோதனைத் தொகுப்புகளில் அதன் முன்னிலை புள்ளியியல் ரீதியாக முக்கியமானதல்ல என்று பின்னிணைப்பு குறிப்பிடுகிறது.

வடிகட்டாததற்கான கட்டணம்

இந்த விதியின்படி, ஆகஸ்ட் 2026-இன் AI பங்கில் வடிகட்டப்படாத இணைய உரையில் பயிற்றுவிப்பது, அதன் மனிதப் பகுதியில் மட்டும் பயிற்றுவிப்பதைவிட 1.6 மடங்கு கணினித் திறனைச் செலவழிக்கிறது — 2028-க்கு முன்கணிக்கப்பட்ட பங்கில் 3.0 மடங்கு. மேலும் இந்தச் சேதத்தைக் கவனிக்காமல் விடுவது எளிது: AI உரையை முன்கணிப்பது எளிது என்பதால், 22.3% AI உரை கொண்ட ஒரு சரிபார்ப்புத் தொகுப்பு (validation set) தீங்கான ஓட்டங்களில் 95.5%-ஐ முன்னேற்றங்களாகக் காட்டியது. வழக்கமான தரநிலைச் சோதனை (benchmark) மதிப்பெண்களும் மனித உரையுடன் உயர்ந்த அளவுக்கே AI உரையுடனும் உயர்ந்தன.

இலக்கு மனித உரையாக இருக்கும்போது AI உரையை வடிகட்டவும், AI தரவைச் சேர்ப்பதற்கு முன் மனிதத் தரவை மீண்டும் பயன்படுத்தவும், மனித உரை மற்றும் AI உரையில் பிழைகளைத் தனித்தனியாக அறிவிக்கவும் ஆசிரியர்கள் பரிந்துரைக்கின்றனர். வரம்புகள் உண்மையானவை: 973 மில்லியன் அளவுருக்களுக்கு மேல் இல்லாத மாதிரிகள், ஆங்கிலம் மட்டும், முன்பயிற்சி மட்டும், மேலும் ஒரே ஒரு கண்டறிவி — அதுவும் ஆசிரியர்களின் நிறுவனமே தயாரித்தது, இந்த முடிவுகள் அதன் வணிகத்துக்குச் சாதகமானவை. சுயாதீனச் சரிபார்ப்புகளை அனுமதிக்க, அவர்கள் தொகுப்பையும், 800 மாதிரிகள் அனைத்தையும், நிரலையும் வெளியிடுகின்றனர்.

Legal notice