ویب کا تقریباً ایک تہائی حصہ اب مصنوعی ذہانت لکھتی ہے
بڑے لسانی ماڈل زیادہ تر ویب سے جمع کیے گئے متن سے سیکھتے ہیں۔ اس متن کا زیادہ سے زیادہ حصہ خود مصنوعی ذہانت کا لکھا ہوا ہے۔ مصنفین اسے “جنگلی” مصنوعی ذہانتی متن کہتے ہیں: جو بہت سے مختلف ماڈلز نے انسانی قارئین کے لیے لکھا، آن لائن شائع کیا گیا، اور انسانی متن کے ساتھ ملا جلا اور بغیر کسی لیبل کے تربیتی ڈیٹا میں بہہ آیا۔ یہ نہ تو “ماڈل کا انہدام” (model collapse) ہے، جس میں کسی ماڈل کو اس کے اپنے آؤٹ پٹ پر دوبارہ تربیت دی جاتی ہے، اور نہ ہی منتخب کردہ مصنوعی ڈیٹا (synthetic data) جو جان بوجھ کر تربیت میں مدد کے لیے بنایا جاتا ہے۔
یونیورسٹی آف میری لینڈ اور Pangram Labs — ایک کمپنی جو مصنوعی ذہانتی متن کا ڈیٹیکٹر بیچتی ہے — کے جینا رسل، موہت ایئر اور ان کے ساتھیوں نے یہ ناپنے کا بیڑا اٹھایا کہ ایسا متن کتنا ہے اور یہ کسی ماڈل پر کیا اثر ڈالتا ہے۔
ویب پر کتنی مصنوعی ذہانت ہے؟
FineWeb پائپ لائن کی مدد سے، جو ویب کے دیو ہیکل Common Crawl آرکائیو کو چھانتی ہے، ٹیم نے جون 2026 تک کا مجموعہ (corpus) دوبارہ بنایا: 9 کروڑ 60 لاکھ دستاویزات، 83 ارب ٹوکنز، یعنی الفاظ کے وہ ٹکڑے جو ماڈل پڑھتا ہے۔ ہر دستاویز پر کمپنی کے اپنے ڈیٹیکٹر Pangram سے لیبل لگایا گیا، جس کی بتائی گئی غلط مثبت (false positive) شرح 0.05% ہے؛ 2022 کے آخر میں ChatGPT کے اجرا سے پہلے کی، 2021 کی 60,000 دستاویزات میں اس نے صرف 0.062% کو مصنوعی ذہانت کا لکھا ہوا قرار دیا۔
FineWeb کے معیاری فلٹرز سے گزرنے والے ویب متن میں مصنوعی ذہانت کے لکھے ٹوکنز کا حصہ:
- جون 2021 میں 0.1% سے کم؛
- جون 2024 میں 10.1%، جون 2025 میں 16.1%؛
- جون 2026 میں 27.5%، اگست 2026 میں 31.1%؛
- پیش گوئی: 2027 کے آخر میں 42.3%، 2028 کے آخر میں 50.7%۔
یہ اضافہ ناہموار ہے۔ 2026 میں سبق آموز (tutorial) اور “معلوماتی مضامین” کے تقریباً آدھے ٹوکنز پر مصنوعی ذہانت کا لیبل ہے، جبکہ خبروں میں یہ 9% اور ذاتی بلاگز میں 5% ہے۔ اس سے بھی بری بات یہ کہ تربیتی سیٹ بنانے کے لیے استعمال ہونے والے معیاری فلٹرز مصنوعی ذہانتی متن کو ترجیح دیتے ہیں: FineWeb مصنوعی ذہانت کی دستاویزات کو انسانی دستاویزات سے 2.3 گنا زیادہ رکھتا ہے، اور DCLM فلٹر 9.8 گنا زیادہ۔
800 ماڈلز کی آزمائش
ٹیم نے 800 چھوٹے لسانی ماڈلز کی ابتدائی تربیت (pretraining) کی، جو 1 کروڑ 99 لاکھ سے 97 کروڑ 30 لاکھ پیرامیٹرز تک کے تھے، انسانی متن کے ایک مقررہ ذخیرے میں فی انسانی ٹوکن صفر سے 64 تک مصنوعی ذہانتی ٹوکنز شامل کیے، اور ہر ایک کا موازنہ اسی ماڈل سے کیا جسے اس کے بجائے اتنے ہی تازہ انسانی ٹوکنز دیے گئے۔
- مصنوعی ذہانتی متن نے صرف ڈیٹا کے بھوکے ماڈلز کی مدد کی، یعنی فی پیرامیٹر تقریباً 10 انسانی ٹوکنز سے نیچے۔
- فی پیرامیٹر تقریباً 20 ٹوکنز کے معمول کے کمپیوٹ کے لحاظ سے بہترین بجٹ سے آگے، مصنوعی ذہانتی متن شامل کرنے سے انسانی متن پر غلطی بڑھ گئی، جبکہ اضافی انسانی متن اسے کم کرتا رہا۔
- انسانی متن کی پیش گوئی کے لیے مصنوعی ذہانتی متن کا بہترین حصہ فی پیرامیٹر 5 ٹوکنز پر 37% سے گر کر 20 پر 1% رہ گیا۔ مصنوعی ذہانتی متن کی پیش گوئی کے لیے یہ 90% سے اوپر رہا۔
- ایک ہی انسانی متن کو دہرانا تازہ مصنوعی ذہانتی متن شامل کرنے سے بہتر رہا: ایک اضافی دور کے بعد غلطی 2.3% کم، آٹھ کے بعد تقریباً 6.3% کم۔
- مصنوعی ذہانتی متن پر تربیت یافتہ ماڈلز مصنوعی ذہانت کی طرح لکھنے لگے: “delve” اور “tapestry” جیسے الفاظ فی 1,000 الفاظ 0.16 سے بڑھ کر 0.54 ہو گئے۔
موجودہ “پیمائشی قوانین” (scaling laws) — وہ فارمولے جو کسی ماڈل کی غلطی اس کے حجم اور ڈیٹا سے پیش گوئی کرتے ہیں — مصنوعی ذہانتی ٹوکن کو انسانی ٹوکن جیسا سمجھتے ہیں اور اسی لیے یہاں غلطی کرتے ہیں۔ مصنفین ایک نیا قانون تجویز کرتے ہیں جس میں فائدہ ایک حد پر جا کر رک جاتا ہے اور نقصان لوگارتھمی انداز میں بڑھتا ہے، اس لیے مصنوعی ذہانتی ٹوکن کی قدر منفی ہو سکتی ہے۔ 26 کروڑ 80 لاکھ پیرامیٹرز تک کے ماڈلز پر فٹ کیا گیا یہ قانون 3.6 گنا بڑے ماڈلز کی پیش گوئی بہترین موجودہ قانون کے مقابلے میں 41% کم غلطی کے ساتھ کرتا ہے، اگرچہ ضمیمہ نوٹ کرتا ہے کہ مصنوعی ذہانت کے کم حصے والے دو ٹیسٹ سیٹس پر اس کی برتری معنی خیز (significant) نہیں۔
نہ چھاننے کا بل
اس قانون کے مطابق اگست 2026 کے مصنوعی ذہانتی حصے پر بغیر چھانے ویب متن سے تربیت کرنے میں، صرف اس کے انسانی حصے سے تربیت کے مقابلے میں 1.6 گنا کمپیوٹنگ طاقت لگتی ہے — 2028 کے پیش گوئی شدہ حصے پر 3.0 گنا۔ اور نقصان آسانی سے نظر سے اوجھل رہ جاتا ہے: مصنوعی ذہانتی متن کی پیش گوئی آسان ہوتی ہے، اس لیے 22.3% مصنوعی ذہانتی متن والے ایک توثیقی (validation) سیٹ نے نقصان دہ دوروں میں سے 95.5% کو بہتری کے طور پر دکھایا۔ معیاری بینچ مارک اسکور بھی مصنوعی ذہانتی متن سے تقریباً اتنے ہی بڑھے جتنے انسانی متن سے۔
مصنفین سفارش کرتے ہیں کہ جب مقصد انسانی متن ہو تو مصنوعی ذہانتی متن کو چھان کر نکالا جائے، مصنوعی ذہانتی ڈیٹا شامل کرنے سے پہلے انسانی ڈیٹا کو دہرایا جائے، اور انسانی اور مصنوعی ذہانتی متن پر غلطیاں الگ الگ بتائی جائیں۔ حدود حقیقی ہیں: 97 کروڑ 30 لاکھ پیرامیٹرز سے بڑے ماڈل نہیں، صرف انگریزی، صرف ابتدائی تربیت، اور صرف ایک ڈیٹیکٹر، جو مصنفین کی اپنی کمپنی کا بنایا ہوا ہے — جس کے کاروبار کو یہ نتائج فائدہ پہنچاتے ہیں۔ آزادانہ جانچ ممکن بنانے کے لیے وہ مجموعہ، تمام 800 ماڈلز اور کوڈ جاری کر رہے ہیں۔
