الذكاء الاصطناعي يكتب الآن قرابة ثلث الويب
تتعلّم النماذج اللغوية الكبيرة في الغالب من نصوص تُجمع من الويب. وتتزايد حصة هذه النصوص التي يكتبها الذكاء الاصطناعي نفسه. ويسمّيها المؤلفون نصوص الذكاء الاصطناعي “البرّية” (wild): نصوص كتبتها نماذج كثيرة مختلفة لقرّاء من البشر، ونُشرت على الإنترنت، ثم جُرفت إلى بيانات التدريب مختلطة بالنص البشري ودون أي وسم. وهي ليست “انهيار النموذج”، حيث يُعاد تدريب نموذج على مخرجاته هو، ولا البيانات الاصطناعية المنتقاة التي تُنتَج عمدًا للمساعدة في التدريب.
وشرعت جينا راسل وموهيت آيير وزملاؤهما في جامعة ميريلاند وفي Pangram Labs، وهي شركة تبيع كاشفًا لنصوص الذكاء الاصطناعي، في قياس حجم هذه النصوص وما تفعله بالنموذج.
كم من الذكاء الاصطناعي على الويب؟
باستخدام سلسلة المعالجة FineWeb، التي ترشّح الأرشيف الضخم للويب Common Crawl، أعاد الفريق بناء المدوّنة حتى يونيو 2026: 96 مليون وثيقة، و83 مليار وحدة نصية (tokens)، وهي أجزاء الكلمات التي يقرؤها النموذج. ووُسمت كل وثيقة بكاشف الشركة، Pangram، الذي يبلغ معدل إيجابياته الكاذبة المعلَن 0.05%؛ ومن بين 60,000 وثيقة تعود إلى 2021، أي قبل إطلاق ChatGPT أواخر 2022، لم يصنّف سوى 0.062% على أنها من الذكاء الاصطناعي.
حصة الوحدات النصية المكتوبة بالذكاء الاصطناعي في نصوص الويب التي تجتاز مرشّحات الجودة في FineWeb:
- أقل من 0.1% في يونيو 2021؛
- 10.1% في يونيو 2024، و16.1% في يونيو 2025؛
- 27.5% في يونيو 2026، و31.1% في أغسطس 2026؛
- التوقعات: 42.3% في نهاية 2027، و50.7% في نهاية 2028.
والارتفاع غير متساوٍ. ففي 2026، يُوسم نحو نصف الوحدات النصية في الدروس التعليمية و“المقالات المعرفية” على أنها من الذكاء الاصطناعي، مقابل 9% في الأخبار و5% في المدوّنات الشخصية. والأسوأ أن مرشّحات الجودة المستخدمة في بناء مجموعات التدريب تحابي نصوص الذكاء الاصطناعي: إذ يحتفظ FineWeb بوثائق الذكاء الاصطناعي 2.3 مرة أكثر من الوثائق البشرية، ومرشّح DCLM 9.8 مرة أكثر.
800 نموذج تحت الاختبار
درّب الفريق تدريبًا مسبقًا 800 نموذج لغوي صغير، يتراوح حجمها بين 19.9 مليون و973 مليون معامل، مضيفًا ما بين صفر و64 وحدة نصية من الذكاء الاصطناعي لكل وحدة بشرية إلى مجموعة ثابتة من النصوص البشرية، وقارن كلًّا منها بالنموذج نفسه وقد أُعطي بدلًا من ذلك العدد نفسه من الوحدات البشرية الجديدة.
- لم يساعد نص الذكاء الاصطناعي إلا النماذج المتعطشة للبيانات، دون نحو 10 وحدات بشرية لكل معامل.
- وابتداءً من الميزانية المعتادة المثلى حوسبيًا البالغة نحو 20 وحدة نصية لكل معامل، أدّت إضافة نص الذكاء الاصطناعي إلى زيادة الخطأ على النص البشري، في حين ظل النص البشري الإضافي يخفّضه.
- انخفضت أفضل حصة لنص الذكاء الاصطناعي للتنبؤ بالنص البشري من 37% عند 5 وحدات لكل معامل إلى 1% عند 20. أما للتنبؤ بنص الذكاء الاصطناعي، فبقيت فوق 90%.
- تفوّق تكرار النص البشري نفسه على إضافة نص جديد من الذكاء الاصطناعي: خطأ أقل بنسبة 2.3% بعد مرور إضافي واحد، ونحو 6.3% بعد ثمانية.
- النماذج المدرَّبة على نص الذكاء الاصطناعي بدأت تكتب مثل الذكاء الاصطناعي: إذ ارتفعت عبارات مثل “delve” و“tapestry” من 0.16 إلى 0.54 لكل 1,000 كلمة.
أما “قوانين التوسّع” القائمة، وهي صيغ تتنبأ بخطأ النموذج انطلاقًا من حجمه وبياناته، فتعامل الوحدة النصية من الذكاء الاصطناعي كالوحدة البشرية، وتخطئ في ذلك. ويقترح المؤلفون قانونًا جديدًا تتشبّع فيه الفائدة ويتزايد فيه الضرر لوغاريتميًا، بحيث يمكن لقيمة الوحدة النصية من الذكاء الاصطناعي أن تصبح سالبة. وبعد ملاءمته على نماذج تصل إلى 268 مليون معامل، يتنبأ بأداء نماذج أكبر بـ3.6 مرة بخطأ أقل بنسبة 41% من أفضل قانون قائم، وإن كان الملحق يشير إلى أن تفوّقه ليس ذا دلالة إحصائية على مجموعتي اختبار ذواتي حصص منخفضة من الذكاء الاصطناعي.
فاتورة عدم الترشيح
وفقًا لهذا القانون، يكلّف التدريب على نصوص ويب غير مرشَّحة بحصة الذكاء الاصطناعي في أغسطس 2026 1.6 مرة القدرة الحوسبية اللازمة للتدريب على جزئها البشري وحده، و3.0 مرات بالحصة المتوقعة لعام 2028. والضرر يسهل أن يفوت الملاحظة: فنص الذكاء الاصطناعي أسهل في التنبؤ، ولذا أظهرت مجموعة تحقّق تضم 22.3% من نص الذكاء الاصطناعي 95.5% من عمليات التدريب الضارة على أنها تحسينات. كما ارتفعت نتائج اختبارات المقارنة المعيارية مع نص الذكاء الاصطناعي بقدر ارتفاعها مع النص البشري تقريبًا.
ويوصي المؤلفون بترشيح نص الذكاء الاصطناعي حين يكون الهدف هو النص البشري، وبتكرار البيانات البشرية قبل إضافة بيانات الذكاء الاصطناعي، وبالإبلاغ عن الأخطاء على النص البشري ونص الذكاء الاصطناعي كلٌّ على حدة. والحدود حقيقية: نماذج لا يتجاوز حجمها 973 مليون معامل، والإنجليزية وحدها، والتدريب المسبق وحده، وكاشف واحد، من صنع شركة المؤلفين، التي تخدم هذه الاستنتاجات تجارتها. ولإتاحة التحقق المستقل، ينشرون المدوّنة والنماذج الثمانمئة كلها والشيفرة.
