কম্পিউটিং ও এআইপ্রিপ্রিন্টপরীক্ষাপড়তে ৩ মিনিট

ওয়েবের প্রায় এক-তৃতীয়াংশ এখন এআই-এর লেখা

বড় ভাষা মডেলগুলো মূলত ওয়েব থেকে সংগৃহীত লেখা থেকে শেখে। সেই লেখার ক্রমশ বেশি অংশ নিজেই এআই-এর লেখা। লেখকেরা একে বলছেন “বুনো” এআই-লেখা (wild AI text): বহু ভিন্ন মডেলের লেখা, মানুষ পাঠকের জন্য, অনলাইনে প্রকাশিত, এবং প্রশিক্ষণ-তথ্যে মানব-লেখার সঙ্গে মিশে ও চিহ্নহীনভাবে ভেসে আসা। এটি “মডেল ধস” (মডেল কোল্যাপ্স) নয়, যেখানে একটি মডেলকে তার নিজের আউটপুট দিয়ে আবার প্রশিক্ষণ দেওয়া হয়, আবার প্রশিক্ষণে সাহায্যের জন্য ইচ্ছাকৃতভাবে তৈরি বাছাই করা কৃত্রিম (সিন্থেটিক) তথ্যও নয়।

ইউনিভার্সিটি অব মেরিল্যান্ড এবং এআই-লেখা শনাক্তকারী বিক্রি করা কোম্পানি Pangram Labs-এর জেনা রাসেল, মোহিত আইয়ার ও তাঁদের সহকর্মীরা মাপতে নেমেছিলেন, এমন লেখা কতখানি আছে এবং তা একটি মডেলের ওপর কী প্রভাব ফেলে।

ওয়েবে কতখানি এআই?

ওয়েবের বিশাল মহাফেজখানা Common Crawl ছেঁকে নেওয়া FineWeb প্রক্রিয়া-শৃঙ্খল ব্যবহার করে দলটি ২০২৬ সালের জুন পর্যন্ত কর্পাসটি নতুন করে তৈরি করে: ৯ কোটি ৬০ লক্ষ নথি, ৮,৩০০ কোটি টোকেন — শব্দের যে টুকরোগুলো একটি মডেল পড়ে। প্রতিটি নথি কোম্পানির শনাক্তকারী Pangram দিয়ে চিহ্নিত করা হয়, যার ঘোষিত মিথ্যা-ইতিবাচক হার ০.০৫%; ২০২২ সালের শেষে ChatGPT প্রকাশের আগের, ২০২১ সালের ৬০,০০০ নথির মধ্যে এটি মাত্র ০.০৬২%-কে এআই হিসেবে চিহ্নিত করেছে।

FineWeb-এর মান-ছাঁকনি পেরোনো ওয়েব-লেখায় এআই-লিখিত টোকেনের অংশ:

  • ২০২১ সালের জুনে ০.১%-এর কম;
  • ২০২৪ সালের জুনে ১০.১%, ২০২৫ সালের জুনে ১৬.১%;
  • ২০২৬ সালের জুনে ২৭.৫%, ২০২৬ সালের আগস্টে ৩১.১%;
  • পূর্বাভাস: ২০২৭ সালের শেষে ৪২.৩%, ২০২৮ সালের শেষে ৫০.৭%।

বৃদ্ধিটি অসম। ২০২৬ সালে টিউটোরিয়াল ও “জ্ঞানমূলক নিবন্ধের” টোকেনের প্রায় অর্ধেক এআই-চিহ্নিত, যেখানে সংবাদের ৯% ও ব্যক্তিগত ব্লগের ৫%। আরও খারাপ, প্রশিক্ষণ-সেট তৈরিতে ব্যবহৃত মান-ছাঁকনিগুলো এআই-লেখার পক্ষপাতী: FineWeb এআই-নথি রেখে দেয় মানব-নথির চেয়ে ২.৩ গুণ বেশি, আর DCLM ছাঁকনি ৯.৮ গুণ বেশি।

৮০০টি মডেলের পরীক্ষা

দলটি ১ কোটি ৯৯ লক্ষ থেকে ৯৭ কোটি ৩০ লক্ষ প্যারামিটারের ৮০০টি ছোট ভাষা মডেল প্রাক-প্রশিক্ষণ (প্রিট্রেন) দিয়েছে। তারা মানব-লেখার একটি নির্দিষ্ট সংগ্রহে প্রতি মানব টোকেনে শূন্য থেকে ৬৪টি পর্যন্ত এআই টোকেন যোগ করেছে, এবং প্রতিটিকে তুলনা করেছে একই মডেলের সঙ্গে, যাকে তার বদলে সমসংখ্যক নতুন মানব টোকেন দেওয়া হয়েছিল।

  • এআই-লেখা কেবল তথ্য-বঞ্চিত মডেলগুলোকে সাহায্য করেছে, অর্থাৎ প্রতি প্যারামিটারে প্রায় ১০টি মানব টোকেনের নিচে।
  • প্রতি প্যারামিটারে প্রায় ২০ টোকেনের প্রচলিত, গণনার দিক থেকে সর্বোত্তম বাজেট থেকে শুরু করে এআই-লেখা যোগ করলে মানব-লেখায় ভুল বেড়েছে, অথচ বাড়তি মানব-লেখা তা কমিয়ে চলেছে।
  • মানব-লেখার পূর্বাভাসের জন্য এআই-লেখার সেরা অংশ প্রতি প্যারামিটারে ৫ টোকেনে ৩৭% থেকে কমে ২০-এ ১% হয়েছে। এআই-লেখার পূর্বাভাসের জন্য এটি ৯০%-এর ওপরে থেকেছে।
  • একই মানব-লেখা পুনরাবৃত্তি করা নতুন এআই-লেখা যোগ করার চেয়ে ভালো ফল দিয়েছে: একটি বাড়তি পাঠের পর ২.৩% কম ভুল, আটটির পর প্রায় ৬.৩% কম।
  • এআই-লেখায় প্রশিক্ষিত মডেলগুলো এআই-এর মতো লিখতে শুরু করেছে: “delve” ও “tapestry”-র মতো শব্দ প্রতি ১,০০০ শব্দে ০.১৬ থেকে বেড়ে ০.৫৪ হয়েছে।

বিদ্যমান “স্কেলিং সূত্রগুলো” — যে সূত্র একটি মডেলের আকার ও তথ্য থেকে তার ভুলের পূর্বাভাস দেয় — একটি এআই টোকেনকে মানব টোকেনের মতোই ধরে, আর এখানেই ভুল করে। লেখকেরা একটি নতুন সূত্র প্রস্তাব করেছেন, যেখানে সুবিধা সম্পৃক্ত হয়ে যায় আর ক্ষতি লগারিদমীয় হারে বাড়ে, ফলে একটি এআই টোকেনের মূল্য ঋণাত্মক হয়ে যেতে পারে। ২৬ কোটি ৮০ লক্ষ প্যারামিটার পর্যন্ত মডেলের ওপর মেলানো এই সূত্রটি ৩.৬ গুণ বড় মডেলের পূর্বাভাস দেয় বিদ্যমান সেরা সূত্রের চেয়ে ৪১% কম ভুলে, যদিও পরিশিষ্টে উল্লেখ আছে যে কম এআই-অংশের দুটি পরীক্ষা-সেটে এর এগিয়ে থাকা পরিসংখ্যানগতভাবে তাৎপর্যপূর্ণ নয়।

না ছাঁকার মাশুল

এই সূত্র অনুযায়ী, ২০২৬ সালের আগস্টের এআই-অংশসহ না-ছাঁকা ওয়েব-লেখায় প্রশিক্ষণ দিতে শুধু তার মানব অংশে প্রশিক্ষণের তুলনায় ১.৬ গুণ গণনাশক্তি লাগে — আর ২০২৮ সালের পূর্বাভাসিত অংশে ৩.০ গুণ। আর ক্ষতিটি সহজেই চোখ এড়িয়ে যায়: এআই-লেখার পূর্বাভাস দেওয়া সহজতর, তাই ২২.৩% এআই-লেখাসহ একটি যাচাই-সেট ক্ষতিকর রানগুলোর ৯৫.৫%-কে উন্নতি হিসেবে দেখিয়েছে। প্রচলিত বেঞ্চমার্ক স্কোরও এআই-লেখায় মোটামুটি ততটাই বেড়েছে, যতটা মানব-লেখায়।

লেখকেরা সুপারিশ করেছেন, লক্ষ্য যখন মানব-লেখা, তখন এআই-লেখা ছেঁকে ফেলা উচিত, এআই-তথ্য যোগ করার আগে মানব-তথ্য পুনরাবৃত্তি করা উচিত, এবং মানব-লেখা ও এআই-লেখায় ভুল আলাদা করে জানানো উচিত। সীমাবদ্ধতাগুলো বাস্তব: ৯৭ কোটি ৩০ লক্ষ প্যারামিটারের বেশি বড় কোনো মডেল নেই, কেবল ইংরেজি, কেবল প্রাক-প্রশিক্ষণ, এবং একটিমাত্র শনাক্তকারী, যা লেখকদের কোম্পানির তৈরি — যার ব্যবসার পক্ষে এই সিদ্ধান্তগুলো যায়। স্বাধীন যাচাইয়ের সুযোগ দিতে তাঁরা কর্পাস, ৮০০টি মডেলের সবগুলো এবং কোড প্রকাশ করছেন।

Legal notice