সহকর্মী-পর্যালোচনার লটারি
বিজ্ঞান চলে সহকর্মী-পর্যালোচনার ওপর: কোনো ফলাফল প্রকাশের আগে অন্য বিশেষজ্ঞরা তার বিচার করেন। মেশিন লার্নিংয়ের বড় সম্মেলনগুলোতে, মুষ্টিমেয় পর্যালোচক প্রতিটি জমা দেওয়া গবেষণাপত্রকে নম্বর দেন, আর সেটি গৃহীত বা প্রত্যাখ্যাত হয়। এই আচারের পেছনে লুকিয়ে আছে একটি অস্বস্তিকর প্রশ্ন। একই গবেষণাপত্র অন্য পর্যালোচকদের পাঠালে, রায় কি একই থাকত?
দুটি ব্যয়বহুল পরীক্ষা
একমাত্র সরাসরি উত্তর আসে দুটি পরীক্ষা থেকে, যেখানে একটি সম্মেলন কিছু গবেষণাপত্র দুটি স্বাধীন কমিটি দিয়ে দুবার পর্যালোচনা করেছিল। গবেষণাপত্রটি তাদের ফলাফল মনে করিয়ে দেয়:
- NeurIPS 2014: দুবার পর্যালোচিত ১৬৬টি গবেষণাপত্রের মধ্যে ৪৩টিতে দুই কমিটি একমত হয়নি — ২৫.৯ শতাংশ। এক কমিটির গৃহীত গবেষণাপত্রের প্রায় অর্ধেক অন্য কমিটি প্রত্যাখ্যান করত।
- NeurIPS 2021: ৮৮২টি গবেষণাপত্রে কমিটিগুলোর মতভেদ ছিল ২৩.০ শতাংশ।
এমন পরীক্ষা বিরল কারণ এগুলো ব্যয়বহুল: এর মানে শত শত গবেষণাপত্রের পর্যালোচনা দ্বিগুণ করা। স্বাধীন গবেষক ফেইলিয়ান হুয়াং (Feilian Huang) প্রশ্ন তুলেছেন, একই সংখ্যা কি শুধু প্রকাশ্য তথ্য থেকে অনুমান করা যায়?
দ্বিতীয় একটি কমিটির সিমুলেশন
গবেষণাটি ২০১৭ থেকে ২০২৫ পর্যন্ত ICLR সম্মেলনের প্রকাশ্য পর্যালোচনা ব্যবহার করে: ৩৬,১১৩টি গবেষণাপত্র ও ১,৩৪,৯১২টি পর্যালোচনা। একটি পরিসংখ্যানগত মডেল প্রতিটি নম্বরকে দুই ভাগে ভাগ করে: গবেষণাপত্রের লুকানো মান, আর প্রতিটি পর্যালোচকের যোগ করা “গোলমাল” (নয়েজ)। দ্বিতীয় একটি মডেল দেখায় নম্বর কীভাবে সিদ্ধান্তে পরিণত হয়। তারপর কম্পিউটার প্রতিটি গবেষণাপত্রের জন্য দুই, তিন বা চারজন পর্যালোচকের দুটি স্বাধীন কমিটি কল্পনা করে, হাজারবার, এবং গোনে কতবার তারা একমত হয় না।
ফলাফলে আস্থা রাখার আগে লেখক এটি দুবার যাচাই করেছেন। NeurIPS 2021 পরীক্ষার বিপরীতে, সেখানকার মতো প্রতিটি গবেষণাপত্রে তিনজন পর্যালোচক নিয়ে, সিমুলেশন ২৩.৩ শতাংশ মতভেদ দেয়, যেখানে মাপা হয়েছিল ২৩.০ শতাংশ। আর অন্তত চারটি পর্যালোচনাসহ ICLR গবেষণাপত্রে, আসল পর্যালোচকদের এলোমেলোভাবে দুই জোড়ায় ভাগ করলেই ২০১৮ সালে এবং ২০২১ থেকে ২০২৫-এর প্রতি বছরে মডেলের মতোই উত্তর পাওয়া যায়, এক পয়েন্টের মধ্যে।

নম্বরের ভেদাঙ্কের যে অংশ গবেষণাপত্রের নিজের কারণে, বছর বছর: প্রায় অর্ধেক; বাকিটা পর্যালোচকের গোলমাল। — চিত্র ২, Huang (2026), arXiv:2610.06591।
প্রায় প্রতি চারটির একটি
নম্বরের তারতম্যের যে অংশ গবেষণাপত্র থেকেই আসে, তা বছরভেদে ০.৩৮ থেকে ০.৫৮ — বাকিটা পর্যালোচকের গোলমাল, যা ২০১৪ সালের প্রায় অর্ধেকের অনুমানের সঙ্গে মেলে। এর পরিণতি:
- প্রতি কমিটিতে দুজন পর্যালোচক থাকলে, ২২.৮ শতাংশ (২০১৭) থেকে ৩০.৩ শতাংশ (২০২৫) গবেষণাপত্রের সিদ্ধান্ত উল্টে যায়। চারজন থাকলে, ১৭.৭ থেকে ২৪.২ শতাংশ।
- গৃহীত গবেষণাপত্রের ৩০ থেকে ৫০ শতাংশ একটি স্বাধীন কমিটি প্রত্যাখ্যান করত — ২০২১ সালে অর্ধেক পর্যন্ত।
- যে নয় বছরে জমা পড়া গবেষণাপত্র প্রায় ২৪ গুণ বেড়েছে (২০১৭ সালে ৪৮৯, ২০২৫ সালে ১১,৬৬৩), গবেষণাটি কোনো দৃঢ় প্রবণতা পায়নি: গোলমাল স্পষ্টভাবে বাড়েও না, কমেও না। লেখক জোর দেন, মাত্র নয় বছরের তথ্যে এটি একটি শক্ত প্রবণতার বিরুদ্ধে প্রমাণ, স্থিতিশীলতার প্রমাণ নয়।

দুটি কমিটির মধ্যে সিমুলেটেড মতভেদ, NeurIPS-এর দুটি আসল পরীক্ষার সঙ্গে তুলনায়। — চিত্র ৩, Huang (2026), arXiv:2610.06591।
মাপকাঠি নিজেই আকস্মিকতা যোগ করে
দুটি বছর আলাদা চোখে পড়ে। ২০২০ সালে ICLR চার ধাপের একটি মোটা নম্বর-মাপকাঠি (১, ৩, ৬, ৮) ব্যবহার করেছিল: ২৩.৭ শতাংশ গবেষণাপত্র তাদের সব পর্যালোচকের কাছ থেকে একই নম্বর পেয়েছিল, অন্য বছরগুলোতে যেখানে ৪.৭ থেকে ১৩.১ শতাংশ। প্রভাবটি যাচাই করতে, লেখক ২০২১ সালের ১০-এর মধ্যে দেওয়া নম্বরগুলো নিয়ে চার ধাপের মাপকাঠিতে পুনঃসংকেতায়িত করেছেন। ফল: সংকেতের প্রায় ৮ শতাংশ হারিয়ে যায়, কমিটিগুলোর মধ্যে মতভেদ প্রায় ৭ পয়েন্ট বাড়ে, আর গৃহীত গবেষণাপত্রের মধ্যে যেগুলো উল্টে যেত তাদের অংশ প্রায় ১১ পয়েন্ট বাড়ে। মোটা মাপকাঠি শুধু একই মতামতে নতুন লেবেল লাগায় না; এটি আকস্মিকতা যোগ করে।
২০২১ ভিন্ন: মাপকাঠি সূক্ষ্ম, কিন্তু নয় বছরের মধ্যে সবচেয়ে দুর্বল সংকেত, আর গৃহীত গবেষণাপত্রের ৩০.৪ শতাংশ গ্রহণের সীমার ঠিক ওপরে ছিল। সীমারেখার কাছে অনেক গবেষণাপত্র, প্রচুর গোলমাল: সহজেই উল্টে যাওয়া সিদ্ধান্ত।
আর চ্যাটবট?
গবেষণাটি ২০২৩ সালের পর, যখন ভাষা মডেল ছড়িয়ে পড়ে, পর্যালোচনার আচরণে পরিবর্তন খোঁজার পরিকল্পনা করেছিল। প্রকাশ্য তথ্যে ২০২২-এর পর পর্যালোচনার পাঠ বা পর্যালোচকের আস্থা-মাত্রা নেই, আর উপলব্ধ পরিসংখ্যানগত পরীক্ষার ক্ষমতা প্রায় শূন্য। তাই লেখক কোনো দিকেই কোনো সিদ্ধান্ত টানেন না — এবং এই সংযমকে ইচ্ছাকৃত বলে উপস্থাপন করেন।
লটারির নিরীক্ষা
পদ্ধতিটির শুধু নম্বর ও সিদ্ধান্ত লাগে, যা কয়েকটি সম্মেলন ইতিমধ্যে প্রকাশ করে। তাদের যেকোনোটি একটিও পর্যালোচনা পুনরাবৃত্তি না করে নিজস্ব “লটারি” হার হিসাব করতে পারে। ICLR-এর নয় বছর নিয়ে লেখকের রায়: পর্যালোচনা ধসে পড়ছে না, উন্নতও হচ্ছে না — এটি মোটামুটি একই মাত্রায় গোলমালপূর্ণ থেকে যাচ্ছে। গবেষণাটি শুধু ICLR নিয়ে, আর এর লেখক একজন একক স্বাধীন গবেষক।
