समकक्ष-समीक्षा की लॉटरी
विज्ञान समकक्ष-समीक्षा (पीयर रिव्यू) पर चलता है: किसी नतीजे के प्रकाशित होने से पहले, दूसरे विशेषज्ञ उसे परखते हैं। मशीन लर्निंग के बड़े सम्मेलनों में, मुट्ठी भर समीक्षक हर प्रस्तुति को अंक देते हैं और शोधपत्र स्वीकार या अस्वीकार होता है। इस रस्म के पीछे एक असहज सवाल छिपा है। वही शोधपत्र दूसरे समीक्षकों को भेजा जाए, तो क्या फ़ैसला वही रहेगा?
दो महँगे प्रयोग
इसके एकमात्र सीधे जवाब दो प्रयोगों से आते हैं, जिनमें किसी सम्मेलन ने कुछ शोधपत्रों की दो बार, दो स्वतंत्र समितियों से समीक्षा करवाई। शोधपत्र उनके नतीजे याद दिलाता है:
- NeurIPS 2014: दोहरी समीक्षा वाले 166 शोधपत्रों में से 43 पर दोनों समितियाँ असहमत रहीं — 25.9 प्रतिशत। एक समिति द्वारा स्वीकार किए गए लगभग आधे शोधपत्र दूसरी समिति अस्वीकार कर देती।
- NeurIPS 2021: 882 शोधपत्रों पर समितियाँ 23.0 प्रतिशत मामलों में असहमत रहीं।
ऐसे प्रयोग दुर्लभ हैं क्योंकि ये महँगे हैं: इनका मतलब है सैकड़ों शोधपत्रों की समीक्षा दोगुनी करना। एक स्वतंत्र शोधकर्ता, फ़ेइलियान हुआंग (Feilian Huang), ने पूछा कि क्या यही संख्या सिर्फ़ सार्वजनिक आँकड़ों से आँकी जा सकती है।
एक दूसरी समिति का सिमुलेशन
अध्ययन 2017 से 2025 तक ICLR सम्मेलन की सार्वजनिक समीक्षाओं का इस्तेमाल करता है: 36,113 शोधपत्र और 134,912 समीक्षाएँ। एक सांख्यिकीय मॉडल हर अंक को दो हिस्सों में बाँटता है: शोधपत्र की छिपी गुणवत्ता, और हर समीक्षक का जोड़ा गया “शोर”। दूसरा मॉडल यह दोहराता है कि अंक फ़ैसलों में कैसे बदलते हैं। फिर कंप्यूटर हर शोधपत्र के लिए दो, तीन या चार समीक्षकों वाली दो स्वतंत्र समितियों की कल्पना करता है, हज़ार बार, और गिनता है कि वे कितनी बार असहमत होती हैं।
नतीजे पर भरोसा करने से पहले, लेखक ने इसे दो बार जाँचा। NeurIPS 2021 के प्रयोग के सामने, वहाँ की तरह हर शोधपत्र पर तीन समीक्षकों के साथ, सिमुलेशन 23.3 प्रतिशत असहमति देता है, जबकि मापी गई 23.0 प्रतिशत थी। और कम से कम चार समीक्षाओं वाले ICLR शोधपत्रों पर, असली समीक्षकों को बस बेतरतीब ढंग से दो जोड़ों में बाँटने से 2018 में और 2021 से 2025 तक हर साल मॉडल जैसा ही जवाब मिलता है, एक अंक के भीतर।

अंकों के प्रसरण (वेरिएंस) का वह हिस्सा जो ख़ुद शोधपत्र से आता है, साल-दर-साल: लगभग आधा; बाक़ी समीक्षकों का शोर है। — चित्र 2, Huang (2026), arXiv:2610.06591।
लगभग हर चार में से एक शोधपत्र
अंकों के उतार-चढ़ाव का जो हिस्सा ख़ुद शोधपत्र से आता है, वह साल के हिसाब से 0.38 से 0.58 तक है — बाक़ी समीक्षकों का शोर है, जो 2014 के लगभग आधे के अनुमान से मेल खाता है। इसके नतीजे:
- हर समिति में दो समीक्षकों के साथ, 22.8 प्रतिशत (2017) से 30.3 प्रतिशत (2025) शोधपत्रों का फ़ैसला पलट जाता है। चार समीक्षकों के साथ, 17.7 से 24.2 प्रतिशत।
- स्वीकार हुए शोधपत्रों में से 30 से 50 प्रतिशत को एक स्वतंत्र समिति अस्वीकार कर देती — 2021 में आधे तक।
- नौ सालों में, जिनमें प्रस्तुतियाँ लगभग 24 गुना बढ़ीं (2017 में 489, 2025 में 11,663), अध्ययन को कोई ठोस रुझान नहीं मिलता: शोर न साफ़ तौर पर बढ़ता है, न घटता है। लेखक ज़ोर देते हैं कि सिर्फ़ नौ साल के आँकड़ों के साथ, यह किसी तेज़ रुझान के ख़िलाफ़ सबूत है, स्थिरता का प्रमाण नहीं।

दो समितियों के बीच सिमुलेटेड असहमति, NeurIPS के दो असली प्रयोगों से तुलना में। — चित्र 3, Huang (2026), arXiv:2610.06591।
पैमाना ख़ुद संयोग जोड़ता है
दो साल अलग दिखते हैं। 2020 में, ICLR ने चार स्तरों वाला एक मोटा अंक-पैमाना (1, 3, 6, 8) इस्तेमाल किया: 23.7 प्रतिशत शोधपत्रों को उनके सभी समीक्षकों से एक जैसे अंक मिले, जबकि बाक़ी सालों में यह 4.7 से 13.1 प्रतिशत था। असर परखने के लिए, लेखक ने 2021 के अंक लिए, जो 10 में से दिए गए थे, और उन्हें चार स्तरों वाले पैमाने पर फिर से कूटबद्ध किया। नतीजा: सिग्नल का लगभग 8 प्रतिशत खो जाता है, समितियों के बीच असहमति लगभग 7 अंक बढ़ जाती है, और स्वीकार हुए शोधपत्रों में पलटने वालों का हिस्सा लगभग 11 अंक बढ़ जाता है। मोटा पैमाना सिर्फ़ उन्हीं रायों पर नया लेबल नहीं लगाता; वह संयोग जोड़ता है।
2021 अलग है: पैमाना बारीक, लेकिन नौ सालों में सबसे कमज़ोर सिग्नल, और स्वीकार हुए शोधपत्रों में से 30.4 प्रतिशत स्वीकृति की दहलीज़ से ठीक ऊपर थे। रेखा के पास बहुत सारे शोधपत्र, ढेर सारा शोर: फ़ैसले आसानी से पलटते हैं।
और चैटबॉट?
अध्ययन ने 2023 के बाद समीक्षा-व्यवहार में बदलाव खोजने की योजना बनाई थी, जब भाषा मॉडल फैले। सार्वजनिक आँकड़ों में 2022 के बाद न समीक्षाओं का पाठ है, न समीक्षकों का विश्वास-स्तर, और उपलब्ध सांख्यिकीय परीक्षण की शक्ति लगभग शून्य है। इसलिए लेखक किसी भी दिशा में कोई निष्कर्ष नहीं निकालते — और इस संयम को जानबूझकर बताते हैं।
लॉटरी का ऑडिट
इस तरीक़े को सिर्फ़ अंकों और फ़ैसलों की ज़रूरत है, जो कई सम्मेलन पहले से प्रकाशित करते हैं। इनमें से कोई भी, एक भी समीक्षा दोहराए बिना, अपनी “लॉटरी” दर निकाल सकता है। ICLR के नौ सालों पर लेखक का फ़ैसला: समीक्षा न ढह रही है, न सुधर रही है — वह लगभग उसी स्तर पर शोरगुल भरी बनी हुई है। अध्ययन सिर्फ़ ICLR को कवर करता है, और इसके लेखक एक अकेले स्वतंत्र शोधकर्ता हैं।
