संगणन आणि एआयप्रीप्रिंटडेटा विश्लेषणवाचनासाठी ३ मिनिटे

समकक्ष पुनरावलोकनाची लॉटरी

विज्ञान समकक्ष पुनरावलोकनावर (peer review) चालते: एखादा निकाल प्रकाशित होण्याआधी, इतर तज्ज्ञ त्याचे मूल्यमापन करतात. मशीन लर्निंगच्या मोठ्या परिषदांमध्ये, मूठभर पुनरावलोकनकर्ते प्रत्येक सादरीकरणाला गुण देतात आणि शोधनिबंध स्वीकारला किंवा नाकारला जातो. या विधीमागे एक अस्वस्थ करणारा प्रश्न दडलेला आहे. तोच शोधनिबंध इतर पुनरावलोकनकर्त्यांकडे पाठवला, तर निर्णय तोच असेल का?

दोन महागडे प्रयोग

थेट उत्तरे फक्त अशा दोन प्रयोगांतून मिळतात ज्यांत एका परिषदेने काही शोधनिबंधांचे, दोन स्वतंत्र समित्यांद्वारे, दोनदा पुनरावलोकन केले. शोधनिबंध त्यांचे निकाल आठवतो:

  • NeurIPS 2014: दोनदा तपासलेल्या 166 शोधनिबंधांपैकी 43 बाबत दोन समित्यांमध्ये मतभेद झाले — 25.9 टक्के. एका समितीने स्वीकारलेले साधारण निम्मे शोधनिबंध दुसरीने नाकारले असते.
  • NeurIPS 2021: 882 शोधनिबंधांपैकी 23.0 टक्क्यांबाबत समित्यांत मतभेद झाले.

असे प्रयोग दुर्मिळ आहेत कारण ते खर्चिक असतात: त्यांचा अर्थ शेकडो शोधनिबंधांचे पुनरावलोकन दुप्पट करणे. फेइलियान हुआंग (Feilian Huang) या स्वतंत्र संशोधकाने विचारले की हीच संख्या फक्त सार्वजनिक डेटावरून अंदाजता येईल का.

दुसऱ्या समितीचे सिम्युलेशन

अभ्यास 2017 ते 2025 मधील ICLR परिषदेची सार्वजनिक पुनरावलोकने वापरतो: 36,113 शोधनिबंध आणि 134,912 पुनरावलोकने. एक सांख्यिकीय प्रारूप प्रत्येक गुणाचे दोन भाग करते: शोधनिबंधाची लपलेली गुणवत्ता, आणि प्रत्येक पुनरावलोकनकर्त्याने घातलेला “गोंगाट” (noise). दुसरे प्रारूप गुणांचे निर्णयांत रूपांतर कसे होते ते पुन्हा साकारते. मग संगणक प्रत्येक शोधनिबंधासाठी दोन, तीन किंवा चार पुनरावलोकनकर्त्यांच्या दोन स्वतंत्र समित्यांची हजार वेळा कल्पना करतो, आणि त्यांच्यात किती वेळा मतभेद होतात ते मोजतो.

निकालावर विश्वास ठेवण्याआधी, लेखकाने तो दोनदा तपासला. NeurIPS 2021 प्रयोगाशी तुलना करता, तिथल्याप्रमाणे प्रत्येक शोधनिबंधाला तीन पुनरावलोकनकर्ते घेऊन, सिम्युलेशन मोजलेल्या 23.0 टक्क्यांच्या तुलनेत 23.3 टक्के मतभेद देते. आणि किमान चार पुनरावलोकने असलेल्या ICLR शोधनिबंधांवर, खऱ्या पुनरावलोकनकर्त्यांच्या फक्त दोन यादृच्छिक जोड्या केल्यानेही, 2018 मध्ये आणि 2021 ते 2025 मधील प्रत्येक वर्षी, प्रारूपासारखेच, एका अंकाच्या आत, उत्तर मिळते.

वर्षानुसार संकेत-ते-गोंगाट गुणोत्तर, सुमारे 0.38 ते 0.58 दरम्यान, 0.5 वरील तुटक रेषेभोवती.

गुणांतील विचलनाचा शोधनिबंधामुळे येणारा वाटा, वर्षागणिक: साधारण निम्मा, उरलेला पुनरावलोकनकर्त्यांचा गोंगाट. — आकृती 2, Huang (2026), arXiv:2610.06591.

साधारण चारपैकी एक शोधनिबंध

गुणांतील फरकाचा खुद्द शोधनिबंधातून येणारा वाटा वर्षानुसार 0.38 ते 0.58 इतका असतो — उरलेला पुनरावलोकनकर्त्यांचा गोंगाट आहे, साधारण निम्म्याच्या 2014 च्या अंदाजाशी सुसंगत. परिणाम:

  • प्रत्येक समितीत दोन पुनरावलोकनकर्ते असताना, 22.8 टक्के (2017) ते 30.3 टक्के (2025) शोधनिबंधांचा निर्णय उलटतो. चार पुनरावलोकनकर्ते असताना, 17.7 ते 24.2 टक्के.
  • स्वीकारलेल्यांपैकी 30 ते 50 टक्के शोधनिबंध स्वतंत्र समितीने नाकारले असते — 2021 मध्ये तर निम्मे.
  • ज्या नऊ वर्षांत सादरीकरणे सुमारे 24 पट वाढली (2017 मध्ये 489, 2025 मध्ये 11,663), त्या काळात अभ्यासाला कोणताही भक्कम कल आढळत नाही: गोंगाट स्पष्टपणे वाढतही नाही, कमीही होत नाही. लेखक भर देतो की फक्त नऊ वर्षांचा डेटा असल्याने हा एखाद्या तीव्र कलाविरुद्धचा पुरावा आहे, स्थैर्याची सिद्धता नव्हे.

दोन आणि तीन पुनरावलोकनकर्त्यांच्या समित्यांसाठी वर्षानुसार सिम्युलेट केलेला मतभेद-दर, NeurIPS 2014 आणि 2021 ची मूल्ये तुटक रेषांनी.

दोन समित्यांमधील सिम्युलेट केलेले मतभेद, NeurIPS च्या दोन खऱ्या प्रयोगांशी तुलना करून. — आकृती 3, Huang (2026), arXiv:2610.06591.

गुणपद्धतीच दैवाचा वाटा वाढवते

दोन वर्षे उठून दिसतात. 2020 मध्ये, ICLR ने चार पायऱ्यांची ढोबळ गुणपद्धती (1, 3, 6, 8) वापरली: 23.7 टक्के शोधनिबंधांना त्यांच्या सर्व पुनरावलोकनकर्त्यांकडून एकसारखे गुण मिळाले, तर इतर वर्षांत हे प्रमाण 4.7 ते 13.1 टक्के होते. परिणाम तपासण्यासाठी, लेखकाने 10 पैकी दिलेले 2021 चे गुण घेतले आणि ते चार पायऱ्यांच्या पद्धतीत पुन्हा मांडले. निकाल: संकेताचा सुमारे 8 टक्के भाग हरवतो, समित्यांमधील मतभेद सुमारे 7 अंकांनी वाढतात, आणि उलटणाऱ्या स्वीकृत शोधनिबंधांचा वाटा सुमारे 11 अंकांनी वाढतो. ढोबळ गुणपद्धती फक्त त्याच मतांना नवी लेबले लावत नाही; ती दैवाचा वाटा वाढवते.

2021 वेगळे आहे: बारीक गुणपद्धती, पण नऊ वर्षांतील सर्वात कमकुवत संकेत, आणि स्वीकारलेल्यांपैकी 30.4 टक्के शोधनिबंध स्वीकृतीच्या उंबरठ्याच्या अगदी वर होते. रेषेजवळ अनेक शोधनिबंध, भरपूर गोंगाट: निर्णय सहज उलटतात.

आणि चॅटबॉट?

2023 नंतर, भाषा-प्रारूपे पसरल्यावर, पुनरावलोकनाच्या वर्तनात बदल झाला का हे शोधण्याची अभ्यासाची योजना होती. सार्वजनिक डेटामध्ये 2022 नंतरचा पुनरावलोकनांचा मजकूर किंवा पुनरावलोकनकर्त्यांचा आत्मविश्वास नाही, आणि उपलब्ध सांख्यिकीय चाचणीत जवळजवळ काहीच क्षमता नाही. म्हणून लेखक कोणत्याही बाजूने निष्कर्ष काढत नाही — आणि हा संयम जाणीवपूर्वक असल्याचे मांडतो.

लॉटरीचे लेखापरीक्षण

या पद्धतीला फक्त गुण आणि निर्णय लागतात, जे अनेक परिषदा आधीच प्रकाशित करतात. त्यांच्यापैकी कोणतीही परिषद एकही पुनरावलोकन दुप्पट न करता स्वतःचा “लॉटरी” दर काढू शकेल. ICLR च्या नऊ वर्षांबद्दल लेखकाचा निर्णय: पुनरावलोकन कोसळतही नाही आणि सुधारतही नाही — ते जवळजवळ त्याच पातळीवर गोंगाटयुक्त राहते. अभ्यास फक्त ICLR पुरता आहे, आणि त्याचा लेखक एकच स्वतंत्र संशोधक आहे.

Legal notice