BAHATI NASIBU YA UHAKIKI WA WATAALAMU
Sayansi inaendeshwa kwa uhakiki wa wataalamu wenzao: kabla tokeo halijachapishwa, wataalamu wengine hulipima. Katika makongamano makubwa ya ujifunzaji wa mashine, wahakiki wachache huipa alama kila makala iliyowasilishwa na makala hukubaliwa au kukataliwa. Nyuma ya desturi hii kuna swali lisilostarehesha. Tuma makala ileile kwa wahakiki wengine, je, uamuzi ungekuwa uleule?
Majaribio mawili ya gharama kubwa
Majibu pekee ya moja kwa moja yanatoka kwenye majaribio mawili ambapo kongamano lilihakiki baadhi ya makala mara mbili, kwa kamati mbili huru. Makala inakumbusha matokeo yao:
- NeurIPS 2014: kati ya makala 166 zilizohakikiwa mara mbili, kamati hizo mbili hazikukubaliana kuhusu 43 — asilimia 25.9. Takriban nusu ya makala zilizokubaliwa na kamati moja zingekataliwa na nyingine.
- NeurIPS 2021: kwa makala 882, kamati hazikukubaliana kwa asilimia 23.0.
Majaribio kama hayo ni nadra kwa sababu yana gharama kubwa: yanamaanisha kuongeza maradufu uhakiki wa mamia ya makala. Feilian Huang, mtafiti huru, aliuliza kama namba hiyohiyo ingeweza kukadiriwa kutokana na data za umma pekee.
Kuiga kamati ya pili
Utafiti unatumia uhakiki wa umma wa kongamano la ICLR kuanzia 2017 hadi 2025: makala 36,113 na uhakiki 134,912. Modeli ya kitakwimu inagawa kila alama katika sehemu mbili: ubora uliofichika wa makala, na “kelele” (noise) inayoongezwa na kila mhakiki. Modeli ya pili inaiga jinsi alama zinavyogeuka kuwa maamuzi. Kompyuta kisha inawazia, kwa kila makala, kamati mbili huru za wahakiki wawili, watatu au wanne, mara elfu moja, na kuhesabu ni mara ngapi hazikubaliani.
Kabla ya kuliamini tokeo, mwandishi alilihakiki mara mbili. Ukilinganisha na jaribio la NeurIPS 2021, kwa wahakiki watatu kwa kila makala kama huko, uigaji unatoa asilimia 23.3 ya kutokubaliana dhidi ya asilimia 23.0 iliyopimwa. Na kwa makala za ICLR zenye angalau uhakiki manne, kugawa tu wahakiki halisi katika jozi mbili za nasibu kunatoa jibu lilelile kama modeli, ndani ya pointi moja, mwaka 2018 na kila mwaka kuanzia 2021 hadi 2025.

Sehemu ya tofauti ya alama inayotokana na makala yenyewe, mwaka kwa mwaka: takriban nusu, iliyobaki ni kelele ya wahakiki. — Kielelezo 2, Huang (2026), arXiv:2610.06591.
Takriban makala moja katika nne
Sehemu ya tofauti ya alama inayotoka kwenye makala yenyewe inaanzia 0.38 hadi 0.58 kutegemea mwaka — iliyobaki ni kelele ya wahakiki, sambamba na makadirio ya 2014 ya takriban nusu. Matokeo yake:
- Kwa wahakiki wawili kwa kila kamati, uamuzi unageuka kwa asilimia 22.8 (2017) hadi asilimia 30.3 (2025) ya makala. Kwa wahakiki wanne, asilimia 17.7 hadi 24.2.
- Asilimia 30 hadi 50 ya makala zilizokubaliwa zingekataliwa na kamati huru — hadi nusu mwaka 2021.
- Katika miaka tisa ambapo mawasilisho yaliongezeka takriban mara 24 (489 mwaka 2017, 11,663 mwaka 2025), utafiti haupati mwelekeo thabiti: kelele haiongezeki wala haipungui kwa uwazi. Mwandishi anasisitiza kwamba kwa miaka tisa tu ya data, huu ni ushahidi dhidi ya mwelekeo imara, si uthibitisho wa utulivu.

Kutokubaliana kulikoigwa kati ya kamati mbili, ukilinganisha na majaribio mawili halisi ya NeurIPS. — Kielelezo 3, Huang (2026), arXiv:2610.06591.
Kipimo chenyewe kinaongeza bahati
Miaka miwili inajitokeza. Mwaka 2020, ICLR ilitumia kipimo cha alama chenye ngazi nne tu (1, 3, 6, 8): asilimia 23.7 ya makala zilipokea alama zinazofanana kabisa kutoka kwa wahakiki wao wote, dhidi ya asilimia 4.7 hadi 13.1 katika miaka mingine. Ili kupima athari, mwandishi alichukua alama za 2021, zilizotolewa kati ya 10, na kuziweka upya kwenye kipimo cha ngazi nne. Matokeo: takriban asilimia 8 ya ishara inapotea, kutokubaliana kati ya kamati kunapanda kwa takriban pointi 7, na sehemu ya makala zilizokubaliwa ambazo zingegeuka inapanda kwa takriban pointi 11. Kipimo chenye ngazi chache hakibadilishi tu majina ya maoni yaleyale; kinaongeza bahati.
Mwaka 2021 ni tofauti: kipimo cha kina, lakini ishara dhaifu zaidi katika miaka tisa, na asilimia 30.4 ya makala zilizokubaliwa zilikaa juu kidogo tu ya kizingiti cha kukubaliwa. Makala nyingi karibu na mstari, kelele nyingi: kugeuka kwa urahisi.
Na roboti-soga je?
Utafiti ulipanga kutafuta badiliko katika tabia ya uhakiki baada ya 2023, modeli za lugha zilipoenea. Data za umma hazina maandishi ya uhakiki wala kiwango cha uhakika cha wahakiki baada ya 2022, na jaribio la kitakwimu lililopo karibu halina nguvu. Kwa hiyo mwandishi hafikii hitimisho lolote kwa upande wowote — na anawasilisha kujizuia huko kama kwa makusudi.
Kukagua bahati nasibu
Mbinu hii inahitaji tu alama na maamuzi, ambavyo makongamano kadhaa tayari huchapisha. Yeyote kati yao angeweza kukokotoa kiwango chake cha “bahati nasibu” bila kurudia hata uhakiki mmoja. Uamuzi wa mwandishi kuhusu miaka tisa ya ICLR: uhakiki hauporomoki wala hauboreki — unabaki na kelele kwa kiwango karibu kilekile. Utafiti unashughulikia ICLR pekee, na mwandishi wake ni mtafiti mmoja huru.
