संगणन आणि एआयप्रीप्रिंटडेटा विश्लेषणवाचनासाठी ४ मिनिटे

निधी सुरूच, पण आता मोजणीत नाही

संशोधनाला निधी देणाऱ्या संस्था आपण कशाला निधी देतो हे वाढत्या प्रमाणात आपल्या अनुदानांच्या मजकुराचे सॉफ्टवेअरद्वारे वर्गीकरण करून जाणून घेतात. अमेरिकेच्या नॅशनल इन्स्टिट्यूट्स ऑफ हेल्थ (NIH) 2008 पासून असे करत आहेत. त्यांची RCDC प्रणाली प्रत्येक अनुदानाचे शीर्षक, सारांश, सार्वजनिक आरोग्याशी संबंधित महत्त्वाचे निवेदन आणि विशिष्ट उद्दिष्टे यांचे विश्लेषण करते, आणि दरवर्षी ही संस्था कर्करोगापासून अल्पसंख्याक आरोग्यापर्यंत 300 हून अधिक श्रेणींमध्ये किती खर्च केला हे काँग्रेसला आणि जनतेला कळवते. संशोधक, पुरस्कर्ते आणि NIH कर्मचारी सर्वजण ही बेरीज जनता कोणत्या विज्ञानासाठी पैसे मोजते याची नोंद म्हणून वापरतात.

अशा वर्गीकरणांवरील अभ्यास असे गृहीत धरतात की मजकूर अर्जदार लिहितो. फांगफांग शिए (Fangfang Xie, नानजिंग विद्यापीठ), जिंगवेन झांग (Jingwen Zhang, हुबेई विद्यापीठ) आणि हायनिंग वांग (Haining Wang, इंडियाना युनिव्हर्सिटी स्कूल ऑफ मेडिसिन) यांनी विचारले की, आपले सॉफ्टवेअर जो मजकूर मोजते तोच निधी देणारी संस्था स्वतः संपादित करते तेव्हा काय होते.

2025 मध्ये काय बदलले

शोधनिबंधाने उद्धृत केलेल्या कागदपत्रांनुसार, 20 आणि 21 जानेवारी 2025 च्या कार्यकारी आदेशांनी विविधता, समता आणि समावेशन (DEI) कार्यक्रम आणि “लिंगभाव विचारसरणी” यांना लक्ष्य केले. 4 मार्च 2025 रोजी NIH च्या मार्गदर्शक सूचनांनी कार्यक्रम अधिकाऱ्यांना सांगितले की जी अनुदाने “DEI उपक्रमांना पाठिंबा देत नाहीत, पण ज्यांत DEI शी संबंधित भाषा असू शकते” ती निधी देण्यापूर्वी “DEI भाषा काढून टाकून” अद्ययावत करावीत. एका संघराज्य न्यायालयाने 16 जून 2025 रोजी हे निर्देश रद्द केले; 21 ऑगस्ट रोजी सर्वोच्च न्यायालयाने तो निर्णय कायम ठेवला, मात्र अनुदान-समाप्ती रद्द करणाऱ्या भागाला स्थगिती दिली. डिसेंबर 2025 मध्ये NIH ने मजकुराची स्वयंचलित छाननी सुरू केली, जी किमान 235 शब्द तपासते असे वृत्त आहे.

शब्दांचा माग

लेखकांनी NIH च्या सार्वजनिक फायली वापरून 37,790 चालू अनुदानांमधून लोकसमूहांच्या नावांचा माग काढला, आणि त्यांची तुलना 2025 च्या आढाव्याने स्पर्श न केलेल्या नोंदींशी केली: संबंधित वैद्यकीय चाचण्यांनी कोणाची नोंदणी केली, संबंधित लेखांचे मानवी ग्रंथपालांनी अनुक्रमण कसे केले होते, आणि चाचणीच्या पात्रता निकषांनी कोणाचा उल्लेख केला. त्यांनी वांशिक आणि वंशीय अल्पसंख्याक आरोग्य संशोधन या श्रेणीवर लक्ष केंद्रित केले, आणि काही प्रकल्पांचे मूल्यमापन त्यांची ओळख व श्रेणी माहीत नसलेल्या परीक्षकांकडून करून घेतले.

ज्या सारांशातून मोजणी केली जाते तो सारांश आढावा कसा संपादित करतो याची आकृती, आणि विलंबानुसार तपासणीतील शब्द गमावणाऱ्या सारांशांचा आलेख.

आढावा सारांशावर काम करतो, मोजणी सारांशातूनच काढली जाते; तपासणीतील प्रत्येक शब्द गमावणाऱ्या चिन्हांकित चालू अनुदानांचे प्रमाण ती देण्यातील विलंबासोबत वाढले. — आकृती 1, Xie, Zhang & Wang (2026), arXiv:2610.03443.

आकडे काय दाखवतात

  • संपादने प्रचंड होती. 2024 मध्ये तपासणीतील शब्द असलेल्या 5,461 चालू अनुदानांपैकी 39.7% मध्ये 2025 मध्ये एकही शब्द उरला नव्हता, आदल्या वर्षी हे प्रमाण 0.08% होते. नूतनीकरण जितके उशिरा दिले गेले, तितके अधिक गमावले — 90 दिवसांहून अधिक विलंबानंतर 54.6% पर्यंत. संपादनांनी अर्थ वाचला होता: “a minority of cells” (पेशींचा अल्प भाग) सारख्या शब्दरचनेला क्वचितच हात लावला गेला.
  • नावे सजावटीसाठी नव्हती. सहभागी नोंदणी कळवणाऱ्या चाचण्या असलेल्या नवीन अनुदानांमध्ये, कृष्णवर्णीय लोकसमूहांचा उल्लेख करणाऱ्या शीर्षकावरून कृष्णवर्णीय सहभागींचा वाटा 60 टक्के-अंकांनी अधिक असल्याचे भाकीत झाले.
  • मोजणी नावांच्या मागोमाग गेली. अल्पसंख्याक आरोग्य श्रेणी असलेल्या चालू प्रकल्पांपैकी, सारांश न बदललेल्या प्रकल्पांपैकी 99.4% नी ती श्रेणी टिकवली, पण वांशिक किंवा वंशीय लोकसमूहाचा उल्लेख थांबलेल्यांपैकी फक्त 15.7% नी — आणि त्याच वेळी प्रकल्पांचा निधी कायम राहिला.
  • गमावलेले प्रकल्प व्याख्येत बसत होते. ओळख न सांगितलेल्या परीक्षकांनी ठरवले की यादृच्छिकपणे निवडलेल्या 50 पैकी 42 गमावलेले प्रकल्प 2024 मध्ये श्रेणीच्या व्याख्येत बसत होते. लेबल गमावलेल्या 70 प्रकल्पांच्या आधीच्या आणि नंतरच्या सारांशांची तुलना करताना त्यांना आढळले की लोकसमूहाबद्दलची नमूद उद्दिष्टे 49 प्रकल्पांत पुन्हा लिहिली गेली होती; स्वतंत्रपणे वाचल्यास 63 नवीन सारांश आता व्याख्येत बसत नव्हते. “श्रेणीने संपादित मजकूर अचूक वाचला.”
  • बेरजेत एक भगदाड. या श्रेणीसाठी NIH ने प्रकाशित केलेली एकूण रक्कम 2,612 दशलक्ष डॉलर (2024) वरून 1,944 दशलक्ष डॉलर (2025) वर घसरली. लेखकांच्या विश्लेषणानुसार, नाव गमावल्यानंतर लेबल गमावलेले चालू प्रकल्प त्यांना माग काढता आलेल्या निव्वळ घसरणीपैकी सुमारे एक-पंचमांश भाग आहेत — प्रकाशित आकड्यांमध्ये अदृश्य असलेला भाग.

शब्द, की माणसे?

लैंगिक आणि लिंगभाव अल्पसंख्याकांसाठी नमुना वेगळा होता. त्यांचा उल्लेख करणाऱ्या 2024 च्या अनुदानांपैकी 46.7% अनुदाने कधी ना कधी संपुष्टात आल्याची नोंद झाली, तर सर्व अनुदानांसाठी हे प्रमाण 4.8% होते — शब्दसंग्रह, संस्था आणि अनुदानाचा प्रकार यांसाठी समायोजन केल्यानंतर 37.8 अंकांनी अधिक, तर हिस्पॅनिक लोकसमूहांसाठी +3.2 आणि कृष्णवर्णीयांसाठी +0.2. मार्च 2026 पर्यंत यांपैकी बहुतेक अनुदाने कदाचित पुनर्स्थापित झाल्याचे नोंदवले गेले. नावांची यादीत असलेली आणि नसलेली रूपे सारखीच काढून टाकली गेल्यामुळे, लेखक याचा अर्थ लोकसमूहाला लक्ष्य करणे असा लावतात: दबाव शब्दांवर नव्हे, तर समूहावर होता.

काहीच सांगू न शकणारी नोंद

लेखक मुख्य निष्कर्षाला “न मोजलेले विज्ञान” म्हणतात: असे संशोधन ज्यासाठी निधी देणारी संस्था अजूनही पैसे देते, जे त्या लोकसमूहाशी संबंधित असल्याचे इतर नोंदी दाखवतात, पण ज्याची संस्थेच्या स्वतःच्या मोजणीत आता नोंद होत नाही. ते भर देतात की धोरणाची दिशा कोणतीही असो, ही समस्या कायम राहते: निधी देणारी संस्था जे शब्द मोजते तेच शब्द ती नियंत्रितही करते, तेव्हा तिचे धोरण विज्ञानाबद्दलचे तथ्य म्हणून परत वाचले जाते.

त्यांच्या मर्यादा स्पष्टपणे सांगितल्या आहेत: काही चाचण्या लहान संख्यांवर आधारित आहेत (काटेकोरपणे नोंदवलेले 20 प्रकल्प), परीक्षकांमधील सहमती कधीकधी फक्त बऱ्यापैकी होती, संपादनांच्या तारखा आणि संपादक अज्ञात आहेत, आणि संशोधनच बदलले की नाही हे जाणण्यासाठी कालावधी फार लहान आहे. लेखक जाहीर करतात की या अभ्यासाला कोणताही निधी मिळाला नाही. “मजकूर वाचणारे वर्गीकरण,” ते निष्कर्ष काढतात, “त्या मजकुराच्या व्यवस्थापनाइतकेच वैध असते.”

Legal notice