कंप्यूटिंग और एआईप्रीप्रिंटडेटा विश्लेषणपढ़ने में 5 मिनट

अनुदान अब भी जारी, पर गिनती से बाहर

शोध के लिए धन देने वाली संस्थाएँ यह जानने के लिए कि वे किसे वित्तपोषित करती हैं, तेज़ी से अपने अनुदानों के पाठ को सॉफ़्टवेयर से वर्गीकृत करवा रही हैं। अमेरिका के नेशनल इंस्टीट्यूट्स ऑफ़ हेल्थ (NIH) 2008 से ऐसा कर रहे हैं। उनका RCDC सिस्टम हर अनुदान के शीर्षक, सार, जन-स्वास्थ्य प्रासंगिकता के कथन और विशिष्ट लक्ष्यों को खंगालता है, और हर साल एजेंसी कांग्रेस और जनता को बताती है कि उसने कैंसर से लेकर अल्पसंख्यक स्वास्थ्य तक 300 से अधिक श्रेणियों में कितना ख़र्च किया। शोधकर्ता, पैरवीकार और NIH कर्मचारी, सभी इन कुल आँकड़ों को इस बात के रिकॉर्ड के रूप में इस्तेमाल करते हैं कि जनता किस विज्ञान के लिए भुगतान करती है।

ऐसे वर्गीकरणों पर हुए अध्ययन मानकर चलते हैं कि पाठ आवेदक लिखता है। नानजिंग विश्वविद्यालय की फ़ांगफ़ांग शिए, हुबेई विश्वविद्यालय की जिंगवेन झांग और इंडियाना यूनिवर्सिटी स्कूल ऑफ़ मेडिसिन के हाइनिंग वांग ने पूछा कि क्या होता है जब धन देने वाली संस्था ख़ुद उस पाठ को संपादित करती है जिसे उसका सॉफ़्टवेयर गिनता है।

2025 में क्या बदला

शोधपत्र में उद्धृत दस्तावेज़ों के अनुसार, 20 और 21 जनवरी 2025 के कार्यकारी आदेशों ने विविधता, समता और समावेशन (DEI) कार्यक्रमों और “लैंगिक विचारधारा” को निशाना बनाया। 4 मार्च 2025 को NIH के दिशानिर्देश ने कार्यक्रम अधिकारियों से कहा कि जो अनुदान “DEI गतिविधियों का समर्थन नहीं करते, लेकिन उनमें DEI से जुड़ी भाषा हो सकती है”, उन्हें धन जारी करने से पहले “DEI भाषा हटाकर” अद्यतन किया जाए। 16 जून 2025 को एक संघीय अदालत ने इन निर्देशों को रद्द कर दिया; 21 अगस्त को सुप्रीम कोर्ट ने वह फ़ैसला बरक़रार रखा, लेकिन उस हिस्से पर रोक लगा दी जिसने अनुदान समाप्तियों को निरस्त किया था। दिसंबर 2025 में NIH ने एक स्वचालित पाठ-जाँच शुरू की, जो बताया जाता है कि कम से कम 235 शब्दों की जाँच करती है।

शब्दों का पीछा

लेखकों ने NIH की सार्वजनिक फ़ाइलों की मदद से 37,790 जारी अनुदानों में आबादी समूहों के नामों का पता लगाया, और उनकी तुलना उन रिकॉर्डों से की जिन्हें 2025 की समीक्षा ने छुआ नहीं था: जुड़े हुए नैदानिक परीक्षणों में किन लोगों को शामिल किया गया, जुड़े हुए लेखों को मानव पुस्तकालयाध्यक्षों ने कैसे अनुक्रमित किया था, और परीक्षणों की पात्रता शर्तों में किन लोगों का नाम था। उन्होंने नस्लीय और जातीय अल्पसंख्यक स्वास्थ्य शोध श्रेणी पर ध्यान केंद्रित किया, और कुछ परियोजनाओं का मूल्यांकन ऐसे समीक्षकों से करवाया जिन्हें उनकी पहचान और श्रेणी का पता नहीं था।

आरेख: समीक्षा उस सारांश को कैसे संपादित करती है जिससे गिनती निकाली जाती है, और देरी के अनुसार जाँचे गए शब्द खोने वाले सारांशों का चार्ट।

समीक्षा सारांश पर काम करती है, गिनती सारांश से निकाली जाती है; हर जाँचा गया शब्द खोने वाले चिह्नित नवीनीकरणों की संख्या उन्हें जारी करने में हुई देरी के साथ बढ़ी। — चित्र 1, Xie, Zhang & Wang (2026), arXiv:2610.03443।

आँकड़े क्या दिखाते हैं

  • संपादन बड़े पैमाने पर हुए। 2024 में किसी जाँचे गए शब्द वाले 5,461 जारी अनुदानों में से 39.7% में 2025 तक एक भी नहीं बचा, जबकि पिछले साल यह 0.08% था। नवीनीकरण जितनी देर से जारी हुआ, उसने उतना ही ज़्यादा खोया — 90 दिन से अधिक देरी पर 54.6% तक। संपादन अर्थ देखकर किए गए: “a minority of cells” (कोशिकाओं का एक अल्पांश) को शायद ही कभी छुआ गया।
  • नाम सजावट नहीं थे। नामांकन की जानकारी देने वाले परीक्षणों वाले नए अनुदानों में, अश्वेत आबादी का नाम लेने वाला शीर्षक अश्वेत प्रतिभागियों के 60 प्रतिशत अंक अधिक हिस्से का संकेत देता था।
  • गिनती नामों के पीछे चली। अल्पसंख्यक स्वास्थ्य श्रेणी वाली जारी परियोजनाओं में, सारांश न बदलने पर 99.4% ने यह श्रेणी बनाए रखी, लेकिन जब सारांश में किसी नस्लीय या जातीय आबादी का नाम नहीं रहा तो केवल 15.7% ने — जबकि परियोजनाओं का अनुदान जारी रहा।
  • खोई गई परियोजनाएँ परिभाषा पर खरी थीं। पहचान से अनजान समीक्षकों ने आँका कि यादृच्छिक रूप से चुनी गई 50 खोई परियोजनाओं में से 42 2024 में श्रेणी की परिभाषा पर खरी थीं। 70 खोई परियोजनाओं के पहले और बाद के सारांशों की तुलना करने पर उन्होंने पाया कि आबादी से जुड़े घोषित लक्ष्य 49 में दोबारा लिखे गए थे; अकेले पढ़ने पर नए सारांशों में से 63 अब परिभाषा पर खरे नहीं उतरते थे। “श्रेणी ने संपादित पाठ को सही पढ़ा।”
  • कुल आँकड़ों में एक छेद। इस श्रेणी के लिए NIH का प्रकाशित कुल आँकड़ा 2,612 मिलियन डॉलर (2024) से घटकर 1,944 मिलियन डॉलर (2025) रह गया। लेखकों के विश्लेषण में, नाम खोने के बाद लेबल खोने वाली जारी परियोजनाएँ उस शुद्ध गिरावट के लगभग पाँचवें हिस्से के लिए ज़िम्मेदार हैं जिसका वे पता लगा सके — एक ऐसा हिस्सा जो प्रकाशित आँकड़ों में दिखाई नहीं देता।

शब्द, या लोग?

यौन और लैंगिक अल्पसंख्यकों के मामले में पैटर्न अलग था। 2024 के जिन अनुदानों में उनका नाम था, उनमें से 46.7% किसी न किसी समय समाप्त दर्ज किए गए, जबकि सभी अनुदानों में यह 4.8% था — शब्दावली, संस्थान और अनुदान के प्रकार के लिए समायोजन के बाद 37.8 अंक ज़्यादा, जबकि हिस्पैनिक आबादी के लिए +3.2 और अश्वेत आबादी के लिए +0.2। मार्च 2026 तक इनमें से ज़्यादातर को संभवतः बहाल के रूप में सूचीबद्ध किया गया था। चूँकि नामों के सूचीबद्ध और ग़ैर-सूचीबद्ध, दोनों रूप एक जैसे हटाए गए, लेखक इसे आबादी को निशाना बनाना मानते हैं: दबाव समूह पर था, शब्दों पर नहीं।

एक रिकॉर्ड जो बता नहीं सकता

लेखक मुख्य नतीजे को “अनगिना विज्ञान” कहते हैं: ऐसा शोध जिसका भुगतान धन देने वाली संस्था अब भी करती है, जिसके बारे में दूसरे रिकॉर्ड दिखाते हैं कि उसमें वह आबादी शामिल है, लेकिन जिसे उसकी अपनी गिनती अब दर्ज नहीं करती। वे ज़ोर देते हैं कि नीति की दिशा जो भी हो, यह समस्या बनी रहती है: जब धन देने वाली संस्था जिन शब्दों को गिनती है वही शब्द वह नियंत्रित भी करती है, तो उसकी नीति विज्ञान के बारे में एक तथ्य की तरह पढ़ी जाती है।

उनकी सीमाएँ साफ़ बताई गई हैं: कुछ परीक्षण छोटी संख्याओं पर टिके हैं (20 सख़्ती से प्रलेखित परियोजनाएँ), समीक्षकों की सहमति कभी-कभी केवल ठीक-ठाक थी, संपादन की तारीख़ें और संपादक अज्ञात हैं, और यह जानने के लिए अवधि बहुत छोटी है कि शोध ख़ुद बदला या नहीं। लेखक घोषित करते हैं कि इस अध्ययन के लिए कोई अनुदान नहीं मिला। “पाठ पढ़ने वाला वर्गीकरण,” वे निष्कर्ष निकालते हैं, “उतना ही विश्वसनीय होता है जितना उस पाठ का प्रशासन।”

Legal notice