رایانش و هوش مصنوعیپیش‌چاپتحلیل داده۴ دقیقه مطالعه

هنوز تأمین مالی می‌شود، دیگر شمرده نمی‌شود

نهادهای تأمین مالی پژوهش روزبه‌روز بیشتر با سپردن دسته‌بندی متن طرح‌هایشان به نرم‌افزار می‌فهمند چه چیزی را تأمین مالی می‌کنند. مؤسسات ملی سلامت آمریکا (NIH) از 2008 چنین می‌کنند. سامانهٔ RCDC آن‌ها عنوان، چکیده، بیانیهٔ ارتباط با سلامت عمومی و اهداف ویژهٔ هر طرح را کاوش می‌کند و این نهاد هر سال به کنگره و مردم گزارش می‌دهد که در بیش از 300 دسته، از سرطان تا سلامت اقلیت‌ها، چقدر هزینه کرده است. پژوهشگران، مدافعان و کارکنان NIH همه از این جمع‌ها به‌عنوان سند علمی که مردم هزینه‌اش را می‌پردازند استفاده می‌کنند.

پژوهش‌هایی که دربارهٔ چنین دسته‌بندی‌هایی انجام شده فرض می‌کنند متن را متقاضی می‌نویسد. فانگ‌فانگ شیه (دانشگاه نانجینگ)، جینگ‌ون ژانگ (دانشگاه هوبئی) و هاینینگ وانگ (دانشکدهٔ پزشکی دانشگاه ایندیانا) پرسیدند وقتی خود نهاد تأمین‌کننده متنی را که نرم‌افزارش می‌شمارد ویرایش کند چه رخ می‌دهد.

در 2025 چه تغییر کرد

بر اساس اسنادی که مقاله نقل می‌کند، فرمان‌های اجرایی 20 و 21 ژانویهٔ 2025 برنامه‌های تنوع، برابری و شمول (DEI) و «ایدئولوژی جنسیتی» را هدف گرفتند. در 4 مارس 2025، دستورالعمل NIH به مسئولان برنامه‌ها گفت طرح‌هایی که «از فعالیت‌های DEI پشتیبانی نمی‌کنند، اما ممکن است زبانی مرتبط با DEI داشته باشند» باید پیش از آزادسازی بودجه «با حذف زبان DEI» به‌روزرسانی شوند. یک دادگاه فدرال این دستورها را در 16 ژوئن 2025 باطل کرد؛ در 21 اوت دیوان عالی آن حکم را پابرجا گذاشت اما بخشی را که خاتمهٔ طرح‌ها را لغو می‌کرد به حالت تعلیق درآورد. در دسامبر 2025، NIH یک غربال خودکار متن راه انداخت که گزارش شده دست‌کم 235 اصطلاح را بررسی می‌کند.

دنبال کردن واژه‌ها

نویسندگان با استفاده از پرونده‌های عمومی NIH نام گروه‌های جمعیتی را در 37,790 طرح در حال ادامه دنبال کردند و آن‌ها را با سوابقی مقایسه کردند که بازبینی 2025 به آن‌ها دست نزده بود: اینکه کارآزمایی‌های بالینی مرتبط چه کسانی را ثبت‌نام کرده بودند، مقاله‌های مرتبط چگونه به دست کتابداران انسانی نمایه‌سازی شده بودند، و معیارهای واجد شرایط بودن کارآزمایی‌ها از چه کسانی نام می‌بردند. آن‌ها بر دستهٔ پژوهش سلامت اقلیت‌های نژادی و قومی تمرکز کردند و برخی پروژه‌ها را به داورانی سپردند که هویت و دستهٔ آن‌ها را نمی‌دانستند.

نموداری از اینکه بازبینی چگونه خلاصه‌ای را که شمارش از آن استخراج می‌شود ویرایش می‌کند، و نموداری از خلاصه‌هایی که بر حسب تأخیر واژه‌های غربال‌شده را از دست داده‌اند.

بازبینی روی خلاصه عمل می‌کند و شمارش از خلاصه استخراج می‌شود؛ طرح‌های ادامه‌دار علامت‌خورده‌ای که همهٔ واژه‌های غربال‌شده را از دست دادند، با تأخیر در صدورشان بیشتر شدند. — شکل 1، شیه، ژانگ و وانگ (2026)، arXiv:2610.03443.

اعداد چه نشان می‌دهند

  • ویرایش‌ها گسترده بودند. از 5,461 طرح ادامه‌دار که در 2024 یک واژهٔ غربال‌شده داشتند، در 39.7٪ در 2025 هیچ‌کدام باقی نمانده بود، در برابر 0.08٪ در سال پیش از آن. هرچه تمدید دیرتر صادر شده بود، بیشتر از دست داده بود — تا 54.6٪ پس از بیش از 90 روز. ویرایش‌ها معنا را می‌خواندند: به عبارتی مانند «اقلیتی از سلول‌ها» به‌ندرت دست زده شد.
  • نام‌ها تزئینی نبودند. در طرح‌های تازه با کارآزمایی‌هایی که ثبت‌نام را گزارش می‌کردند، عنوانی که از جمعیت‌های سیاه‌پوست نام می‌برد سهمی 60 واحد درصد بیشتر از شرکت‌کنندگان سیاه‌پوست را پیش‌بینی می‌کرد.
  • شمارش از نام‌ها پیروی کرد. در میان پروژه‌های ادامه‌دار دارای دستهٔ سلامت اقلیت‌ها، وقتی خلاصه تغییر نکرده بود 99.4٪ آن را حفظ کردند، اما وقتی دیگر از یک جمعیت نژادی یا قومی نام نمی‌برد تنها 15.7٪ — در حالی که پروژه‌ها بودجه‌شان را حفظ کردند.
  • پروژه‌های ازدست‌رفته با تعریف جور بودند. داوران ناآگاه داوری کردند که 42 مورد از 50 مورد ازدست‌رفتهٔ تصادفی در 2024 با تعریف این دسته جور بوده‌اند. با مقایسهٔ خلاصه‌های پیش و پس از 70 مورد ازدست‌رفته، دریافتند که اهداف اعلام‌شده دربارهٔ آن جمعیت در 49 مورد بازنویسی شده‌اند؛ اگر به‌تنهایی خوانده شوند، 63 خلاصهٔ تازه دیگر با تعریف جور نبودند. «دسته متن ویرایش‌شده را درست خواند.»
  • حفره‌ای در جمع‌ها. جمع منتشرشدهٔ NIH برای این دسته از 2,612 میلیون دلار (2024) به 1,944 میلیون دلار (2025) کاهش یافت. در تحلیل نویسندگان، پروژه‌های ادامه‌داری که پس از از دست دادن نام، برچسب را هم از دست دادند، حدود یک‌پنجم کاهش خالصی را تشکیل می‌دهند که توانستند ردیابی کنند — بخشی که در ارقام منتشرشده دیده نمی‌شود.

واژه‌ها یا آدم‌ها؟

برای اقلیت‌های جنسی و جنسیتی، الگو متفاوت بود. از طرح‌های 2024 که از آنان نام می‌بردند، 46.7٪ در مقطعی خاتمه‌یافته ثبت شدند، در برابر 4.8٪ از همهٔ طرح‌ها — پس از تعدیل بر حسب واژگان، مؤسسه و نوع طرح، 37.8 واحد بیشتر، در مقایسه با 3.2+ برای جمعیت‌های اسپانیایی‌تبار و 0.2+ برای جمعیت‌های سیاه‌پوست. تا مارس 2026، بیشتر این‌ها به‌عنوان احتمالاً بازگردانده‌شده فهرست شده بودند. از آنجا که صورت‌های فهرست‌شده و فهرست‌نشدهٔ نام‌ها به یک اندازه حذف شده بودند، نویسندگان این را هدف‌گیری جمعیت می‌خوانند: فشار بر گروه بود، نه بر واژه‌ها.

سندی که نمی‌تواند بگوید

نویسندگان نتیجهٔ اصلی را «علم شمرده‌نشده» می‌نامند: پژوهشی که نهاد تأمین‌کننده هنوز هزینه‌اش را می‌پردازد، سوابق دیگر نشان می‌دهند که به آن جمعیت مربوط است، اما شمارش خود آن نهاد دیگر ثبتش نمی‌کند. آن‌ها تأکید می‌کنند که این مشکل، جهت سیاست هرچه باشد، پابرجاست: وقتی واژه‌هایی که نهاد تأمین‌کننده می‌شمارد همان واژه‌هایی باشند که کنترلشان می‌کند، سیاستش همچون واقعیتی دربارهٔ علم بازخوانده می‌شود.

محدودیت‌هایشان را صریح بیان می‌کنند: برخی آزمون‌ها بر اعداد کوچک تکیه دارند (20 پروژه با مستندسازی دقیق)، توافق داوران گاهی تنها متوسط بود، تاریخ‌ها و نویسندگان ویرایش‌ها ناشناخته‌اند، و بازهٔ زمانی کوتاه‌تر از آن است که بدانیم خود پژوهش تغییر کرده یا نه. نویسندگان اعلام می‌کنند که برای این مطالعه هیچ بودجه‌ای دریافت نکرده‌اند. آن‌ها نتیجه می‌گیرند: «دسته‌بندی‌ای که متن را می‌خواند، تنها به اندازهٔ حکمرانی بر آن متن معتبر است.»

Legal notice