Информатика и ИИПрепринтАнализ данных4 мин чтения

ФИНАНСИРУЮТСЯ, НО БОЛЬШЕ НЕ УЧИТЫВАЮТСЯ

Организации, финансирующие науку, всё чаще узнают, что именно они финансируют, поручая программам классифицировать текст своих грантов. Национальные институты здравоохранения США (NIH) делают это с 2008 года. Их система RCDC анализирует название, аннотацию, обоснование значимости для общественного здравоохранения и конкретные цели каждого гранта, и ежегодно агентство сообщает Конгрессу и обществу, сколько оно потратило в более чем 300 категориях — от рака до здоровья меньшинств. Исследователи, общественные активисты и сотрудники NIH используют эти итоги как летопись того, какую науку оплачивает общество.

Исследования таких классификаций исходят из того, что текст пишет заявитель. Фанфан Се (Нанкинский университет), Цзинвэнь Чжан (Хубэйский университет) и Хайнин Ван (Медицинская школа Университета Индианы) задались вопросом, что происходит, когда сам финансирующий орган редактирует текст, который подсчитывает его программа.

Что изменилось в 2025 году

Согласно документам, на которые ссылается статья, указы президента от 20 и 21 января 2025 года были направлены против программ разнообразия, равенства и инклюзивности (DEI) и «гендерной идеологии». 4 марта 2025 года руководство NIH предписало кураторам программ обновлять гранты, которые «не поддерживают деятельность в области DEI, но могут содержать формулировки, связанные с DEI», — «с удалением языка DEI» — до выделения средств. Федеральный суд отменил эти директивы 16 июня 2025 года; 21 августа Верховный суд оставил это решение в силе, приостановив при этом ту его часть, которая отменяла прекращение грантов. В декабре 2025 года NIH ввели автоматическую проверку текста, которая, по имеющимся данным, отслеживает не менее 235 терминов.

По следам слов

Авторы проследили названия групп населения в 37 790 продлеваемых грантах, используя открытые файлы NIH, и сравнили их с записями, которых проверка 2025 года не коснулась: кого включали связанные клинические испытания, как связанные статьи были проиндексированы живыми библиотекарями и кого называли критерии включения в испытания. Они сосредоточились на категории «Исследования здоровья расовых и этнических меньшинств» и передали часть проектов на оценку рецензентам, которые не знали ни их принадлежности, ни категории.

Схема того, как проверка редактирует аннотацию, из которой извлекается подсчёт, и график аннотаций, утративших отслеживаемые термины, в зависимости от задержки.

Проверка воздействует на аннотацию, подсчёт извлекается из аннотации; доля отмеченных продлений, лишившихся всех отслеживаемых терминов, росла с задержкой их выдачи. — Рисунок 1, Xie, Zhang & Wang (2026), arXiv:2610.03443.

Что показывают цифры

  • Правки были массовыми. Из 5461 продлеваемого гранта, содержавшего отслеживаемый термин в 2024 году, у 39,7% в 2025 году не осталось ни одного — против 0,08% годом ранее. Чем позже выдавалось продление, тем больше оно теряло — до 54,6% при задержке более 90 дней. Правки учитывали смысл: «меньшинство клеток» почти не трогали.
  • Названия не были украшением. В новых грантах с испытаниями, сообщавшими о наборе участников, название, упоминавшее чернокожее население, предсказывало на 60 процентных пунктов более высокую долю чернокожих участников.
  • Подсчёт следовал за названиями. Среди продлеваемых проектов с категорией «здоровье меньшинств» её сохранили 99,4%, если аннотация не менялась, но лишь 15,7%, если в ней больше не упоминалась расовая или этническая группа, — при том что проекты сохраняли финансирование.
  • Потерянные проекты соответствовали определению. Рецензенты вслепую сочли, что 42 из 50 случайно отобранных потерь в 2024 году соответствовали определению категории. Сравнив аннотации 70 потерь до и после правки, они обнаружили, что заявленные цели, касающиеся группы населения, были переписаны в 49; при чтении по отдельности 63 новые аннотации уже не соответствовали определению. «Категория правильно прочла отредактированный текст».
  • Дыра в итогах. Опубликованный NIH итог по категории снизился с 2612 млн долларов (2024) до 1944 млн долларов (2025). По анализу авторов, на продлеваемые проекты, потерявшие метку после утраты названия, приходится около пятой части чистого снижения, которое им удалось проследить, — часть, невидимая в опубликованных цифрах.

Слова или люди?

Для сексуальных и гендерных меньшинств картина была иной. Из грантов 2024 года, упоминавших их, 46,7% в какой-то момент были зарегистрированы как прекращённые — против 4,8% всех грантов, то есть на 37,8 пункта больше с поправкой на лексику, институт и тип гранта, по сравнению с +3,2 для латиноамериканского и +0,2 для чернокожего населения. К марту 2026 года большинство из них значились как, возможно, восстановленные. Поскольку из текстов одинаково удалялись как включённые в списки, так и не включённые формы названий, авторы трактуют это как нацеленность на группу населения: давление было направлено на группу, а не на слова.

Учёт, который не может этого показать

Главный результат авторы называют «неучтённой наукой»: это исследования, которые финансирующий орган по-прежнему оплачивает и которые, как показывают другие записи, касаются данной группы населения, но которые его собственный подсчёт больше не фиксирует. Проблема, подчёркивают они, существует независимо от направленности политики: когда слова, которые подсчитывает финансирующий орган, — это одновременно слова, которые он контролирует, его политика возвращается к нему под видом факта о науке.

Ограничения названы прямо: некоторые проверки опираются на малые числа (20 строго задокументированных проектов), согласие рецензентов порой было лишь удовлетворительным, даты и авторы правок неизвестны, а период слишком короток, чтобы понять, изменились ли сами исследования. Авторы заявляют, что исследование не финансировалось. «Классификация, читающая текст, — заключают они, — достоверна лишь настолько, насколько надёжно управление этим текстом».

Legal notice