ОЦЕНКИ ДЕПРЕССИИ ОТ ИИ ЗАВИСЯТ ОТ САМОГО ИИ
Для диагностики депрессии не существует анализа крови. Большие языковые модели обещают неутомимые, недорогие и воспроизводимые оценки на основе клинических бесед, и первые проверки внушали оптимизм. Психиатрия уже сталкивалась с похожим вопросом: в 1971 году исследование показало, что американские и британские психиатры расходились в оценках, посмотрев одни и те же видеозаписи интервью, и в ответ дисциплина ввела явные критерии и структурированные интервью.
Но языковая модель становится «оценщиком» лишь через цепочку решений. Кто-то выбирает модель, формулирует запрос — как опросник, от лица психиатра или от лица пациента, отвечающего о себе, — выбирает цифры или буквы для ответов, решает, читает ли модель только слова пациента или всю беседу, и превращает её вывод в балл. В проверках эти альтернативы показывают редко.
880 способов собрать одного оценщика
Байхан Линь из Медицинской школы Икана при больнице Mount Sinai в Нью-Йорке скрестил 11 открытых моделей (от 1 до 21 миллиарда параметров) с пятью формулировками, двумя вариантами представления беседы, двумя способами считывания ответа и четырьмя способами построения балла. Получилось 880 оценщиков, каждый из которых применён к одним и тем же 189 записанным интервью, проведённым анимированным виртуальным интервьюером. Перед каждым интервью участники заполняли PHQ-8 — опросник депрессии из восьми пунктов с баллом от 0 до 24; балл 10 и выше — обычный порог скрининга. Его превысили около 30% участников.
Исследование было предварительно зарегистрировано: код анализа заморозили до какого-либо сравнения с опросником. Затем зафиксированную процедуру один раз запустили на 86 новых интервью, проведённых полностью автономным виртуальным интервьюером, с автоматическими расшифровками. Вся обработка шла на локальной рабочей станции.
Оценщик весит больше пациента
- Одно интервью — противоположные вердикты. Участника с лёгкими симптомами (PHQ-8 равен 5, ниже порога) половина из 880 оценщиков отнесла к положительным при скрининге. Ни один участник не получил единогласного вердикта.
- Точные оценщики тоже расходятся. Среди 540 оценщиков с хорошей различающей способностью (AUC 0,70 и выше) два случайно выбранных расходились в решении о скрининге для 40% участников.
- Модель важнее человека. Выбор модели объяснял 30,0% разброса баллов; устойчивые различия между участниками — 10,5%, в 2,8 раза меньше.
Весы со сбитым нулём
Точность в обычном понимании показывает, насколько хорошо оценщик ранжирует людей. Она не говорит, скольких он отмечает. Оценщики отмечали от 0% до 100% участников — при реальных 30%. Эту долю определяла средняя склонность каждого оценщика завышать или занижать баллы (R² = 0,91). Автор сравнивает это с напольными весами со сбитым нулём: они могут правильно ранжировать людей, но именно смещение решает, кто пересечёт черту. Две модели с почти одинаковой точностью, Qwen2.5 7B и Mistral 7B, отметили бы соответственно 24 и 80 человек из 100.
Эту черту сдвигали мелкие технические детали. Перестановка букв ответов — так что «A» означало «почти каждый день» вместо «ни разу», клинически бессмысленное изменение, — сдвигала долю отмеченных в среднем (медиана) на 21 пункт, а максимум на 85. Запуск той же модели в виде сжатого файла в разных программах менял в среднем (медиана) 21% решений.
Баллы улавливали не только депрессию. Они так же тесно следовали за симптомами посттравматического стресса, как и за депрессией; разговорчивых участников отмечали чаще, а 16% оценщиков переворачивали направление небольшой разницы между женщинами и мужчинами, которую фиксировал опросник.
Калибровка помогает — до определённого предела
Поскольку смещение так много определяло, автор попробовал исправление: заново выставить порог каждого оценщика по 40 участникам, размеченным на месте. Точность выросла примерно с 60% до 75%, а разногласия сократились вдвое, с 40% до 20%. Но даже когда всех оценщиков заставляли выбрать одинаковое число людей, они всё равно выбирали разных людей примерно в одном случае из пяти.
На 86 новых интервью подтвердились пять из шести предварительно зарегистрированных прогнозов, которые можно было проверить. Автор перечисляет чёткие ограничения: только открытые модели до 21 миллиарда параметров, потому что данные не могли покидать рабочую станцию; критерием служил опросник самооценки, а не диагноз; клиницисты не оценивали те же расшифровки; интервью на английском языке из одной лаборатории.
Пять проверок, прежде чем доверять баллу
Статья заканчивается практическими советами: сообщать диапазон решений при разумных конфигурациях, а не одно число; заранее фиксировать нейтральную конфигурацию; калибровать на месте и измерять оставшиеся разногласия; проверять, что ещё улавливает оценщик; и считать любую смену модели, программы, расшифровки или формулировки новым инструментом. Как пишет автор, когда изменение способа спрашивать меняет то, кого мы выявляем, инструмент становится частью объяснения.
