КОГДА ИИ ОШИБАЕТСЯ, МОЛОДЫМ ВРАЧАМ ПОМОГАЕТ ВТОРОЙ ИИ
Модели ИИ теперь умеют смотреть на рентгенограмму и анамнез пациента и предлагать диагноз с письменным обоснованием. Помогает ли это, зависит не только от модели, но и от того, как реагируют врачи, — особенно когда подсказка ошибочна. Прежние исследования, на которые ссылается статья, показали, что менее опытные врачи больше всех выигрывают от помощи ИИ, но и чаще всех сбиваются с пути из-за его ошибок.
Команда из Наньчанского университета и Гонконгского университета науки и технологий проверила простую идею, взятую из области коллективного интеллекта: показывать врачам два независимых мнения ИИ вместо одного.
Рандомизированное исследование с тремя группами
Линь У (Lin Wu), Чжэ Сюй (Zhe Xu), Фуцин Чжоу (Fuqing Zhou) и их коллеги провели исследование в трёх больницах Китая с июля по сентябрь 2026 года; оно зарегистрировано в Китайском реестре клинических исследований. Они набрали 132 ординатора со стажем менее трёх лет — как рентгенологов, так и представителей других специальностей (терапия, общая хирургия, неотложная медицина) — и случайным образом распределили их по трём группам:
- группа A: подсказки только от GPT-5.4;
- группа B: GPT-5.4 плюс Kimi-K2.6;
- группа C: GPT-5.4 плюс Gemini-3.6 Flash.
Участники не знали, подсказки каких моделей они видят. Девять ординаторов выбыли из-за сбоев сети или плохого самочувствия, так что в анализ вошли 123 человека.
Все читали одни и те же 60 рентгенограмм грудной клетки и брюшной полости. По каждой они сначала самостоятельно ставили диагноз и фиксировали его, затем видели подсказку или подсказки ИИ и давали окончательный ответ. Случаи специально подобрали так, чтобы каждая модель была права ровно в 39 из 60 (65%), — а GPT-5.4, общая для всех групп модель, ошибался в 21. Для сравнения: пять рентгенологов со стажем от одного до пяти лет без ИИ набрали 54,3%.
Что делает ошибающийся ИИ
В целом по всем участникам точность с помощью ИИ выросла с 46,3% до 61,5%. Самое интересное — то, что произошло на 21 снимке, где GPT-5.4 ошибался:
- Ординаторы-рентгенологи с одним ИИ в итоге показали на этих случаях точность 20,0%. Без ИИ та же группа набирала 31,4%: ошибочная подсказка потянула их вниз.
- С двумя ИИ ординаторы-рентгенологи достигли 40,1% и 40,4%.
- Ординаторы других специальностей показывают ту же картину: от 12,1% с одним ИИ до примерно 31% с двумя.
По всем 60 случаям ординаторы-рентгенологи улучшили результат на 9,6 процентного пункта с одним ИИ и на 16,3 и 17,5 пункта с двумя — примерно на 7 пунктов больше. Время чтения и уверенность между группами не различались.
Бесплатных обедов не бывает
У второго мнения есть цена. Для ординаторов не из рентгенологии, когда GPT-5.4 был прав, добавление второй модели снижало точность с 87,4% примерно до 75%: несогласный ИИ мог отговорить их от правильного ответа. В целом их прирост с одним и с двумя ИИ не различался. А когда ошибались обе модели, поисковый анализ не выявил значимой пользы от второй.
Авторы заключают, что две подсказки «могут» ограничивать влияние ошибочного ИИ, причём общий выигрыш получили лишь ординаторы-рентгенологи.
Ограничения, о которых стоит помнить
- 60 случаев были отобраны так, чтобы у всех моделей была одинаковая точность, поэтому они не отражают повседневную практику.
- Эффект может зависеть от того, как часто две модели расходятся во мнениях, а это меняется от пары к паре.
- Формальный расчёт размера выборки не проводился; число участников определялось реальными возможностями набора.
- Сама случайная рандомизация была получена с помощью другой языковой модели, DeepSeek, у которой попросили сбалансированный список; его использовали без изменений.
Дальше, по словам авторов, последуют исследования с неотобранными пациентами и отслеживанием движений глаз, чтобы увидеть, как врачи на самом деле взвешивают мнения двух несогласных машин.
