پزشکی و سلامتپیش‌چاپتحلیل داده۴ دقیقه مطالعه

نمرهٔ افسردگی هوش مصنوعی به خودِ هوش مصنوعی بستگی دارد

افسردگی هیچ آزمایش خون تشخیصی ندارد. مدل‌های زبانی بزرگ وعدهٔ ارزیابی‌های خستگی‌ناپذیر، ارزان و تکرارپذیر از دل گفت‌وگوهای بالینی را می‌دهند و ارزیابی‌های اولیه دلگرم‌کننده بوده‌اند. روان‌پزشکی پیش‌تر هم با پرسشی مشابه روبه‌رو شده بود: در سال ۱۹۷۱، پژوهشی نشان داد که روان‌پزشکان آمریکایی و بریتانیایی پس از تماشای مصاحبه‌های ویدئویی یکسان با هم اختلاف نظر داشتند، و این رشته با معیارهای صریح و مصاحبه‌های ساختاریافته پاسخ داد.

اما یک مدل زبانی تنها از راه مجموعه‌ای از انتخاب‌ها به «ارزیاب» تبدیل می‌شود. کسی مدل را برمی‌گزیند، درخواست را عبارت‌بندی می‌کند — به شکل پرسش‌نامه، از زبان یک روان‌پزشک، یا به صورتی که بیمار دربارهٔ خودش پاسخ دهد —، برای پاسخ‌ها عدد یا حرف انتخاب می‌کند، تصمیم می‌گیرد که مدل فقط سخنان بیمار را بخواند یا کل گفت‌وگو را، و خروجی آن را به نمره تبدیل می‌کند. ارزیابی‌ها به‌ندرت این گزینه‌های جایگزین را نشان می‌دهند.

۸۸۰ راه برای ساختن یک ارزیاب

بایهان لین، از دانشکدهٔ پزشکی ایکان در مانت سینای نیویورک، ۱۱ مدل باز (از ۱ تا ۲۱ میلیارد پارامتر) را با پنج عبارت‌بندی، دو نمای گفت‌وگو، دو روش خواندن پاسخ و چهار روش ساختن نمره ترکیب کرد. حاصل، ۸۸۰ ارزیاب است که هر کدام روی همان ۱۸۹ مصاحبهٔ ضبط‌شده اجرا شد؛ مصاحبه‌هایی که یک مصاحبه‌گر مجازی متحرک انجام داده بود. پیش از هر مصاحبه، شرکت‌کنندگان PHQ-8 را پر کرده بودند، پرسش‌نامه‌ای هشت‌گویه‌ای دربارهٔ افسردگی که از ۰ تا ۲۴ نمره می‌گیرد؛ نمرهٔ ۱۰ یا بیشتر آستانهٔ معمول غربالگری است. حدود ۳۰٪ شرکت‌کنندگان از آن گذشتند.

این پژوهش از پیش ثبت شده بود (pre-registered): کد تحلیل پیش از هرگونه مقایسه با پرسش‌نامه منجمد شد. سپس روند قفل‌شده یک بار روی ۸۶ مصاحبهٔ تازه اجرا شد که یک مصاحبه‌گر مجازی کاملاً خودکار با رونوشت‌های خودکار انجام داده بود. همهٔ پردازش‌ها روی یک ایستگاه کاری محلی باقی ماند.

ارزیاب بر بیمار می‌چربد

  • یک مصاحبه، حکم‌های متضاد. شرکت‌کننده‌ای با علائم خفیف (PHQ-8 برابر ۵، زیر آستانه) را نیمی از ۸۸۰ ارزیاب غربالگری مثبت علامت زدند. هیچ شرکت‌کننده‌ای حکم یکپارچه‌ای نگرفت.
  • ارزیاب‌های دقیق هم اختلاف دارند. از میان ۵۴۰ ارزیاب با قدرت تمایز خوب (AUC برابر ۰٫۷۰ یا بیشتر)، دو ارزیاب تصادفی برای ۴۰٪ شرکت‌کنندگان در تصمیم غربالگری اختلاف داشتند.
  • مدل از شخص مهم‌تر است. انتخاب مدل ۳۰٫۰٪ از تغییرات نمره‌ها را توضیح می‌داد؛ تفاوت‌های پایدار میان شرکت‌کنندگان ۱۰٫۵٪ را — ۲٫۸ برابر کمتر.

ترازویی که صفرش جابه‌جا شده

دقت، آن‌طور که معمولاً سنجیده می‌شود، می‌گوید یک ارزیاب افراد را چقدر خوب رتبه‌بندی می‌کند. نمی‌گوید چند نفر را علامت می‌زند. ارزیاب‌ها از ۰٪ تا ۱۰۰٪ شرکت‌کنندگان را علامت زدند، در حالی که در واقعیت این رقم ۳۰٪ بود. آنچه این سهم را تعیین می‌کرد، گرایش میانگین هر ارزیاب به بیش‌برآورد یا کم‌برآورد بود (R² = 0.91). نویسنده آن را به ترازوی حمامی تشبیه می‌کند که صفرش جابه‌جا شده است: شاید افراد را خوب رتبه‌بندی کند، اما همین انحراف تعیین می‌کند چه کسی از خط عبور کند. دو مدل با دقت تقریباً یکسان، Qwen2.5 7B و Mistral 7B، به ترتیب ۲۴ و ۸۰ نفر از هر ۱۰۰ نفر را علامت می‌زدند.

جزئیات فنی کوچک این خط را جابه‌جا کرد. وارونه کردن حروف پاسخ — به‌طوری که «A» به جای «اصلاً» معنای «تقریباً هر روز» بدهد، تغییری بی‌معنا از نظر بالینی — سهم افراد علامت‌خورده را با میانهٔ ۲۱ واحد و تا ۸۵ واحد جابه‌جا کرد. اجرای همان مدل به صورت یک فایل فشرده در نرم‌افزارهای مختلف، با میانهٔ ۲۱٪ تصمیم‌ها را تغییر داد.

نمره‌ها چیزی بیش از افسردگی را هم ثبت می‌کردند. آن‌ها علائم استرس پس از سانحه را به همان اندازهٔ افسردگی دنبال می‌کردند، شرکت‌کنندگان پرحرف بیشتر علامت می‌خوردند، و ۱۶٪ ارزیاب‌ها جهت تفاوت کوچک میان زنان و مردان را که پرسش‌نامه گزارش کرده بود، وارونه کردند.

کالیبراسیون کمک می‌کند، تا حدی

از آنجا که این انحراف تا این اندازه تعیین‌کننده بود، نویسنده راه ترمیمی را آزمود: تنظیم دوبارهٔ آستانهٔ هر ارزیاب با ۴۰ شرکت‌کنندهٔ برچسب‌خوردهٔ محلی. دقت از حدود ۶۰٪ به ۷۵٪ رسید و اختلاف نظر نصف شد، از ۴۰٪ به ۲۰٪. اما حتی وقتی همهٔ ارزیاب‌ها ناچار شدند تعداد یکسانی از افراد را برگزینند، باز هم تقریباً یک بار از هر پنج بار افراد متفاوتی را برگزیدند.

در ۸۶ مصاحبهٔ تازه، پنج پیش‌بینی از شش پیش‌بینی ازپیش‌ثبت‌شده‌ای که قابل آزمون بودند، تأیید شدند. نویسنده محدودیت‌های روشنی را برمی‌شمارد: فقط مدل‌های باز تا ۲۱ میلیارد پارامتر، زیرا داده‌ها نمی‌توانستند از ایستگاه کاری خارج شوند؛ پرسش‌نامه‌ای خودگزارشی به عنوان معیار، نه تشخیص بالینی؛ نبودِ ارزیابی همان رونوشت‌ها از سوی پزشکان؛ و مصاحبه‌هایی به زبان انگلیسی از یک آزمایشگاه واحد.

پنج وارسی پیش از اعتماد به یک نمره

مقاله با توصیه‌های کاربردی پایان می‌یابد: به جای یک عدد واحد، دامنهٔ تصمیم‌ها را در پیکربندی‌های معقول گزارش کنید؛ یک پیکربندی خنثی را از پیش تعیین کنید؛ به‌طور محلی کالیبره کنید و اختلاف باقی‌مانده را بسنجید؛ بیازمایید که ارزیاب چه چیزهای دیگری را ثبت می‌کند؛ و هر تغییری در مدل، نرم‌افزار، رونویسی یا عبارت‌بندی را ابزاری تازه به شمار آورید. به تعبیر نویسنده، وقتی تغییر شیوهٔ پرسیدن، کسانی را که شناسایی می‌کنیم تغییر می‌دهد، ابزار بخشی از تبیین می‌شود.

Legal notice