نمرهٔ افسردگی هوش مصنوعی به خودِ هوش مصنوعی بستگی دارد
افسردگی هیچ آزمایش خون تشخیصی ندارد. مدلهای زبانی بزرگ وعدهٔ ارزیابیهای خستگیناپذیر، ارزان و تکرارپذیر از دل گفتوگوهای بالینی را میدهند و ارزیابیهای اولیه دلگرمکننده بودهاند. روانپزشکی پیشتر هم با پرسشی مشابه روبهرو شده بود: در سال ۱۹۷۱، پژوهشی نشان داد که روانپزشکان آمریکایی و بریتانیایی پس از تماشای مصاحبههای ویدئویی یکسان با هم اختلاف نظر داشتند، و این رشته با معیارهای صریح و مصاحبههای ساختاریافته پاسخ داد.
اما یک مدل زبانی تنها از راه مجموعهای از انتخابها به «ارزیاب» تبدیل میشود. کسی مدل را برمیگزیند، درخواست را عبارتبندی میکند — به شکل پرسشنامه، از زبان یک روانپزشک، یا به صورتی که بیمار دربارهٔ خودش پاسخ دهد —، برای پاسخها عدد یا حرف انتخاب میکند، تصمیم میگیرد که مدل فقط سخنان بیمار را بخواند یا کل گفتوگو را، و خروجی آن را به نمره تبدیل میکند. ارزیابیها بهندرت این گزینههای جایگزین را نشان میدهند.
۸۸۰ راه برای ساختن یک ارزیاب
بایهان لین، از دانشکدهٔ پزشکی ایکان در مانت سینای نیویورک، ۱۱ مدل باز (از ۱ تا ۲۱ میلیارد پارامتر) را با پنج عبارتبندی، دو نمای گفتوگو، دو روش خواندن پاسخ و چهار روش ساختن نمره ترکیب کرد. حاصل، ۸۸۰ ارزیاب است که هر کدام روی همان ۱۸۹ مصاحبهٔ ضبطشده اجرا شد؛ مصاحبههایی که یک مصاحبهگر مجازی متحرک انجام داده بود. پیش از هر مصاحبه، شرکتکنندگان PHQ-8 را پر کرده بودند، پرسشنامهای هشتگویهای دربارهٔ افسردگی که از ۰ تا ۲۴ نمره میگیرد؛ نمرهٔ ۱۰ یا بیشتر آستانهٔ معمول غربالگری است. حدود ۳۰٪ شرکتکنندگان از آن گذشتند.
این پژوهش از پیش ثبت شده بود (pre-registered): کد تحلیل پیش از هرگونه مقایسه با پرسشنامه منجمد شد. سپس روند قفلشده یک بار روی ۸۶ مصاحبهٔ تازه اجرا شد که یک مصاحبهگر مجازی کاملاً خودکار با رونوشتهای خودکار انجام داده بود. همهٔ پردازشها روی یک ایستگاه کاری محلی باقی ماند.
ارزیاب بر بیمار میچربد
- یک مصاحبه، حکمهای متضاد. شرکتکنندهای با علائم خفیف (PHQ-8 برابر ۵، زیر آستانه) را نیمی از ۸۸۰ ارزیاب غربالگری مثبت علامت زدند. هیچ شرکتکنندهای حکم یکپارچهای نگرفت.
- ارزیابهای دقیق هم اختلاف دارند. از میان ۵۴۰ ارزیاب با قدرت تمایز خوب (AUC برابر ۰٫۷۰ یا بیشتر)، دو ارزیاب تصادفی برای ۴۰٪ شرکتکنندگان در تصمیم غربالگری اختلاف داشتند.
- مدل از شخص مهمتر است. انتخاب مدل ۳۰٫۰٪ از تغییرات نمرهها را توضیح میداد؛ تفاوتهای پایدار میان شرکتکنندگان ۱۰٫۵٪ را — ۲٫۸ برابر کمتر.
ترازویی که صفرش جابهجا شده
دقت، آنطور که معمولاً سنجیده میشود، میگوید یک ارزیاب افراد را چقدر خوب رتبهبندی میکند. نمیگوید چند نفر را علامت میزند. ارزیابها از ۰٪ تا ۱۰۰٪ شرکتکنندگان را علامت زدند، در حالی که در واقعیت این رقم ۳۰٪ بود. آنچه این سهم را تعیین میکرد، گرایش میانگین هر ارزیاب به بیشبرآورد یا کمبرآورد بود (R² = 0.91). نویسنده آن را به ترازوی حمامی تشبیه میکند که صفرش جابهجا شده است: شاید افراد را خوب رتبهبندی کند، اما همین انحراف تعیین میکند چه کسی از خط عبور کند. دو مدل با دقت تقریباً یکسان، Qwen2.5 7B و Mistral 7B، به ترتیب ۲۴ و ۸۰ نفر از هر ۱۰۰ نفر را علامت میزدند.
جزئیات فنی کوچک این خط را جابهجا کرد. وارونه کردن حروف پاسخ — بهطوری که «A» به جای «اصلاً» معنای «تقریباً هر روز» بدهد، تغییری بیمعنا از نظر بالینی — سهم افراد علامتخورده را با میانهٔ ۲۱ واحد و تا ۸۵ واحد جابهجا کرد. اجرای همان مدل به صورت یک فایل فشرده در نرمافزارهای مختلف، با میانهٔ ۲۱٪ تصمیمها را تغییر داد.
نمرهها چیزی بیش از افسردگی را هم ثبت میکردند. آنها علائم استرس پس از سانحه را به همان اندازهٔ افسردگی دنبال میکردند، شرکتکنندگان پرحرف بیشتر علامت میخوردند، و ۱۶٪ ارزیابها جهت تفاوت کوچک میان زنان و مردان را که پرسشنامه گزارش کرده بود، وارونه کردند.
کالیبراسیون کمک میکند، تا حدی
از آنجا که این انحراف تا این اندازه تعیینکننده بود، نویسنده راه ترمیمی را آزمود: تنظیم دوبارهٔ آستانهٔ هر ارزیاب با ۴۰ شرکتکنندهٔ برچسبخوردهٔ محلی. دقت از حدود ۶۰٪ به ۷۵٪ رسید و اختلاف نظر نصف شد، از ۴۰٪ به ۲۰٪. اما حتی وقتی همهٔ ارزیابها ناچار شدند تعداد یکسانی از افراد را برگزینند، باز هم تقریباً یک بار از هر پنج بار افراد متفاوتی را برگزیدند.
در ۸۶ مصاحبهٔ تازه، پنج پیشبینی از شش پیشبینی ازپیشثبتشدهای که قابل آزمون بودند، تأیید شدند. نویسنده محدودیتهای روشنی را برمیشمارد: فقط مدلهای باز تا ۲۱ میلیارد پارامتر، زیرا دادهها نمیتوانستند از ایستگاه کاری خارج شوند؛ پرسشنامهای خودگزارشی به عنوان معیار، نه تشخیص بالینی؛ نبودِ ارزیابی همان رونوشتها از سوی پزشکان؛ و مصاحبههایی به زبان انگلیسی از یک آزمایشگاه واحد.
پنج وارسی پیش از اعتماد به یک نمره
مقاله با توصیههای کاربردی پایان مییابد: به جای یک عدد واحد، دامنهٔ تصمیمها را در پیکربندیهای معقول گزارش کنید؛ یک پیکربندی خنثی را از پیش تعیین کنید؛ بهطور محلی کالیبره کنید و اختلاف باقیمانده را بسنجید؛ بیازمایید که ارزیاب چه چیزهای دیگری را ثبت میکند؛ و هر تغییری در مدل، نرمافزار، رونویسی یا عبارتبندی را ابزاری تازه به شمار آورید. به تعبیر نویسنده، وقتی تغییر شیوهٔ پرسیدن، کسانی را که شناسایی میکنیم تغییر میدهد، ابزار بخشی از تبیین میشود.
