درجات الاكتئاب التي يمنحها الذكاء الاصطناعي تتوقف على الذكاء الاصطناعي نفسه
لا يوجد تحليل دم لتشخيص الاكتئاب. وتَعِد النماذج اللغوية الكبيرة بتقييمات لا تكلّ، رخيصة وقابلة للتكرار، مستخلصة من المحادثات السريرية، وقد جاءت التقييمات الأولى مشجعة. وقد واجه الطب النفسي سؤالًا مشابهًا من قبل: ففي عام 1971، وجدت دراسة أن أطباء نفسيين أمريكيين وبريطانيين اختلفوا بعد مشاهدة المقابلات المصورة نفسها، فردّ هذا المجال بمعايير صريحة ومقابلات منظَّمة.
لكن النموذج اللغوي لا يصبح “مقيّمًا” إلا عبر سلسلة من الخيارات. فهناك من يختار النموذج، ويصوغ الطلب — في شكل استبيان، أو بصوت طبيب نفسي، أو بوصفه المريض الذي يجيب عن نفسه — ويختار أرقامًا أو حروفًا للإجابات، ويقرر إن كان النموذج سيقرأ كلام المريض وحده أم المحادثة كلها، ثم يحوّل مخرجاته إلى درجة. ونادرًا ما تُظهر التقييمات هذه البدائل.
880 طريقة لبناء مقيّم واحد
قام بايهان لين، من كلية إيكان للطب في ماونت سايناي بنيويورك، بالمزاوجة بين 11 نموذجًا مفتوحًا (من مليار إلى 21 مليار معامل) وخمس صياغات، وطريقتين لعرض المحادثة، وطريقتين لقراءة الإجابة، وأربع طرق لبناء الدرجة. وينتج عن ذلك 880 مقيّمًا، طُبّق كل منها على المقابلات المسجلة الـ189 نفسها، التي أجراها محاور افتراضي متحرك. وقبل كل مقابلة، كان المشاركون قد ملؤوا استبيان PHQ-8، وهو استبيان للاكتئاب من ثمانية بنود تتراوح درجته بين 0 و24؛ وتُعدّ الدرجة 10 فأكثر عتبة الفحص المعتادة. وقد تجاوزها نحو 30% من المشاركين.
كانت الدراسة مسجَّلة مسبقًا: إذ جُمّدت شيفرة التحليل قبل أي مقارنة مع الاستبيان. ثم شُغّل الإجراء المقفل مرة واحدة على 86 مقابلة جديدة أجراها محاور افتراضي مستقل تمامًا، مع نصوص مفرّغة آليًا. وجرت المعالجة كلها على محطة عمل محلية.
المقيّم يرجح على المريض
- مقابلة واحدة، أحكام متعارضة. صنّف نصف المقيّمين الـ880 مشاركًا ذا أعراض خفيفة (درجة PHQ-8 تساوي 5، أي دون العتبة) على أنه إيجابي في الفحص. ولم يحصل أي مشارك على حكم بالإجماع.
- المقيّمون الدقيقون يختلفون أيضًا. من بين 540 مقيّمًا يتمتعون بقدرة تمييز جيدة (AUC يساوي 0.70 أو أكثر)، اختلف اثنان يُختاران عشوائيًا في قرار الفحص بشأن 40% من المشاركين.
- النموذج أهم من الشخص. فسّر اختيار النموذج 30.0% من التباين في الدرجات؛ بينما فسّرت الفروق الثابتة بين المشاركين 10.5% — أي أقل بـ2.8 مرة.
ميزان صفره في غير موضعه
الدقة، كما تُقاس عادة، تقول مدى جودة المقيّم في ترتيب الأشخاص. لكنها لا تقول كم شخصًا يصنّف. فقد صنّف المقيّمون ما بين 0% و100% من المشاركين، مقابل 30% في الواقع. وما حدّد هذه النسبة هو الميل المتوسط لكل مقيّم إلى المبالغة في التقدير أو التهوين منه (R² = 0.91). ويشبّه المؤلف ذلك بميزان حمّام صفره في غير موضعه: قد يرتّب الناس جيدًا، لكن انحرافه هو ما يقرر من يتجاوز الخط. فنموذجان بدقة متطابقة تقريبًا، هما Qwen2.5 7B وMistral 7B، سيصنّفان على التوالي 24 و80 شخصًا من كل 100.
وكانت تفاصيل تقنية صغيرة تحرّك هذا الخط. فعكس حروف الإجابة — بحيث يعني “A” “كل يوم تقريبًا” بدلًا من “لا على الإطلاق”، وهو تغيير لا معنى له سريريًا — غيّر نسبة المصنَّفين بوسيط قدره 21 نقطة، ووصل التغيير إلى 85. وأدى تشغيل النموذج نفسه بوصفه ملفًا مضغوطًا في برمجيات مختلفة إلى تغيير وسيط قدره 21% من القرارات.
كما التقطت التقييمات أكثر من الاكتئاب. فقد تتبّعت أعراض اضطراب ما بعد الصدمة بالقرب نفسه الذي تتبّعت به الاكتئاب، وكان المشاركون كثيرو الكلام يُصنَّفون أكثر، وعكس 16% من المقيّمين اتجاه الفرق الصغير بين النساء والرجال الذي يُظهره الاستبيان.
المعايرة تساعد، إلى حدٍّ ما
ولأن الانحراف كان يتحكم في الكثير، جرّب المؤلف إصلاحًا: إعادة ضبط عتبة كل مقيّم باستخدام 40 مشاركًا موسومين محليًا. فارتفعت الدقة من نحو 60% إلى 75%، وانخفض الخلاف إلى النصف، من 40% إلى 20%. لكن حتى حين أُجبر كل مقيّم على اختيار العدد نفسه من الأشخاص، ظلوا يختارون أشخاصًا مختلفين في نحو مرة من كل خمس.
وفي المقابلات الـ86 الجديدة، صحّت خمسة من التنبؤات الستة المسجلة مسبقًا التي أمكن اختبارها. ويعدّد المؤلف حدودًا واضحة: نماذج مفتوحة فقط حتى 21 مليار معامل، لأن البيانات لم يكن مسموحًا لها بمغادرة محطة العمل؛ واستبيان ذاتي التقرير معيارًا، لا تشخيص؛ وعدم وجود أطباء يقيّمون النصوص نفسها؛ ومقابلات باللغة الإنجليزية من مختبر واحد.
خمسة فحوص قبل الوثوق بدرجة
تختتم الورقة بنصائح عملية: الإبلاغ عن نطاق القرارات عبر إعدادات معقولة بدلًا من رقم واحد؛ وتثبيت إعداد محايد مسبقًا؛ والمعايرة محليًا وقياس الخلاف المتبقي؛ واختبار ما يلتقطه المقيّم غير ذلك؛ والتعامل مع أي تغيير في النموذج أو البرمجيات أو التفريغ أو الصياغة بوصفه أداة جديدة. وكما يقول المؤلف، حين يغيّر تغييرُ طريقة السؤال مَن نحدّدهم، تصبح الأداة جزءًا من التفسير.
