طب اور صحتپری پرنٹڈیٹا کا تجزیہ5 منٹ کا مطالعہ

اے آئی کے ڈپریشن اسکور خود اے آئی پر منحصر ہیں

ڈپریشن کی تشخیص کے لیے کوئی خون کا ٹیسٹ نہیں ہے۔ بڑے لینگویج ماڈلز طبی گفتگو سے بغیر تھکے، سستے اور دہرائے جا سکنے والے جائزوں کا وعدہ کرتے ہیں، اور ابتدائی جانچ حوصلہ افزا رہی ہے۔ نفسیاتی طب پہلے بھی ایسے ہی سوال کا سامنا کر چکی ہے: 1971 میں ایک تحقیق سے پتا چلا کہ امریکی اور برطانوی ماہرینِ نفسیات ایک ہی ویڈیو ریکارڈ شدہ انٹرویوز دیکھنے کے بعد آپس میں متفق نہیں تھے، اور اس شعبے نے اس کا جواب واضح معیارات اور منظم انٹرویوز کی صورت میں دیا۔

لیکن کوئی لینگویج ماڈل صرف کئی انتخابات کے سلسلے کے ذریعے ہی “جائزہ کار” بنتا ہے۔ کوئی ماڈل چنتا ہے، درخواست کے الفاظ طے کرتا ہے — سوالنامے کی شکل میں، کسی ماہرِ نفسیات کی زبان میں، یا خود اپنے بارے میں جواب دیتے مریض کی طرح — جوابات کے لیے ہندسے یا حروف چنتا ہے، یہ فیصلہ کرتا ہے کہ ماڈل صرف مریض کے الفاظ پڑھے یا پوری گفتگو، اور اس کے نتیجے کو اسکور میں بدلتا ہے۔ جائزوں میں یہ متبادل شاذ و نادر ہی دکھائے جاتے ہیں۔

ایک جائزہ کار بنانے کے 880 طریقے

نیو یارک کے آئیکن اسکول آف میڈیسن ایٹ ماؤنٹ سینائی کے بائیہان لن نے 11 اوپن ماڈلز (1 سے 21 ارب پیرامیٹرز تک) کو پانچ طرح کے الفاظ، گفتگو کے دو زاویوں، جواب پڑھنے کے دو طریقوں اور اسکور بنانے کے چار طریقوں سے ملایا۔ اس سے 880 جائزہ کار بنتے ہیں، جن میں سے ہر ایک کو انہی 189 ریکارڈ شدہ انٹرویوز پر لاگو کیا گیا، جو ایک متحرک ورچوئل انٹرویو کار نے لیے تھے۔ ہر انٹرویو سے پہلے شرکا نے PHQ-8 بھرا تھا، جو ڈپریشن کا آٹھ سوالوں پر مشتمل سوالنامہ ہے جس کا اسکور 0 سے 24 تک ہوتا ہے؛ 10 یا اس سے زیادہ اسکور اسکریننگ کی معمول کی حد ہے۔ تقریباً 30 فیصد شرکا اس حد سے آگے تھے۔

یہ تحقیق پیشگی رجسٹرڈ تھی: سوالنامے سے کسی بھی موازنے سے پہلے تجزیے کا کوڈ منجمد کر دیا گیا تھا۔ پھر اس مقفل طریقۂ کار کو ایک بار 86 نئے انٹرویوز پر چلایا گیا جو ایک مکمل طور پر خودکار ورچوئل انٹرویو کار نے خودکار ٹرانسکرپٹس کے ساتھ لیے تھے۔ تمام کارروائی ایک مقامی ورک اسٹیشن پر ہی رہی۔

جائزہ کار کا وزن مریض سے زیادہ

  • ایک انٹرویو، متضاد فیصلے۔ ہلکی علامات والے ایک شریک (PHQ-8 اسکور 5، حد سے نیچے) کو 880 میں سے آدھے جائزہ کاروں نے اسکریننگ میں مثبت قرار دیا۔ کسی بھی شریک کو متفقہ فیصلہ نہیں ملا۔
  • درست جائزہ کار بھی اختلاف کرتے ہیں۔ اچھی امتیازی صلاحیت (AUC کم از کم 0.70) والے 540 جائزہ کاروں میں سے بے ترتیب چنے گئے دو جائزہ کار 40 فیصد شرکا کے بارے میں اسکریننگ کے فیصلے پر متفق نہیں تھے۔
  • ماڈل شخص سے زیادہ اہم ہے۔ ماڈل کے انتخاب نے اسکور میں تغیر کا 30.0 فیصد واضح کیا؛ شرکا کے درمیان مستقل فرق نے 10.5 فیصد — یعنی 2.8 گنا کم۔

ایسا ترازو جس کا صفر اپنی جگہ پر نہیں

درستی، جیسا کہ عام طور پر ناپی جاتی ہے، بتاتی ہے کہ کوئی جائزہ کار لوگوں کو کتنی اچھی طرح ترتیب دیتا ہے۔ یہ نہیں بتاتی کہ وہ کتنے لوگوں کو نشان زد کرتا ہے۔ جائزہ کاروں نے 0 سے 100 فیصد تک شرکا کو نشان زد کیا، جبکہ حقیقت میں یہ تعداد 30 فیصد تھی۔ اس تناسب کا تعین ہر جائزہ کار کے زیادہ یا کم اسکور دینے کے اوسط رجحان سے ہوتا تھا (R² = 0.91)۔ مصنف اسے ایسے باتھ روم ترازو سے تشبیہ دیتے ہیں جس کا صفر اپنی جگہ سے ہٹا ہوا ہو: وہ لوگوں کو اچھی ترتیب میں رکھ سکتا ہے، لیکن اس کا ہٹاؤ طے کرتا ہے کہ کون لکیر پار کرے گا۔ تقریباً ایک جیسی درستی والے دو ماڈل، Qwen2.5 7B اور Mistral 7B، بالترتیب ہر 100 میں سے 24 اور 80 لوگوں کو نشان زد کریں گے۔

چھوٹی چھوٹی تکنیکی باتوں نے اس لکیر کو کھسکا دیا۔ جواب کے حروف کو الٹنے سے — تاکہ “A” کا مطلب “بالکل نہیں” کے بجائے “تقریباً ہر روز” ہو، جو طبی لحاظ سے بے معنی تبدیلی ہے — نشان زد ہونے والوں کا تناسب اوسطاً (median) 21 پوائنٹس اور زیادہ سے زیادہ 85 پوائنٹس تک بدل گیا۔ ایک ہی ماڈل کو کمپریس شدہ فائل کے طور پر مختلف سافٹ ویئر میں چلانے سے اوسطاً 21 فیصد فیصلے بدل گئے۔

یہ اسکور ڈپریشن کے علاوہ دوسری چیزیں بھی پکڑتے تھے۔ وہ صدمے کے بعد کے ذہنی دباؤ (PTSD) کی علامات کے ساتھ بھی اتنی ہی قریب سے چلتے تھے جتنا ڈپریشن کے ساتھ، زیادہ بولنے والے شرکا کو زیادہ کثرت سے نشان زد کیا گیا، اور 16 فیصد جائزہ کاروں نے سوالنامے میں درج خواتین اور مردوں کے درمیان چھوٹے سے فرق کی سمت کو الٹ دیا۔

کیلیبریشن مدد کرتی ہے، ایک حد تک

چونکہ یہ ہٹاؤ اتنا اثر رکھتا تھا، مصنف نے ایک اصلاح آزمائی: 40 مقامی طور پر لیبل شدہ شرکا کے ساتھ ہر جائزہ کار کی حد کو دوبارہ طے کرنا۔ درستی تقریباً 60 سے 75 فیصد تک بڑھ گئی، اور اختلاف آدھا ہو گیا، 40 سے 20 فیصد۔ لیکن جب ہر جائزہ کار کو ایک ہی تعداد میں لوگ چننے پر مجبور کیا گیا، تب بھی وہ تقریباً ہر پانچ میں سے ایک بار مختلف لوگ چنتے رہے۔

86 نئے انٹرویوز میں، پیشگی رجسٹرڈ چھ قابلِ جانچ پیش گوئیوں میں سے پانچ درست ثابت ہوئیں۔ مصنف واضح حدود بیان کرتے ہیں: صرف 21 ارب پیرامیٹرز تک کے اوپن ماڈلز، کیونکہ ڈیٹا ورک اسٹیشن سے باہر نہیں جا سکتا تھا؛ معیار کے طور پر خود رپورٹ کردہ سوالنامہ، نہ کہ تشخیص؛ کسی معالج نے انہی ٹرانسکرپٹس کا جائزہ نہیں لیا؛ اور ایک ہی لیبارٹری سے انگریزی زبان کے انٹرویوز۔

کسی اسکور پر بھروسہ کرنے سے پہلے پانچ جانچیں

مقالہ عملی مشوروں پر ختم ہوتا ہے: ایک واحد عدد کے بجائے معقول ترتیبات میں فیصلوں کی حد رپورٹ کریں؛ پہلے سے ایک غیر جانبدار ترتیب طے کریں؛ مقامی طور پر کیلیبریٹ کریں اور باقی رہ جانے والے اختلاف کو ناپیں؛ جانچیں کہ جائزہ کار اور کیا کچھ پکڑتا ہے؛ اور ماڈل، سافٹ ویئر، ٹرانسکرپشن یا الفاظ میں کسی بھی تبدیلی کو ایک نیا آلہ سمجھیں۔ جیسا کہ مصنف کہتے ہیں، جب پوچھنے کا انداز بدلنے سے یہ بدل جائے کہ ہم کس کی شناخت کرتے ہیں، تو آلہ خود وضاحت کا حصہ بن جاتا ہے۔

Legal notice