AI चे नैराश्य गुण AI वरच अवलंबून
नैराश्याचे निदान करणारी कोणतीही रक्त तपासणी नाही. मोठी भाषा मॉडेल (LLM) क्लिनिकल संभाषणांमधून न थकणारे, स्वस्त आणि पुन्हा पुन्हा तसेच मिळणारे मूल्यमापन देण्याचे आश्वासन देतात, आणि सुरुवातीची मूल्यमापने उत्साहवर्धक ठरली आहेत. मानसोपचारशास्त्राने असाच प्रश्न याआधीही अनुभवला आहे: 1971 मध्ये एका अभ्यासात आढळले की एकच ध्वनिचित्रमुद्रित मुलाखत पाहिल्यानंतर अमेरिकन आणि ब्रिटिश मानसोपचारतज्ज्ञांचे मत जुळत नव्हते, आणि या क्षेत्राने त्याला स्पष्ट निकष आणि संरचित मुलाखतींनी उत्तर दिले.
पण भाषा मॉडेल केवळ अनेक निवडींच्या मालिकेतूनच “परीक्षक” बनते. कोणीतरी मॉडेल निवडतो, विनंतीची शब्दरचना ठरवतो — प्रश्नावलीसारखी, मानसोपचारतज्ज्ञाच्या आवाजात, की स्वतःबद्दल उत्तर देणाऱ्या रुग्णाच्या रूपात — उत्तरांसाठी अंक की अक्षरे ते निवडतो, मॉडेल फक्त रुग्णाचे शब्द वाचेल की संपूर्ण संभाषण ते ठरवतो, आणि त्याच्या उत्तराचे गुणांमध्ये रूपांतर करतो. मूल्यमापने हे पर्याय क्वचितच दाखवतात.
एक परीक्षक घडवण्याचे 880 मार्ग
न्यूयॉर्कमधील आयकान स्कूल ऑफ मेडिसिन ॲट माउंट सायनायचे बायहान लिन (Baihan Lin) यांनी 11 खुली मॉडेल (1 ते 21 अब्ज पॅरामीटर) पाच शब्दरचना, संभाषणाची दोन दृश्ये, उत्तर वाचण्याच्या दोन पद्धती आणि गुण तयार करण्याच्या चार पद्धतींशी गुंफली. त्यातून 880 परीक्षक तयार झाले, आणि प्रत्येक परीक्षक एका ॲनिमेटेड आभासी मुलाखतकाराने घेतलेल्या त्याच 189 ध्वनिमुद्रित मुलाखतींवर लावला गेला. प्रत्येक मुलाखतीपूर्वी सहभागींनी PHQ-8 भरली होती: 0 ते 24 गुणांची, आठ प्रश्नांची नैराश्य प्रश्नावली; 10 किंवा अधिक गुण हा तपासणीचा नेहमीचा उंबरठा असतो. सुमारे 30% सहभागींनी तो ओलांडला होता.
हा अभ्यास पूर्व-नोंदणीकृत होता: प्रश्नावलीशी कोणतीही तुलना करण्यापूर्वीच विश्लेषणाचा कोड गोठवला गेला. नंतर ही बंदिस्त कार्यपद्धती, पूर्णपणे स्वायत्त आभासी मुलाखतकाराने घेतलेल्या आणि स्वयंचलित लिप्यंतर असलेल्या 86 नव्या मुलाखतींवर एकदाच चालवली गेली. सर्व प्रक्रिया एका स्थानिक वर्कस्टेशनवरच झाली.
रुग्णापेक्षा परीक्षकच भारी
- एक मुलाखत, परस्परविरोधी निकाल. सौम्य लक्षणे असलेल्या एका सहभागीला (PHQ-8 गुण 5, उंबरठ्याखाली) 880 पैकी निम्म्या परीक्षकांनी तपासणीत पॉझिटिव्ह ठरवले. एकाही सहभागीला एकमुखी निकाल मिळाला नाही.
- अचूक परीक्षकांमध्येही मतभेद. चांगली भेदक्षमता (AUC 0.70 किंवा अधिक) असलेल्या 540 परीक्षकांपैकी यादृच्छिकपणे निवडलेले दोन परीक्षक 40% सहभागींच्या तपासणी निर्णयावर असहमत होते.
- व्यक्तीपेक्षा मॉडेल महत्त्वाचे. गुणांमधील 30.0% भिन्नता मॉडेलच्या निवडीने स्पष्ट झाली; सहभागींमधील स्थिर फरकांनी 10.5% — 2.8 पट कमी.
शून्य चुकलेला वजनकाटा
सहसा मोजली जाणारी अचूकता सांगते की परीक्षक लोकांची क्रमवारी किती चांगली लावतो. तो किती जणांना चिन्हांकित करतो, हे ती सांगत नाही. परीक्षकांनी 0% ते 100% पर्यंत कितीही सहभागींना चिन्हांकित केले, प्रत्यक्षात हे प्रमाण 30% होते. ते प्रमाण ठरवणारी गोष्ट म्हणजे प्रत्येक परीक्षकाची सरासरीने जास्त किंवा कमी गुण देण्याची प्रवृत्ती (R² = 0.91). लेखक याची तुलना शून्य चुकलेल्या बाथरूम वजनकाट्याशी करतात: तो लोकांची क्रमवारी कदाचित नीट लावेल, पण त्याचे विचलनच ठरवते की रेषा कोण ओलांडतो. जवळजवळ सारखीच अचूकता असलेली दोन मॉडेल, Qwen2.5 7B आणि Mistral 7B, अनुक्रमे 100 पैकी 24 आणि 80 जणांना चिन्हांकित करतील.
लहानसहान तांत्रिक बाबींनी ती रेषा हलवली. उत्तरांची अक्षरे उलटवल्याने — म्हणजे “A” चा अर्थ “अजिबात नाही” ऐवजी “जवळजवळ रोज” असा केल्याने, जो क्लिनिकलदृष्ट्या निरर्थक बदल आहे — चिन्हांकितांचे प्रमाण मध्यगा 21 अंकांनी, आणि कमाल 85 अंकांनी बदलले. तेच मॉडेल संकुचित फाइल म्हणून वेगवेगळ्या सॉफ्टवेअरमध्ये चालवल्याने मध्यगा 21% निर्णय बदलले.
मूल्यमापनांनी नैराश्याखेरीज आणखीही काही टिपले. ती आघातोत्तर ताणाच्या (post-traumatic stress) लक्षणांचा मागोवा नैराश्याइतक्याच जवळून घेत होती, बोलक्या सहभागींना अधिक वेळा चिन्हांकित केले गेले, आणि 16% परीक्षकांनी प्रश्नावलीने नोंदवलेल्या स्त्रिया आणि पुरुषांमधील लहानशा फरकाची दिशाच उलटवली.
पुन्हा जुळवणी उपयोगी, पण एका मर्यादेपर्यंत
विचलनाचा एवढा प्रभाव असल्याने, लेखकांनी एक दुरुस्ती करून पाहिली: स्थानिक पातळीवर लेबल केलेल्या 40 सहभागींच्या आधारे प्रत्येक परीक्षकाचा उंबरठा पुन्हा ठरवणे. अचूकता सुमारे 60% वरून 75% पर्यंत वाढली, आणि मतभेद निम्मे झाले, 40% वरून 20%. पण प्रत्येक परीक्षकाला सारख्याच संख्येने लोक निवडायला भाग पाडले तरीही, ते सुमारे पाचपैकी एकदा वेगवेगळे लोक निवडत होते.
86 नव्या मुलाखतींमध्ये, तपासता येण्याजोग्या सहा पूर्व-नोंदणीकृत भाकितांपैकी पाच खरी ठरली. लेखक स्पष्ट मर्यादा नोंदवतात: डेटा वर्कस्टेशनबाहेर जाऊ शकत नसल्याने फक्त 21 अब्ज पॅरामीटरपर्यंतची खुली मॉडेल; निकष म्हणून निदान नव्हे तर स्वतः भरलेली प्रश्नावली; त्याच लिप्यंतरांचे मूल्यमापन करणारे कोणतेही डॉक्टर नाहीत; आणि एकाच प्रयोगशाळेतील इंग्रजी भाषेतील मुलाखती.
गुणांवर विश्वास ठेवण्यापूर्वी पाच तपासण्या
शोधनिबंधाचा शेवट व्यावहारिक सल्ल्याने होतो: एकाच आकड्याऐवजी योग्य अशा विविध रचनांमधील निर्णयांची व्याप्ती नोंदवा; आधीच एक तटस्थ रचना निश्चित करा; स्थानिक पातळीवर जुळवणी करा आणि उरलेले मतभेद मोजा; परीक्षक आणखी काय टिपतो ते तपासा; आणि मॉडेल, सॉफ्टवेअर, लिप्यंतर किंवा शब्दरचना यांतील कोणताही बदल म्हणजे एक नवे उपकरण असे माना. लेखकांच्या शब्दांत, आपण कसे विचारतो ते बदलल्याने आपण कोणाला ओळखतो ते बदलत असेल, तर उपकरणच स्पष्टीकरणाचा भाग बनते.
