AI के डिप्रेशन स्कोर AI पर ही निर्भर करते हैं
डिप्रेशन (अवसाद) की पहचान के लिए कोई ब्लड टेस्ट नहीं है। बड़े भाषा मॉडल क्लिनिकल बातचीत से बिना थके, सस्ते और दोहराए जा सकने वाले आकलन देने का वादा करते हैं, और शुरुआती मूल्यांकन उत्साहजनक रहे हैं। मनोचिकित्सा पहले भी ऐसे ही सवाल का सामना कर चुकी है: 1971 में एक अध्ययन में पाया गया कि अमेरिकी और ब्रिटिश मनोचिकित्सक वीडियो पर रिकॉर्ड किए गए एक ही इंटरव्यू देखने के बाद भी असहमत थे, और इस क्षेत्र ने इसका जवाब स्पष्ट मानदंडों और संरचित इंटरव्यू से दिया।
लेकिन कोई भाषा मॉडल कई विकल्पों से गुज़रकर ही “रेटर” बनता है। कोई मॉडल चुनता है, अनुरोध के शब्द तय करता है — प्रश्नावली के रूप में, किसी मनोचिकित्सक की आवाज़ में, या मरीज़ के रूप में अपने बारे में जवाब देते हुए — जवाबों के लिए अंक या अक्षर चुनता है, तय करता है कि मॉडल सिर्फ़ मरीज़ के शब्द पढ़ेगा या पूरी बातचीत, और उसके आउटपुट को एक स्कोर में बदलता है। मूल्यांकनों में ये विकल्प शायद ही कभी दिखाए जाते हैं।
एक रेटर बनाने के 880 तरीक़े
न्यूयॉर्क के माउंट सिनाई स्थित Icahn School of Medicine के Baihan Lin ने 11 ओपन मॉडलों (1 से 21 अरब पैरामीटर तक) को पाँच तरह के शब्दांकन, बातचीत के दो दृष्टिकोण, जवाब पढ़ने के दो तरीक़ों और स्कोर बनाने के चार तरीक़ों से जोड़ा। इससे 880 रेटर बने, जिनमें से हर एक को उन्हीं 189 रिकॉर्ड किए गए इंटरव्यू पर लागू किया गया, जो एक एनिमेटेड वर्चुअल इंटरव्यूअर ने लिए थे। हर इंटरव्यू से पहले प्रतिभागियों ने PHQ-8 भरा था — आठ प्रश्नों वाली डिप्रेशन प्रश्नावली, जिसका स्कोर 0 से 24 होता है; 10 या उससे ज़्यादा स्कोर स्क्रीनिंग की आम सीमा है। लगभग 30% प्रतिभागी इस सीमा को पार करते थे।
यह अध्ययन पहले से पंजीकृत (प्री-रजिस्टर्ड) था: प्रश्नावली से कोई भी तुलना करने से पहले विश्लेषण का कोड जमा (फ़्रीज़) कर दिया गया था। फिर इस तय प्रक्रिया को 86 नए इंटरव्यू पर एक बार चलाया गया, जो एक पूरी तरह स्वायत्त वर्चुअल इंटरव्यूअर ने लिए थे और जिनके ट्रांसक्रिप्ट अपने-आप बने थे। सारी प्रोसेसिंग एक स्थानीय वर्कस्टेशन पर ही हुई।
रेटर का वज़न मरीज़ से भारी
- एक इंटरव्यू, उलटे फ़ैसले। हल्के लक्षणों वाले एक प्रतिभागी (PHQ-8 स्कोर 5, सीमा से नीचे) को 880 में से आधे रेटरों ने स्क्रीनिंग में पॉज़िटिव बताया। किसी भी प्रतिभागी को सर्वसम्मत फ़ैसला नहीं मिला।
- सटीक रेटर भी असहमत रहते हैं। अच्छी विभेदन क्षमता (AUC 0.70 या ज़्यादा) वाले 540 रेटरों में से यादृच्छिक रूप से चुने गए दो रेटर 40% प्रतिभागियों के स्क्रीनिंग फ़ैसले पर असहमत थे।
- मॉडल व्यक्ति से ज़्यादा मायने रखता है। मॉडल के चुनाव ने स्कोर में 30.0% भिन्नता की व्याख्या की; प्रतिभागियों के बीच के स्थिर अंतरों ने 10.5% की — 2.8 गुना कम।
ग़लत शून्य वाली मशीन
सटीकता, जैसे आम तौर पर मापी जाती है, बताती है कि रेटर लोगों को कितनी अच्छी तरह क्रम में लगाता है। यह नहीं बताती कि वह कितने लोगों को चिह्नित करता है। रेटरों ने 0% से 100% तक प्रतिभागियों को चिह्नित किया, जबकि असल में यह 30% था। यह हिस्सा तय करती थी हर रेटर की औसत प्रवृत्ति — ज़्यादा या कम आँकने की (R² = 0.91)। लेखक इसकी तुलना वज़न तौलने वाली ऐसी मशीन से करते हैं जिसका शून्य ग़लत जगह पर है: वह लोगों को ठीक क्रम में लगा सकती है, लेकिन उसका यह खिसकाव तय करता है कि कौन रेखा पार करेगा। लगभग एक जैसी सटीकता वाले दो मॉडल, Qwen2.5 7B और Mistral 7B, हर 100 में से क्रमशः 24 और 80 लोगों को चिह्नित करते।
छोटी-छोटी तकनीकी बातें इस रेखा को खिसका देती थीं। जवाब के अक्षरों को उलट देने से — ताकि “A” का मतलब “बिल्कुल नहीं” के बजाय “लगभग हर दिन” हो जाए, जो क्लिनिकल रूप से एक बेमानी बदलाव है — चिह्नित लोगों का हिस्सा माध्यिका (मीडियन) में 21 अंक, और अधिकतम 85 अंक तक बदल गया। एक ही मॉडल को संपीड़ित (कंप्रेस्ड) फ़ाइल के रूप में अलग सॉफ़्टवेयर में चलाने से माध्यिका में 21% फ़ैसले बदल गए।
ये रेटिंग डिप्रेशन के अलावा भी चीज़ें पकड़ रही थीं। ये पोस्ट-ट्रॉमैटिक स्ट्रेस के लक्षणों से उतनी ही क़रीबी से मेल खाती थीं जितनी डिप्रेशन से; ज़्यादा बोलने वाले प्रतिभागियों को ज़्यादा बार चिह्नित किया गया; और 16% रेटरों ने प्रश्नावली में दर्ज महिलाओं और पुरुषों के बीच के छोटे अंतर की दिशा ही उलट दी।
कैलिब्रेशन मदद करता है, एक हद तक
चूँकि यह खिसकाव इतना कुछ तय कर रहा था, लेखक ने एक सुधार आज़माया: 40 स्थानीय रूप से लेबल किए गए प्रतिभागियों की मदद से हर रेटर की सीमा फिर से तय करना। सटीकता लगभग 60% से बढ़कर 75% हो गई, और असहमति आधी रह गई, 40% से 20%। लेकिन जब हर रेटर को बराबर संख्या में लोग चुनने पर मजबूर किया गया, तब भी लगभग हर पाँच में से एक बार उन्होंने अलग-अलग लोग चुने।
86 नए इंटरव्यू में, पहले से पंजीकृत छह जाँचने योग्य भविष्यवाणियों में से पाँच सही निकलीं। लेखक साफ़ सीमाएँ गिनाते हैं: सिर्फ़ 21 अरब पैरामीटर तक के ओपन मॉडल, क्योंकि डेटा वर्कस्टेशन से बाहर नहीं जा सकता था; कसौटी के रूप में स्व-रिपोर्ट की गई प्रश्नावली, न कि निदान; उन्हीं ट्रांसक्रिप्ट को रेट करने वाला कोई चिकित्सक नहीं; और एक ही प्रयोगशाला के अंग्रेज़ी भाषा के इंटरव्यू।
किसी स्कोर पर भरोसा करने से पहले पाँच जाँचें
शोधपत्र व्यावहारिक सलाह के साथ ख़त्म होता है: एक अकेली संख्या के बजाय समझदारी भरे विन्यासों (कॉन्फ़िगरेशन) में फ़ैसलों का दायरा बताएँ; पहले से एक तटस्थ विन्यास तय करें; स्थानीय रूप से कैलिब्रेट करें और बची हुई असहमति मापें; जाँचें कि रेटर और क्या पकड़ रहा है; और मॉडल, सॉफ़्टवेयर, ट्रांसक्रिप्शन या शब्दांकन में किसी भी बदलाव को एक नया उपकरण मानें। जैसा कि लेखक कहते हैं, जब पूछने का तरीक़ा बदलने से यह बदल जाए कि हम किसे पहचानते हैं, तो उपकरण ख़ुद व्याख्या का हिस्सा बन जाता है।
