மருத்துவம் & உடல்நலம்முன்பதிப்புதரவுப் பகுப்பாய்வுபடிக்க 3 நிமிடங்கள்

AI தரும் மனச்சோர்வு மதிப்பெண்கள் அந்த AI-யைப் பொறுத்தவை

மனச்சோர்வைக் கண்டறிய இரத்தப் பரிசோதனை எதுவும் இல்லை. பெரிய மொழி மாதிரிகள் (large language models), மருத்துவ உரையாடல்களிலிருந்து சோர்வடையாத, மலிவான, மீண்டும் செய்யக்கூடிய மதிப்பீடுகளை உறுதியளிக்கின்றன; ஆரம்ப மதிப்பீடுகள் ஊக்கமளிப்பதாக இருந்தன. உளநல மருத்துவம் இதற்கு முன்பும் இதே போன்ற ஒரு கேள்வியை எதிர்கொண்டது: 1971இல், ஒரே காணொளி நேர்காணல்களைப் பார்த்த பிறகும் அமெரிக்க, பிரிட்டிஷ் உளநல மருத்துவர்கள் முரண்பட்டதை ஓர் ஆய்வு கண்டறிந்தது; அத்துறை தெளிவான அளவுகோல்களையும் கட்டமைக்கப்பட்ட நேர்காணல்களையும் கொண்டு பதிலளித்தது.

ஆனால் ஒரு மொழி மாதிரி, தொடர்ச்சியான தேர்வுகளின் மூலமே “மதிப்பீட்டாளராக” மாறுகிறது. யாரோ ஒருவர் மாதிரியைத் தேர்ந்தெடுக்கிறார், கோரிக்கையைச் சொல்லமைக்கிறார் — ஒரு கேள்வித்தாளாக, ஓர் உளநல மருத்துவரின் குரலில், அல்லது நோயாளியே தன்னைப் பற்றிப் பதிலளிப்பது போல —, பதில்களுக்கு எண்களையோ எழுத்துகளையோ தேர்வு செய்கிறார், மாதிரி நோயாளியின் வார்த்தைகளை மட்டும் படிக்குமா முழு உரையாடலையும் படிக்குமா என்று முடிவு செய்கிறார், அதன் வெளியீட்டை ஒரு மதிப்பெண்ணாக மாற்றுகிறார். மதிப்பீடுகள் இந்த மாற்று வழிகளை அரிதாகவே காட்டுகின்றன.

ஒரு மதிப்பீட்டாளரை உருவாக்க 880 வழிகள்

நியூயார்க்கின் மவுண்ட் சினாயில் உள்ள இகான் மருத்துவப் பள்ளியைச் சேர்ந்த பைஹான் லின் (Baihan Lin), 11 திறந்த மாதிரிகளை (100 கோடி முதல் 2,100 கோடி அளவுருக்கள் வரை) ஐந்து சொல்லமைப்புகள், உரையாடலின் இரண்டு பார்வைகள், பதிலைப் படிக்கும் இரண்டு வழிகள், மதிப்பெண்ணை உருவாக்கும் நான்கு வழிகள் ஆகியவற்றுடன் இணைத்தார். இது 880 மதிப்பீட்டாளர்களைத் தருகிறது; ஒவ்வொன்றும், அசைவூட்டப்பட்ட ஒரு மெய்நிகர் நேர்காணலாளர் நடத்திய அதே 189 பதிவு செய்யப்பட்ட நேர்காணல்களுக்குப் பயன்படுத்தப்பட்டது. ஒவ்வொரு நேர்காணலுக்கும் முன்பு, பங்கேற்பாளர்கள் PHQ-8 என்ற, 0 முதல் 24 வரை மதிப்பெண் வழங்கப்படும் எட்டு உருப்படிகள் கொண்ட மனச்சோர்வுக் கேள்வித்தாளை நிரப்பியிருந்தனர்; 10 அல்லது அதற்கு மேற்பட்ட மதிப்பெண் வழக்கமான பரிசோதனை வரம்பு. சுமார் 30% பங்கேற்பாளர்கள் அதைத் தாண்டினர்.

இந்த ஆய்வு முன்பதிவு செய்யப்பட்டது (pre-registered): கேள்வித்தாளுடன் எந்த ஒப்பீடும் செய்வதற்கு முன்பே பகுப்பாய்வுக் குறியீடு உறைய வைக்கப்பட்டது. பின்னர் பூட்டப்பட்ட நடைமுறை, முழுமையாகத் தன்னியக்கமான ஒரு மெய்நிகர் நேர்காணலாளர் தானியங்கி எழுத்துப்படிகளுடன் நடத்திய 86 புதிய நேர்காணல்களில் ஒருமுறை இயக்கப்பட்டது. அனைத்துச் செயலாக்கமும் ஒரு உள்ளூர்ப் பணிநிலையத்திலேயே நடந்தது.

நோயாளியை விட மதிப்பீட்டாளரே அதிக எடை

  • ஒரே நேர்காணல், எதிரெதிர்த் தீர்ப்புகள். லேசான அறிகுறிகள் கொண்ட ஒரு பங்கேற்பாளர் (PHQ-8 மதிப்பெண் 5, வரம்புக்குக் கீழே), 880 மதிப்பீட்டாளர்களில் பாதிப் பேரால் பரிசோதனை நேர்மறை எனக் குறிக்கப்பட்டார். எந்தப் பங்கேற்பாளருக்கும் ஒருமித்த தீர்ப்பு கிடைக்கவில்லை.
  • துல்லியமான மதிப்பீட்டாளர்களும் முரண்படுகின்றனர். நல்ல பிரித்தறியும் திறன் (AUC 0.70 அல்லது அதற்கு மேல்) கொண்ட 540 மதிப்பீட்டாளர்களில், சீரற்ற முறையில் எடுக்கப்பட்ட இருவர் 40% பங்கேற்பாளர்களுக்கான பரிசோதனை முடிவில் முரண்பட்டனர்.
  • நபரை விட மாதிரியே முக்கியம். மாதிரியின் தேர்வு மதிப்பெண் மாறுபாட்டில் 30.0%-ஐ விளக்கியது; பங்கேற்பாளர்களுக்கு இடையிலான நிலையான வேறுபாடுகள் 10.5%-ஐ — 2.8 மடங்கு குறைவு.

பூஜ்ஜியம் தவறிய ஓர் எடைக்கருவி

வழக்கமாக அளக்கப்படும் துல்லியம், ஒரு மதிப்பீட்டாளர் மக்களை எவ்வளவு நன்றாக வரிசைப்படுத்துகிறார் என்பதைச் சொல்கிறது. எத்தனை பேரைக் குறிக்கிறார் என்பதைச் சொல்வதில்லை. உண்மையில் 30% இருக்க, மதிப்பீட்டாளர்கள் 0% முதல் 100% வரை பங்கேற்பாளர்களைக் குறித்தனர். அந்த விகிதத்தைத் தீர்மானித்தது, ஒவ்வொரு மதிப்பீட்டாளரும் சராசரியாக அதிகமாகவோ குறைவாகவோ மதிப்பிடும் போக்கே (R² = 0.91). ஆசிரியர் இதைப் பூஜ்ஜியம் தவறிய ஒரு குளியலறை எடைக்கருவியுடன் ஒப்பிடுகிறார்: அது மக்களை நன்றாக வரிசைப்படுத்தலாம், ஆனால் அதன் விலகலே யார் கோட்டைத் தாண்டுகிறார் என்பதைத் தீர்மானிக்கிறது. கிட்டத்தட்ட ஒரே துல்லியம் கொண்ட இரண்டு மாதிரிகள், Qwen2.5 7B, Mistral 7B, 100 பேரில் முறையே 24, 80 பேரைக் குறிக்கும்.

சிறிய தொழில்நுட்ப நுணுக்கங்கள் அந்தக் கோட்டை நகர்த்தின. பதில் எழுத்துகளைத் தலைகீழாக்குவது — “A” என்பது “இல்லவே இல்லை” என்பதற்குப் பதிலாக “கிட்டத்தட்ட ஒவ்வொரு நாளும்” எனப் பொருள்படும்படி, மருத்துவ ரீதியாக அர்த்தமற்ற ஒரு மாற்றம் — குறிக்கப்பட்டவர்களின் விகிதத்தை இடைநிலை அளவாக (median) 21 புள்ளிகளும், அதிகபட்சம் 85 புள்ளிகளும் மாற்றியது. அதே மாதிரியை ஒரு சுருக்கப்பட்ட கோப்பாக வெவ்வேறு மென்பொருள்களில் இயக்கியது, இடைநிலை அளவாக 21% முடிவுகளை மாற்றியது.

மதிப்பெண்கள் மனச்சோர்வை விட அதிகமானவற்றையும் பிடித்தன. அவை அதிர்ச்சிக்குப் பிந்தைய மன அழுத்த (post-traumatic stress) அறிகுறிகளையும் மனச்சோர்வைப் போலவே நெருக்கமாகப் பின்தொடர்ந்தன; அதிகம் பேசும் பங்கேற்பாளர்கள் அடிக்கடி குறிக்கப்பட்டனர்; கேள்வித்தாள் காட்டிய பெண்கள்–ஆண்கள் இடையிலான சிறிய வேறுபாட்டின் திசையை 16% மதிப்பீட்டாளர்கள் தலைகீழாக்கினர்.

அளவுதிருத்தம் உதவுகிறது, ஒரு எல்லை வரை

விலகல் இவ்வளவு தாக்கம் செலுத்தியதால், ஆசிரியர் ஒரு திருத்தத்தை முயன்றார்: ஒவ்வொரு மதிப்பீட்டாளரின் வரம்பையும் உள்ளூரில் குறியிடப்பட்ட 40 பங்கேற்பாளர்களைக் கொண்டு மீட்டமைப்பது. துல்லியம் சுமார் 60%-இலிருந்து 75%-க்கு உயர்ந்தது; முரண்பாடு பாதியாக, 40%-இலிருந்து 20%-க்குக் குறைந்தது. ஆனால் ஒவ்வொரு மதிப்பீட்டாளரும் ஒரே எண்ணிக்கையிலான நபர்களைத் தேர்ந்தெடுக்கக் கட்டாயப்படுத்தப்பட்டபோதும், அவர்கள் சுமார் ஐந்தில் ஒரு முறை வெவ்வேறு நபர்களைத் தேர்ந்தெடுத்தனர்.

86 புதிய நேர்காணல்களில், சோதிக்கக்கூடிய ஆறு முன்பதிவுக் கணிப்புகளில் ஐந்து உறுதியாயின. ஆசிரியர் தெளிவான வரம்புகளைப் பட்டியலிடுகிறார்: தரவு பணிநிலையத்தை விட்டு வெளியேற முடியாததால், 2,100 கோடி அளவுருக்கள் வரையிலான திறந்த மாதிரிகள் மட்டுமே; அளவுகோலாக ஒரு நோயறிதல் அல்ல, சுயமாக நிரப்பப்பட்ட கேள்வித்தாள்; அதே எழுத்துப்படிகளை மதிப்பிடும் மருத்துவர்கள் இல்லை; ஒரே ஆய்வகத்திலிருந்து ஆங்கில மொழி நேர்காணல்கள்.

ஒரு மதிப்பெண்ணை நம்புவதற்கு முன் ஐந்து சரிபார்ப்புகள்

கட்டுரை நடைமுறை ஆலோசனைகளுடன் முடிகிறது: ஒற்றை எண்ணுக்குப் பதிலாக, நியாயமான அமைப்புகளுக்கு இடையிலான முடிவுகளின் வரம்பைத் தெரிவியுங்கள்; நடுநிலையான ஓர் அமைப்பை முன்கூட்டியே நிர்ணயியுங்கள்; உள்ளூரில் அளவுதிருத்தம் செய்து, எஞ்சியிருக்கும் முரண்பாட்டை அளவிடுங்கள்; மதிப்பீட்டாளர் வேறு எதையெல்லாம் பிடிக்கிறது என்று சோதியுங்கள்; மாதிரி, மென்பொருள், எழுத்துப்படியாக்கம், சொல்லமைப்பு ஆகியவற்றில் ஏற்படும் எந்த மாற்றத்தையும் ஒரு புதிய கருவியாகக் கருதுங்கள். ஆசிரியர் சொல்வது போல, நாம் கேட்கும் விதத்தை மாற்றுவது நாம் யாரை அடையாளம் காண்கிறோம் என்பதை மாற்றும்போது, கருவியே விளக்கத்தின் ஒரு பகுதியாகிவிடுகிறது.

Legal notice