AI ఇచ్చే డిప్రెషన్ స్కోర్లు AI మీదే ఆధారపడతాయి
డిప్రెషన్ను నిర్ధారించే రక్త పరీక్ష లేదు. పెద్ద భాషా మోడళ్లు (LLMలు) క్లినికల్ సంభాషణల నుంచి అలసట లేని, చౌకైన, మళ్లీ మళ్లీ ఒకేలా వచ్చే అంచనాలను వాగ్దానం చేస్తున్నాయి, తొలి మూల్యాంకనాలు ప్రోత్సాహకరంగా ఉన్నాయి. మనోవైద్యశాస్త్రం ఇలాంటి ప్రశ్నను ఇంతకుముందే ఎదుర్కొంది: 1971లో ఒక అధ్యయనం, ఒకే వీడియో ఇంటర్వ్యూలు చూసిన తర్వాత అమెరికా, బ్రిటన్ మనోవైద్యులు భిన్నాభిప్రాయాలు వ్యక్తం చేశారని కనుగొంది; ఆ రంగం స్పష్టమైన ప్రమాణాలు, నిర్మాణాత్మక ఇంటర్వ్యూలతో దానికి సమాధానం ఇచ్చింది.
కానీ ఒక భాషా మోడల్ వరుస ఎంపికల ద్వారా మాత్రమే “మూల్యాంకనదారు” అవుతుంది. ఎవరో మోడల్ను ఎంచుకుంటారు, అభ్యర్థనను పదాల్లో పెడతారు — ప్రశ్నావళిలా, మనోవైద్యుని స్వరంలో, లేదా రోగి తన గురించి తానే జవాబిస్తున్నట్టు — జవాబులకు అంకెలా అక్షరాలా ఎంచుకుంటారు, మోడల్ రోగి మాటలను మాత్రమే చదవాలా మొత్తం సంభాషణను చదవాలా నిర్ణయిస్తారు, దాని అవుట్పుట్ను స్కోరుగా మారుస్తారు. మూల్యాంకనాలు ఈ ప్రత్యామ్నాయాలను అరుదుగా చూపిస్తాయి.
ఒక మూల్యాంకనదారును తయారుచేయడానికి 880 మార్గాలు
న్యూయార్క్లోని ఐకాన్ స్కూల్ ఆఫ్ మెడిసిన్ ఎట్ మౌంట్ సైనాయ్కు చెందిన బైహాన్ లిన్ (Baihan Lin), 11 ఓపెన్ మోడళ్లను (100 కోట్ల నుంచి 2,100 కోట్ల పారామీటర్లు) ఐదు పదజాలాలు, సంభాషణకు రెండు దృక్కోణాలు, జవాబును చదివే రెండు విధానాలు, స్కోరును నిర్మించే నాలుగు విధానాలతో జతచేశారు. దాంతో 880 మూల్యాంకనదారులు తయారయ్యారు; ప్రతి ఒక్కరినీ యానిమేటెడ్ వర్చువల్ ఇంటర్వ్యూయర్ నిర్వహించిన అవే 189 రికార్డ్ చేసిన ఇంటర్వ్యూలకు వర్తింపజేశారు. ప్రతి ఇంటర్వ్యూకు ముందు, పాల్గొనేవారు PHQ-8 నింపారు: 0 నుంచి 24 వరకు స్కోరు ఇచ్చే ఎనిమిది అంశాల డిప్రెషన్ ప్రశ్నావళి; 10 లేదా అంతకంటే ఎక్కువ స్కోరు సాధారణ స్క్రీనింగ్ పరిమితి. సుమారు 30% మంది పాల్గొనేవారు దాన్ని దాటారు.
ఈ అధ్యయనం ముందస్తుగా నమోదు (pre-registered) చేసినది: ప్రశ్నావళితో ఏ పోలికా చేయకముందే విశ్లేషణ కోడ్ను స్థిరపరిచారు. ఆ తర్వాత లాక్ చేసిన ఆ విధానాన్ని, పూర్తిగా స్వయంప్రతిపత్తి గల వర్చువల్ ఇంటర్వ్యూయర్ నిర్వహించిన, ఆటోమేటిక్ ట్రాన్స్క్రిప్ట్లతో కూడిన 86 కొత్త ఇంటర్వ్యూలపై ఒక్కసారి నడిపారు. ప్రాసెసింగ్ అంతా ఒక స్థానిక వర్క్స్టేషన్లోనే జరిగింది.
రోగి కంటే మూల్యాంకనదారుదే పైచేయి
- ఒకే ఇంటర్వ్యూ, విరుద్ధ తీర్పులు. స్వల్ప లక్షణాలున్న ఒక పాల్గొనేవారిని (PHQ-8 స్కోరు 5, పరిమితి కంటే తక్కువ) 880 మూల్యాంకనదారుల్లో సగం మంది స్క్రీనింగ్ పాజిటివ్గా గుర్తించారు. ఏ పాల్గొనేవారికీ ఏకగ్రీవ తీర్పు రాలేదు.
- కచ్చితమైన మూల్యాంకనదారులూ విభేదిస్తారు. మంచి వివేచన సామర్థ్యం (AUC 0.70 లేదా అంతకంటే ఎక్కువ) ఉన్న 540 మూల్యాంకనదారుల్లో యాదృచ్ఛికంగా ఎంచుకున్న ఇద్దరు, 40% మంది పాల్గొనేవారి స్క్రీనింగ్ నిర్ణయంపై విభేదించారు.
- వ్యక్తి కంటే మోడల్ ముఖ్యం. స్కోర్లలోని వైవిధ్యంలో 30.0% మోడల్ ఎంపికతో వివరించవచ్చు; పాల్గొనేవారి మధ్య స్థిరమైన తేడాలు 10.5% మాత్రమే వివరిస్తాయి — 2.8 రెట్లు తక్కువ.
సున్నా తప్పిన తూకం యంత్రం
సాధారణంగా కొలిచే కచ్చితత్వం, ఒక మూల్యాంకనదారు మనుషులను ఎంత బాగా ర్యాంక్ చేస్తారో చెబుతుంది. ఎంతమందిని గుర్తిస్తారో చెప్పదు. మూల్యాంకనదారులు 0% నుంచి 100% వరకు ఎంతమందినైనా గుర్తించారు, వాస్తవంలో అది 30%. ఆ వాటాను నిర్ణయించింది ప్రతి మూల్యాంకనదారుకు సగటున ఎక్కువగా లేదా తక్కువగా రేట్ చేసే ధోరణే (R² = 0.91). రచయిత దీన్ని సున్నా తప్పిన బాత్రూమ్ తూకం యంత్రంతో పోలుస్తారు: అది మనుషులను బాగానే ర్యాంక్ చేయవచ్చు, కానీ దాని తప్పిన సున్నానే గీత దాటేదెవరో నిర్ణయిస్తుంది. దాదాపు ఒకే కచ్చితత్వం ఉన్న రెండు మోడళ్లు, Qwen2.5 7B, Mistral 7B, వరుసగా 100 మందిలో 24, 80 మందిని గుర్తిస్తాయి.
చిన్న చిన్న సాంకేతిక అంశాలు ఆ గీతను కదిలించాయి. జవాబు అక్షరాలను తిప్పడం — “A” అంటే “అస్సలు లేదు” బదులు “దాదాపు ప్రతిరోజూ” అని, క్లినికల్గా అర్థం లేని మార్పు — గుర్తించిన వారి వాటాను మధ్యగతంగా 21 పాయింట్లు, గరిష్ఠంగా 85 పాయింట్లు మార్చింది. అదే మోడల్ను కంప్రెస్ చేసిన ఫైల్గా వేర్వేరు సాఫ్ట్వేర్లలో నడిపితే మధ్యగతంగా 21% నిర్ణయాలు మారాయి.
ఈ అంచనాలు డిప్రెషన్ కంటే ఎక్కువే పట్టుకున్నాయి. అవి పోస్ట్-ట్రామాటిక్ స్ట్రెస్ లక్షణాలను డిప్రెషన్నంత దగ్గరగానే అనుసరించాయి, ఎక్కువగా మాట్లాడే పాల్గొనేవారు తరచుగా గుర్తించబడ్డారు, ప్రశ్నావళి నమోదుచేసిన స్త్రీలు, పురుషుల మధ్య చిన్న తేడా దిశను 16% మూల్యాంకనదారులు తలకిందులు చేశారు.
క్రమాంకనం సాయపడుతుంది, ఒక హద్దు వరకు
తప్పిన సున్నా ఇంత ప్రభావం చూపుతున్నందున, రచయిత ఒక మరమ్మతు ప్రయత్నించారు: స్థానికంగా లేబుల్ చేసిన 40 మంది పాల్గొనేవారితో ప్రతి మూల్యాంకనదారు పరిమితిని తిరిగి నిర్ణయించడం. కచ్చితత్వం సుమారు **60% నుంచి 75%**కు పెరిగింది, భిన్నాభిప్రాయం 40% నుంచి 20%కు, సగానికి తగ్గింది. కానీ ప్రతి మూల్యాంకనదారూ ఒకే సంఖ్యలో మనుషులను ఎంచుకునేలా బలవంతం చేసినా, వారు దాదాపు ఐదుసార్లలో ఒకసారి వేర్వేరు మనుషులను ఎంచుకున్నారు.
86 కొత్త ఇంటర్వ్యూలలో, పరీక్షించగలిగిన ఆరు ముందస్తు నమోదు అంచనాల్లో ఐదు నిలిచాయి. రచయిత స్పష్టమైన పరిమితులను పేర్కొన్నారు: డేటా వర్క్స్టేషన్ దాటి వెళ్లలేనందున 2,100 కోట్ల పారామీటర్ల వరకు ఉన్న ఓపెన్ మోడళ్లు మాత్రమే; ప్రమాణంగా నిర్ధారణ కాకుండా స్వయంగా నింపిన ప్రశ్నావళి; అవే ట్రాన్స్క్రిప్ట్లను రేట్ చేసిన వైద్యులు ఎవరూ లేరు; ఒకే ప్రయోగశాల నుంచి వచ్చిన ఇంగ్లీష్ ఇంటర్వ్యూలు.
స్కోరును నమ్మే ముందు ఐదు తనిఖీలు
పత్రం ఆచరణాత్మక సలహాతో ముగుస్తుంది: ఒకే సంఖ్య బదులు, సహేతుకమైన కాన్ఫిగరేషన్లలో నిర్ణయాల పరిధిని నివేదించండి; ముందుగానే ఒక తటస్థ కాన్ఫిగరేషన్ను స్థిరపరచండి; స్థానికంగా క్రమాంకనం చేసి మిగిలిన భిన్నాభిప్రాయాన్ని కొలవండి; మూల్యాంకనదారు ఇంకా ఏం పట్టుకుంటుందో పరీక్షించండి; మోడల్, సాఫ్ట్వేర్, ట్రాన్స్క్రిప్షన్ లేదా పదజాలంలో ఏ మార్పునైనా కొత్త సాధనంగా పరిగణించండి. రచయిత మాటల్లో, మనం ఎలా అడుగుతామో మార్చడం మనం ఎవరిని గుర్తిస్తామో మారిస్తే, సాధనమే వివరణలో భాగమవుతుంది.
