వైద్యం & ఆరోగ్యంప్రీప్రింట్ప్రయోగంచదవడానికి 2 నిమిషాలు

AI తప్పు చేసినప్పుడు, రెండో AI యువ వైద్యులకు సహాయపడుతుంది

AI మోడళ్లు ఇప్పుడు ఒక రేడియోగ్రాఫ్‌ను, రోగి చరిత్రను చూసి, రాతపూర్వక హేతువుతో నిర్ధారణను ప్రతిపాదించగలవు. అది సహాయపడుతుందా అనేది మోడల్‌పై మాత్రమే కాకుండా, వైద్యులు ఎలా స్పందిస్తారనే దానిపై కూడా ఆధారపడి ఉంటుంది — ముఖ్యంగా సూచన తప్పుగా ఉన్నప్పుడు. పత్రం ఉదహరించిన గత అధ్యయనాలు, తక్కువ అనుభవం ఉన్న వైద్యులు AI సహాయం నుంచి ఎక్కువగా లాభపడతారని, కానీ దాని తప్పులకు దారి తప్పే అవకాశం కూడా వారికే ఎక్కువని కనుగొన్నాయి.

నాన్‌చాంగ్ విశ్వవిద్యాలయం, హాంకాంగ్ యూనివర్సిటీ ఆఫ్ సైన్స్ అండ్ టెక్నాలజీకి చెందిన ఒక బృందం సామూహిక మేధస్సు నుంచి తీసుకున్న ఒక సరళమైన ఆలోచనను పరీక్షించింది: వైద్యులకు ఒకటి కాకుండా రెండు స్వతంత్ర AI అభిప్రాయాలు చూపించడం.

మూడు భుజాల యాదృచ్ఛిక పరీక్ష

లిన్ వూ (Lin Wu), ఝే షు (Zhe Xu), ఫూచింగ్ ఝౌ (Fuqing Zhou), సహచరులు 2026 జూలై నుంచి సెప్టెంబర్ మధ్య చైనాలోని మూడు ఆసుపత్రుల్లో ఈ పరీక్షను నిర్వహించారు, దాన్ని చైనీస్ క్లినికల్ ట్రయల్ రిజిస్ట్రీలో నమోదు చేశారు. వారు మూడేళ్ల కంటే తక్కువ అనుభవం ఉన్న 132 రెసిడెంట్ వైద్యులను చేర్చుకున్నారు, రేడియాలజీ నుంచి, ఇతర స్పెషాలిటీల (ఇంటర్నల్ మెడిసిన్, జనరల్ సర్జరీ, ఎమర్జెన్సీ మెడిసిన్) నుంచి కూడా, వారిని యాదృచ్ఛికంగా మూడు గుంపులకు కేటాయించారు:

  • గుంపు A: కేవలం GPT-5.4 నుంచి సూచనలు;
  • గుంపు B: GPT-5.4 తో పాటు Kimi-K2.6;
  • గుంపు C: GPT-5.4 తో పాటు Gemini-3.6 Flash.

పాల్గొన్నవారికి తాము ఏ మోడళ్లను చూస్తున్నారో తెలియదు. నెట్‌వర్క్ వైఫల్యాలు లేదా అస్వస్థత వల్ల తొమ్మిది మంది రెసిడెంట్లు వైదొలిగారు, విశ్లేషణలో 123 మంది మిగిలారు.

అందరూ అవే 60 ఛాతీ, ఉదర రేడియోగ్రాఫ్‌లను చదివారు. ప్రతి దానికీ, వారు ముందు స్వయంగా నిర్ధారణ ఇచ్చి దాన్ని లాక్ చేశారు, తర్వాత AI సూచన లేదా సూచనలను చూశారు, ఆ తర్వాత తుది సమాధానం ఇచ్చారు. ప్రతి మోడల్ 60 లో సరిగ్గా 39 (65%) కేసుల్లో సరైనదిగా ఉండేలా కేసులను ఉద్దేశపూర్వకంగా ఎంచుకున్నారు — ఉమ్మడి మోడల్ అయిన GPT-5.4, 21 కేసుల్లో తప్పు చేసింది. పోలికకు, ఒకటి నుంచి ఐదేళ్ల అనుభవం ఉన్న ఐదుగురు రేడియాలజిస్టులు AI లేకుండా 54.3% స్కోర్ చేశారు.

తప్పుడు AI ఏం చేస్తుంది

అందరినీ కలిపి చూస్తే, AI సహాయంతో కచ్చితత్వం 46.3% నుంచి 61.5%కి పెరిగింది. ఆసక్తికరమైన భాగం, GPT-5.4 తప్పు చేసిన 21 రేడియోగ్రాఫ్‌లపై ఏం జరిగిందన్నది:

  • ఒకే AI ఉన్న రేడియాలజీ రెసిడెంట్లు ఆ కేసుల్లో 20.0% కచ్చితత్వం వద్ద ఆగారు. AI లేకుండా, అదే గుంపు 31.4% స్కోర్ చేసింది: తప్పుడు సూచన వారిని కిందికి లాగింది.
  • రెండు AI లతో, రేడియాలజీ రెసిడెంట్లు 40.1%, 40.4% కు చేరారు.
  • ఇతర స్పెషాలిటీల రెసిడెంట్లు కూడా అదే నమూనాను చూపుతారు, ఒక AI తో 12.1% నుంచి రెండింటితో సుమారు 31% వరకు.

మొత్తం 60 కేసులపై, రేడియాలజీ రెసిడెంట్లు ఒక AI తో 9.6 శాతం పాయింట్లు, రెండింటితో 16.3, 17.5 పాయింట్లు మెరుగుపడ్డారు — సుమారు 7 పాయింట్లు ఎక్కువ. చదివే సమయం, ఆత్మవిశ్వాసం గుంపుల మధ్య తేడా లేదు.

ఉచిత భోజనం కాదు

రెండో అభిప్రాయానికి ఒక మూల్యం ఉంది. రేడియాలజీ బయటి రెసిడెంట్లకు, GPT-5.4 సరైనప్పుడు, రెండో మోడల్‌ను జోడించడం కచ్చితత్వాన్ని 87.4% నుంచి సుమారు 75%కి తగ్గించింది: విభేదించే AI వారిని సరైన సమాధానం నుంచి మళ్లించగలదు. మొత్తంగా, వారి మెరుగుదల ఒక AI, రెండు AI ల మధ్య తేడా లేదు. రెండు మోడళ్లూ తప్పు చేసినప్పుడు, ఒక అన్వేషణాత్మక విశ్లేషణ రెండో దాని నుంచి గణనీయమైన ప్రయోజనాన్ని కనుగొనలేదు.

రెండు సూచనలు తప్పుడు AI ప్రభావాన్ని పరిమితం “చేయవచ్చు” అని రచయితలు తేల్చారు, మొత్తం మీద లాభం రేడియాలజీ రెసిడెంట్లకు మాత్రమే.

గుర్తుంచుకోవాల్సిన పరిమితులు

  • ప్రతి మోడల్‌కూ ఒకే కచ్చితత్వం వచ్చేలా 60 కేసులను ఎంచుకున్నారు, కాబట్టి అవి రోజువారీ ఆచరణను ప్రతిబింబించవు.
  • రెండు మోడళ్లు ఎంత తరచుగా విభేదిస్తాయనే దానిపై ప్రభావం ఆధారపడి ఉండవచ్చు, అది ఒక జత నుంచి మరో జతకు మారుతుంది.
  • లాంఛనప్రాయమైన నమూనా-పరిమాణ గణన చేయలేదు; పాల్గొనేవారి సంఖ్యను సాధ్యమైన నియామకం ఆధారంగా నిర్ణయించారు.
  • యాదృచ్ఛిక కేటాయింపునే మరో భాషా మోడల్ అయిన DeepSeek ను ఒక సమతుల్య జాబితా అడిగి రూపొందించారు, దాన్ని ఏ మార్పూ లేకుండా వాడారు.

రచయితల ప్రకారం, తర్వాత ఎంపిక చేయని రోగులతో, కంటి కదలికల ట్రాకింగ్‌తో అధ్యయనాలు వస్తాయి, విభేదించే రెండు యంత్రాలను వైద్యులు నిజంగా ఎలా తూకం వేస్తారో చూడటానికి.

Legal notice