वैद्यक आणि आरोग्यप्रीप्रिंटप्रयोगवाचनासाठी ३ मिनिटे

AI चुकते तेव्हा दुसरे AI तरुण डॉक्टरांना मदत करते

AI मॉडेल्स आता रेडिओग्राफ आणि रुग्णाचा इतिहास पाहून लेखी कारणमीमांसेसह निदान सुचवू शकतात. याचा उपयोग होतो की नाही हे फक्त मॉडेलवर नाही, तर डॉक्टर कसा प्रतिसाद देतात यावरही अवलंबून असते — विशेषतः सूचना चुकीची असते तेव्हा. शोधनिबंधाने उद्धृत केलेल्या आधीच्या अभ्यासांत असे आढळले की कमी अनुभवी डॉक्टरांना AI च्या मदतीचा सर्वाधिक फायदा होतो, पण त्याच्या चुकांनी भरकटण्याची शक्यताही त्यांच्याच बाबतीत सर्वाधिक असते.

नानचांग विद्यापीठ आणि हाँगकाँग युनिव्हर्सिटी ऑफ सायन्स अँड टेक्नॉलॉजी येथील एका पथकाने सामूहिक बुद्धिमत्तेतून आलेली एक साधी कल्पना तपासली: डॉक्टरांना एकाऐवजी दोन स्वतंत्र AI मते दाखवा.

तीन गटांची यादृच्छिक चाचणी

लिन वू (Lin Wu), झे शू (Zhe Xu), फुचिंग झोउ (Fuqing Zhou) आणि सहकाऱ्यांनी ही चाचणी जुलै ते सप्टेंबर 2026 दरम्यान चीनमधील तीन रुग्णालयांत घेतली, आणि चायनीज क्लिनिकल ट्रायल रजिस्ट्रीमध्ये तिची नोंदणी केली. त्यांनी तीन वर्षांहून कमी अनुभव असलेले 132 निवासी डॉक्टर (रेसिडेंट्स) भरती केले, रेडिओलॉजीमधील आणि इतर विशेषशाखांतील (अंतर्गत औषधशास्त्र, सामान्य शल्यचिकित्सा, आपत्कालीन वैद्यकशास्त्र) दोन्ही, आणि त्यांची यादृच्छिकपणे तीन गटांत विभागणी केली:

  • गट A: फक्त GPT-5.4 च्या सूचना;
  • गट B: GPT-5.4 अधिक Kimi-K2.6;
  • गट C: GPT-5.4 अधिक Gemini-3.6 Flash.

सहभागींना ते कोणती मॉडेल्स पाहत आहेत हे माहीत नव्हते. नेटवर्कमधील बिघाडामुळे किंवा अस्वस्थ वाटल्यामुळे नऊ निवासी डॉक्टरांनी माघार घेतली, त्यामुळे विश्लेषणात 123 उरले.

सर्वांनी छाती आणि पोटाचे तेच 60 रेडिओग्राफ वाचले. प्रत्येकासाठी त्यांनी आधी स्वतःहून निदान देऊन ते निश्चित केले, मग AI ची सूचना किंवा सूचना पाहिल्या, आणि मग अंतिम उत्तर दिले. प्रकरणे मुद्दाम अशी निवडली होती की प्रत्येक मॉडेल 60 पैकी नेमक्या 39 (65%) प्रकरणांत बरोबर होते — आणि सामायिक मॉडेल GPT-5.4 21 प्रकरणांत चुकले. तुलनेसाठी, एक ते पाच वर्षांचा अनुभव असलेल्या पाच रेडिओलॉजिस्टनी AI शिवाय 54.3% गुण मिळवले.

चुकीचे AI काय करते

सर्वांचा एकत्र विचार केला तर AI च्या मदतीने अचूकता 46.3% वरून 61.5% वर गेली. रंजक भाग असा की GPT-5.4 चुकले त्या 21 रेडिओग्राफवर काय घडले:

  • एकच AI असलेले रेडिओलॉजी निवासी डॉक्टर त्या प्रकरणांत 20.0% अचूकतेवर थांबले. AI शिवाय याच गटाने 31.4% गुण मिळवले होते: चुकीच्या सूचनेने त्यांना खाली खेचले.
  • दोन AI सोबत रेडिओलॉजी निवासी डॉक्टर 40.1% आणि 40.4% वर पोहोचले.
  • इतर विशेषशाखांतील निवासी डॉक्टरही हाच नमुना दाखवतात, एका AI सोबत 12.1% पासून दोनसोबत सुमारे 31% पर्यंत.

सर्व 60 प्रकरणांत, रेडिओलॉजी निवासी डॉक्टरांमध्ये एका AI सोबत 9.6 टक्के-गुणांची सुधारणा झाली, आणि दोनसोबत 16.3 व 17.5 गुणांची — सुमारे 7 गुण अधिक. वाचनाचा वेळ आणि आत्मविश्वास यांत गटांमध्ये फरक नव्हता.

फुकटचे जेवण नव्हे

दुसऱ्या मताची एक किंमत आहे. रेडिओलॉजीबाहेरील निवासी डॉक्टरांसाठी, GPT-5.4 बरोबर असताना दुसरे मॉडेल जोडल्याने अचूकता 87.4% वरून सुमारे 75% वर घसरली: विरोधी मत देणारे AI त्यांना बरोबर उत्तरापासून परावृत्त करू शकत होते. एकूण पाहता, त्यांच्या सुधारणेत एक आणि दोन AI मध्ये फरक नव्हता. आणि दोन्ही मॉडेल्स चुकली तेव्हा, एका शोधक विश्लेषणात दुसऱ्या मॉडेलचा कोणताही लक्षणीय फायदा आढळला नाही.

लेखक निष्कर्ष काढतात की दोन सूचना चुकीच्या AI चा प्रभाव मर्यादित “करू शकतात”, मात्र एकूण फायदा फक्त रेडिओलॉजी निवासी डॉक्टरांनाच झाला.

लक्षात ठेवाव्यात अशा मर्यादा

  • 60 प्रकरणे प्रत्येक मॉडेलला सारखीच अचूकता मिळावी म्हणून निवडली होती, त्यामुळे ती रोजच्या व्यवहाराचे प्रतिबिंब नाहीत.
  • परिणाम दोन मॉडेल्स किती वेळा असहमत होतात यावर अवलंबून असू शकतो, आणि ते एका जोडीपासून दुसऱ्या जोडीपर्यंत बदलते.
  • नमुना-आकाराची कोणतीही औपचारिक गणना केली गेली नाही; सहभागींची संख्या शक्य असलेल्या भरतीवर आधारित होती.
  • यादृच्छिक वाटपच दुसऱ्या एका भाषा-मॉडेलला, DeepSeek ला, संतुलित यादी मागून तयार केले गेले, आणि ती कोणताही बदल न करता वापरली गेली.

लेखकांच्या मते, पुढचे अभ्यास निवड न केलेल्या रुग्णांसह आणि नजर-मागोवा (आय-ट्रॅकिंग) वापरून होतील, जेणेकरून असहमत असलेल्या दोन यंत्रांना डॉक्टर प्रत्यक्षात कसे तोलतात हे पाहता येईल.

Legal notice