चिकित्सा और स्वास्थ्यप्रीप्रिंटप्रयोगपढ़ने में 3 मिनट

जब AI ग़लत हो, तो एक दूसरा AI युवा डॉक्टरों की मदद करता है

AI मॉडल अब एक रेडियोग्राफ़ और मरीज़ का इतिहास देखकर लिखित तर्क के साथ निदान प्रस्तावित कर सकते हैं। इससे मदद मिलती है या नहीं, यह केवल मॉडल पर नहीं, बल्कि इस पर भी निर्भर करता है कि डॉक्टर कैसी प्रतिक्रिया देते हैं — ख़ासकर जब सुझाव ग़लत हो। शोधपत्र द्वारा उद्धृत पहले के अध्ययनों में पाया गया कि कम अनुभवी डॉक्टर AI की मदद से सबसे ज़्यादा लाभ उठाते हैं, लेकिन उसकी ग़लतियों से भटकने की संभावना भी उन्हीं की सबसे ज़्यादा होती है।

नानचांग विश्वविद्यालय और हांगकांग विज्ञान एवं प्रौद्योगिकी विश्वविद्यालय की एक टीम ने सामूहिक बुद्धिमत्ता से लिया गया एक सरल विचार परखा: डॉक्टरों को एक की जगह दो स्वतंत्र AI रायें दिखाना।

तीन समूहों वाला एक यादृच्छिक परीक्षण

लिन वू (Lin Wu), झे शू (Zhe Xu), फ़ूचिंग झोउ (Fuqing Zhou) और उनके सहयोगियों ने जुलाई से सितंबर 2026 के बीच चीन के तीन अस्पतालों में यह परीक्षण किया, जो चीनी क्लिनिकल ट्रायल रजिस्ट्री में पंजीकृत है। उन्होंने तीन साल से कम अनुभव वाले 132 रेज़िडेंट डॉक्टरों को भर्ती किया, रेडियोलॉजी के भी और दूसरी विशेषज्ञताओं (इंटरनल मेडिसिन, जनरल सर्जरी, आपातकालीन चिकित्सा) के भी, और उन्हें यादृच्छिक रूप से तीन समूहों में बाँटा:

  • समूह A: केवल GPT-5.4 के सुझाव;
  • समूह B: GPT-5.4 और Kimi-K2.6;
  • समूह C: GPT-5.4 और Gemini-3.6 Flash।

प्रतिभागियों को नहीं पता था कि वे कौन-से मॉडल देख रहे हैं। नेटवर्क की ख़राबी या तबीयत ठीक न होने के कारण नौ रेज़िडेंट बीच में हट गए, जिससे विश्लेषण में 123 बचे।

सभी ने वही 60 छाती और पेट के रेडियोग्राफ़ पढ़े। हर एक के लिए उन्होंने पहले अपने दम पर निदान दिया और उसे लॉक किया, फिर AI का सुझाव या सुझाव देखे, फिर अंतिम उत्तर दिया। मामलों को जान-बूझकर इस तरह चुना गया था कि हर मॉडल 60 में से ठीक 39 (65%) पर सही था — और साझा मॉडल GPT-5.4, 21 पर ग़लत था। तुलना के लिए, एक से पाँच साल के अनुभव वाले पाँच रेडियोलॉजिस्टों ने बिना AI के 54.3% अंक पाए।

ग़लत AI क्या करता है

सभी प्रतिभागियों को मिलाकर, AI की मदद से सटीकता 46.3% से बढ़कर 61.5% हो गई। दिलचस्प हिस्सा यह है कि उन 21 रेडियोग्राफ़ पर क्या हुआ जिन पर GPT-5.4 ग़लत था:

  • एक AI वाले रेडियोलॉजी रेज़िडेंट उन मामलों पर अंत में 20.0% सटीकता पर रहे। बिना AI के उसी समूह ने 31.4% अंक पाए थे: ग़लत सुझाव ने उन्हें नीचे खींच लिया।
  • दो AI के साथ रेडियोलॉजी रेज़िडेंट 40.1% और 40.4% तक पहुँचे।
  • दूसरी विशेषज्ञताओं के रेज़िडेंट भी यही पैटर्न दिखाते हैं, एक AI के साथ 12.1% से दो के साथ लगभग 31% तक।

सभी 60 मामलों पर, रेडियोलॉजी रेज़िडेंटों में एक AI के साथ 9.6 प्रतिशत अंकों का सुधार हुआ, और दो के साथ 16.3 और 17.5 अंकों का — लगभग 7 अंक ज़्यादा। पढ़ने के समय और आत्मविश्वास में समूहों के बीच कोई अंतर नहीं था।

मुफ़्त का सौदा नहीं

दूसरी राय की एक क़ीमत है। रेडियोलॉजी से बाहर के रेज़िडेंटों के लिए, जब GPT-5.4 सही था, तब दूसरा मॉडल जोड़ने से सटीकता 87.4% से घटकर लगभग 75% रह गई: असहमत AI उन्हें सही उत्तर से डिगा सकता था। कुल मिलाकर, उनका सुधार एक और दो AI के बीच अलग नहीं था। और जब दोनों मॉडल ग़लत थे, तो एक अन्वेषणात्मक विश्लेषण में दूसरे मॉडल से कोई उल्लेखनीय लाभ नहीं मिला।

लेखक निष्कर्ष निकालते हैं कि दो सुझाव ग़लत AI के प्रभाव को सीमित “कर सकते हैं”, जबकि कुल मिलाकर लाभ केवल रेडियोलॉजी रेज़िडेंटों को है।

ध्यान रखने लायक़ सीमाएँ

  • 60 मामलों को इस तरह चुना गया था कि हर मॉडल की सटीकता बराबर हो, इसलिए वे रोज़मर्रा के व्यवहार को नहीं दर्शाते।
  • असर इस पर निर्भर हो सकता है कि दोनों मॉडल कितनी बार असहमत होते हैं, जो एक जोड़ी से दूसरी जोड़ी में बदलता है।
  • नमूने के आकार की कोई औपचारिक गणना नहीं की गई; प्रतिभागियों की संख्या व्यवहार्य भर्ती पर आधारित थी।
  • यादृच्छिक आवंटन ख़ुद एक दूसरे भाषा मॉडल, DeepSeek, से एक संतुलित सूची माँगकर तैयार किया गया था, जिसे बिना बदलाव के इस्तेमाल किया गया।

लेखकों के अनुसार, अगला क़दम बिना चुने मरीज़ों और आई-ट्रैकिंग वाले अध्ययन हैं, ताकि देखा जा सके कि डॉक्टर असल में दो असहमत मशीनों को कैसे तौलते हैं।

Legal notice