جدوں اے آئی غلط ہووے، دوجا اے آئی نویں ڈاکٹراں دی مدد کردا اے
اے آئی ماڈل ہُن اک ریڈیوگراف تے مریض دی ہسٹری ویکھ کے لکھی ہوئی دلیل نال اک تشخیص دسا سکدے نیں۔ ایہ مدد کردا اے یا نہیں، ایہ صرف ماڈل اُتے نہیں، ڈاکٹراں دے ردعمل اُتے وی منحصر اے — خاص کر کے جدوں صلاح غلط ہووے۔ مقالے وچ دتیاں گئیاں پچھلیاں تحقیقاں نے لبھیا پئی گھٹ تجربے والے ڈاکٹر اے آئی دی مدد توں سب توں ودھ فائدہ چُکدے نیں پر ایہدیاں غلطیاں پچھے بھٹکن دا خطرہ وی اوہناں نوں ای سب توں ودھ ہوندا اے۔
نانچانگ یونیورسٹی تے ہانگ کانگ یونیورسٹی آف سائنس اینڈ ٹیکنالوجی دی اک ٹیم نے اجتماعی ذہانت توں لئے گئے اک سادے خیال نوں پرکھیا: ڈاکٹراں نوں اک دی تھاں دو آزاد اے آئی رائیاں وکھاؤ۔
تن بازوآں والا اک بے ترتیب تجربہ
لن وو، ژے ژو، فوچنگ ژاؤ تے ساتھیاں نے جولائی تے ستمبر 2026 دے وچکار چین دے تن ہسپتالاں وچ ایہ تجربہ کیتا، جیہڑا Chinese Clinical Trial Registry وچ درج سی۔ اوہناں نے تن سال توں گھٹ تجربے والے 132 ریزیڈنٹ ڈاکٹر بھرتی کیتے، ریڈیالوجی وچوں وی تے ہور شعبیاں (اندرونی طب، جنرل سرجری، ایمرجنسی میڈیسن) وچوں وی، تے اوہناں نوں بے ترتیبی نال تن ٹولیاں وچ ونڈیا:
- ٹولی A: صرف GPT-5.4 دیاں صلاحاں؛
- ٹولی B: GPT-5.4 تے Kimi-K2.6؛
- ٹولی C: GPT-5.4 تے Gemini-3.6 Flash۔
حصہ لین والیاں نوں پتہ نہیں سی پئی اوہ کیہڑے ماڈل ویکھ رہے نیں۔ نیٹ ورک دیاں خرابیاں یا طبیعت خراب ہون پاروں نو ریزیڈنٹ نکل گئے، تے تجزیے وچ 123 رہ گئے۔
سب نے اوہی 60 چھاتی تے ڈھڈ دے ریڈیوگراف پڑھے۔ ہر اک لئی، اوہناں نے پہلاں اپنے آپ تشخیص دتی تے اوہنوں پکا کر دتا، فیر اے آئی دی صلاح یا صلاحاں ویکھیاں، فیر آخری جواب دتا۔ کیس جان بجھ کے انج چُنے گئے پئی ہر ماڈل 60 وچوں ٹھیک 39 (65%) اُتے صحیح سی — تے GPT-5.4، سانجھا ماڈل، 21 اُتے غلط سی۔ مقابلے لئی، اک توں پنج سال تجربے والے پنج ریڈیالوجسٹاں نے بنا اے آئی دے 54.3% سکور کیتا۔
غلط اے آئی کیہ کردا اے
سب نوں رلا کے، اے آئی دی مدد نال درستگی 46.3% توں 61.5% تیک ودھی۔ دلچسپ گل اوہ اے جیہڑی اوہناں 21 ریڈیوگرافاں اُتے ہوئی جتھے GPT-5.4 غلط سی:
- اک اے آئی والے ریڈیالوجی ریزیڈنٹ اوہناں کیساں اُتے 20.0% درستگی اُتے مُکے۔ بنا اے آئی دے، ایسے ٹولی نے 31.4% سکور کیتا سی: غلط صلاح نے اوہناں نوں تھلے کھچ لیا۔
- دو اے آئیاں نال، ریڈیالوجی ریزیڈنٹ 40.1% تے 40.4% تیک اپڑے۔
- ہور شعبیاں دے ریزیڈنٹ وی اوہی نمونہ وکھاؤندے نیں، اک اے آئی نال 12.1% توں دو نال لگ بھگ 31% تیک۔
سارے 60 کیساں اُتے، ریڈیالوجی ریزیڈنٹاں نے اک اے آئی نال 9.6 فیصدی پوائنٹ، تے دو نال 16.3 تے 17.5 پوائنٹ بہتری کیتی — لگ بھگ 7 پوائنٹ ودھ۔ پڑھن دا ویلا تے بھروسہ ٹولیاں وچ وکھرا نہیں سی۔
مفت دی روٹی نہیں
دوجی رائے دی اک قیمت اے۔ ریڈیالوجی توں باہر دے ریزیڈنٹاں لئی، جدوں GPT-5.4 ٹھیک سی، دوجا ماڈل جوڑن نال درستگی 87.4% توں لگ بھگ 75% تیک گھٹ گئی: اختلاف کرن والا اے آئی اوہناں نوں صحیح جواب توں ہٹا سکدا سی۔ کل ملا کے، اوہناں دی بہتری اک تے دو اے آئیاں نال وکھری نہیں سی۔ تے جدوں دوویں ماڈل غلط سن، اک کھوجی تجزیے نوں دوجے ماڈل توں کوئی خاص فائدہ نہیں لبھا۔
لکھاری ایس نتیجے اُتے اپڑدے نیں پئی دو صلاحاں غلط اے آئی دے اثر نوں “شاید” گھٹا سکدیاں نیں، تے کل ملا کے فائدہ صرف ریڈیالوجی ریزیڈنٹاں نوں اے۔
یاد رکھن والیاں حداں
- 60 کیس انج چُنے گئے پئی ہر ماڈل دی درستگی اکو جیہی ہووے، ایس لئی اوہ روزمرہ دے کم دی عکاسی نہیں کردے۔
- اثر ایس گل اُتے منحصر ہو سکدا اے پئی دوویں ماڈل کنی واری اختلاف کردے نیں، جیہڑا اک جوڑی توں دوجی تیک بدلدا اے۔
- نمونے دے سائز دا کوئی باقاعدہ حساب نہیں کیتا گیا؛ حصہ لین والیاں دی گنتی ممکن بھرتی اُتے ٹکی سی۔
- بے ترتیب ونڈ آپ اک ہور زبانی ماڈل، DeepSeek، کولوں اک متوازن لسٹ منگ کے بنائی گئی، جیہڑی بنا بدلے ورتی گئی۔
لکھاریاں دے مطابق، اگلیاں تحقیقاں بنا چُنے مریضاں تے اکھاں دی ٹریکنگ (eye-tracking) نال ہون گیاں، ایہ ویکھن لئی پئی ڈاکٹر اختلاف کرن والیاں دو مشیناں نوں اصل وچ کویں تولدے نیں۔
