طب اور صحتپری پرنٹتجربہ4 منٹ کا مطالعہ

جب مصنوعی ذہانت غلط ہو تو دوسری مصنوعی ذہانت نوجوان ڈاکٹروں کی مدد کرتی ہے

مصنوعی ذہانت کے ماڈل اب ایک ریڈیوگراف اور مریض کی طبی تاریخ دیکھ کر تحریری جواز کے ساتھ تشخیص تجویز کر سکتے ہیں۔ یہ مددگار ہے یا نہیں، اس کا انحصار صرف ماڈل پر نہیں بلکہ اس پر بھی ہے کہ ڈاکٹر کیسا ردِعمل دیتے ہیں — خاص طور پر جب تجویز غلط ہو۔ مقالے میں حوالہ دیے گئے سابقہ مطالعات سے پتا چلا کہ کم تجربہ کار ڈاکٹر مصنوعی ذہانت کی مدد سے سب سے زیادہ فائدہ اٹھاتے ہیں، لیکن اس کی غلطیوں سے گمراہ ہونے کا امکان بھی انہی کا سب سے زیادہ ہوتا ہے۔

نانچانگ یونیورسٹی اور ہانگ کانگ یونیورسٹی آف سائنس اینڈ ٹیکنالوجی کی ایک ٹیم نے اجتماعی ذہانت سے ماخوذ ایک سادہ خیال آزمایا: ڈاکٹروں کو ایک کے بجائے مصنوعی ذہانت کی دو آزاد آرا دکھائی جائیں۔

تین شاخوں والا بے ترتیب تجربہ

لِن وو (Lin Wu)، ژے شو (Zhe Xu)، فو چِنگ ژو (Fuqing Zhou) اور ان کے ساتھیوں نے جولائی سے ستمبر 2026 کے درمیان چین کے تین اسپتالوں میں یہ تجربہ کیا، جو چینی کلینیکل ٹرائل رجسٹری میں درج ہے۔ انہوں نے تین سال سے کم تجربے والے 132 زیرِ تربیت ڈاکٹر (ریذیڈنٹس) بھرتی کیے، ریڈیالوجی سے بھی اور دوسری تخصصات (اندرونی طب، جنرل سرجری، ایمرجنسی میڈیسن) سے بھی، اور انہیں بے ترتیب طور پر تین گروہوں میں تقسیم کیا:

  • گروہ A: صرف GPT-5.4 کی تجاویز؛
  • گروہ B: GPT-5.4 کے علاوہ Kimi-K2.6؛
  • گروہ C: GPT-5.4 کے علاوہ Gemini-3.6 Flash۔

شرکا کو معلوم نہیں تھا کہ وہ کون سے ماڈل دیکھ رہے ہیں۔ نیٹ ورک کی خرابی یا طبیعت ناساز ہونے کی وجہ سے نو زیرِ تربیت ڈاکٹر الگ ہو گئے، اور تجزیے میں 123 باقی رہے۔

سب نے سینے اور پیٹ کے وہی 60 ریڈیوگراف پڑھے۔ ہر ایک کے لیے انہوں نے پہلے خود تشخیص دی اور اسے حتمی طور پر درج کر دیا، پھر مصنوعی ذہانت کی تجویز یا تجاویز دیکھیں، پھر حتمی جواب دیا۔ کیسز جان بوجھ کر اس طرح چنے گئے کہ ہر ماڈل 60 میں سے ٹھیک 39 (65%) پر درست ہو — اور مشترکہ ماڈل GPT-5.4 21 پر غلط تھا۔ موازنے کے لیے، ایک سے پانچ سال تجربے والے پانچ ماہرینِ ریڈیالوجی نے مصنوعی ذہانت کے بغیر 54.3% حاصل کیا۔

غلط مصنوعی ذہانت کیا کرتی ہے

سب شرکا کو ملا کر، مصنوعی ذہانت کی مدد سے درستی 46.3% سے بڑھ کر 61.5% ہو گئی۔ دلچسپ حصہ یہ ہے کہ ان 21 ریڈیوگرافس پر کیا ہوا جہاں GPT-5.4 غلط تھا:

  • ایک مصنوعی ذہانت کے ساتھ ریڈیالوجی کے زیرِ تربیت ڈاکٹر ان کیسز پر 20.0% درستی پر پہنچے۔ مصنوعی ذہانت کے بغیر اسی گروہ نے 31.4% حاصل کیا تھا: غلط تجویز نے انہیں نیچے کھینچ لیا۔
  • دو مصنوعی ذہانتوں کے ساتھ ریڈیالوجی کے زیرِ تربیت ڈاکٹر 40.1% اور 40.4% تک پہنچے۔
  • دوسری تخصصات کے زیرِ تربیت ڈاکٹر بھی یہی انداز دکھاتے ہیں، ایک مصنوعی ذہانت کے ساتھ 12.1% سے دو کے ساتھ تقریباً 31% تک۔

تمام 60 کیسز پر ریڈیالوجی کے زیرِ تربیت ڈاکٹروں میں ایک مصنوعی ذہانت کے ساتھ 9.6 فیصدی پوائنٹس کی بہتری آئی، اور دو کے ساتھ 16.3 اور 17.5 پوائنٹس کی — یعنی تقریباً 7 پوائنٹس زیادہ۔ پڑھنے کے وقت اور اعتماد میں گروہوں کے درمیان کوئی فرق نہیں تھا۔

مفت میں کچھ نہیں ملتا

دوسری رائے کی ایک قیمت ہے۔ ریڈیالوجی سے باہر کے زیرِ تربیت ڈاکٹروں کے لیے، جب GPT-5.4 درست تھا، دوسرا ماڈل شامل کرنے سے درستی 87.4% سے گھٹ کر تقریباً 75% رہ گئی: اختلاف کرنے والی مصنوعی ذہانت انہیں درست جواب سے ہٹا سکتی تھی۔ مجموعی طور پر ان کی بہتری میں ایک اور دو مصنوعی ذہانتوں کے درمیان کوئی فرق نہیں تھا۔ اور جب دونوں ماڈل غلط تھے تو ایک جستجویانہ تجزیے کو دوسرے ماڈل سے کوئی نمایاں فائدہ نہیں ملا۔

مصنفین کا نتیجہ ہے کہ دو تجاویز غلط مصنوعی ذہانت کے اثر کو محدود “کر سکتی ہیں”، جبکہ مجموعی فائدہ صرف ریڈیالوجی کے زیرِ تربیت ڈاکٹروں کو ہوا۔

ذہن میں رکھنے کی حدود

  • 60 کیسز اس طرح منتخب کیے گئے کہ ہر ماڈل کی درستی یکساں ہو، اس لیے یہ روزمرہ کی طبی مشق کی عکاسی نہیں کرتے۔
  • اثر اس پر منحصر ہو سکتا ہے کہ دونوں ماڈل کتنی بار اختلاف کرتے ہیں، جو ایک جوڑے سے دوسرے میں مختلف ہوتا ہے۔
  • نمونے کے حجم کا کوئی باضابطہ حساب نہیں کیا گیا؛ شرکا کی تعداد قابلِ عمل بھرتی کی بنیاد پر طے ہوئی۔
  • بے ترتیب تقسیم خود ایک اور لسانی ماڈل، DeepSeek، سے ایک متوازن فہرست مانگ کر تیار کی گئی، جو بغیر کسی تبدیلی کے استعمال ہوئی۔

مصنفین کے مطابق اگلا قدم غیر منتخب مریضوں اور آنکھوں کی حرکت کی نگرانی (آئی ٹریکنگ) کے ساتھ مطالعات ہیں، تاکہ دیکھا جا سکے کہ ڈاکٹر حقیقت میں دو اختلاف کرتی مشینوں کی رائے کو کیسے تولتے ہیں۔

Legal notice