حين يخطئ الذكاء الاصطناعي، يساعد ذكاءٌ اصطناعي ثانٍ الأطباءَ الشباب
باتت نماذج الذكاء الاصطناعي قادرة على النظر إلى صورة أشعة وإلى سجلّ المريض واقتراح تشخيص مع تعليل مكتوب. وما إذا كان ذلك مفيدًا لا يتوقف على النموذج وحده، بل على ردّ فعل الأطباء — لا سيما حين يكون الاقتراح خاطئًا. وقد وجدت دراسات سابقة، تستشهد بها الورقة، أن الأطباء الأقل خبرة هم الأكثر استفادة من مساعدة الذكاء الاصطناعي، لكنهم أيضًا الأكثر عرضة للانقياد وراء أخطائه.
اختبر فريق من جامعة نانتشانغ وجامعة هونغ كونغ للعلوم والتكنولوجيا فكرة بسيطة مستمدة من الذكاء الجمعي: أن يُعرض على الأطباء رأيان مستقلان من الذكاء الاصطناعي بدلًا من رأي واحد.
تجربة عشوائية بثلاث أذرع
أجرى لين وو (Lin Wu) وتشه شو (Zhe Xu) وفوتشينغ تشو (Fuqing Zhou) وزملاؤهم التجربة في ثلاثة مستشفيات في الصين بين يوليو وسبتمبر 2026، وهي مسجّلة في السجل الصيني للتجارب السريرية. وجنّدوا 132 طبيبًا مقيمًا تقل خبرتهم عن ثلاث سنوات، من الأشعة ومن تخصصات أخرى (الطب الباطني، والجراحة العامة، وطب الطوارئ)، ووزّعوهم عشوائيًا على ثلاث مجموعات:
- المجموعة A: اقتراحات من GPT-5.4 وحده؛
- المجموعة B: GPT-5.4 إضافةً إلى Kimi-K2.6؛
- المجموعة C: GPT-5.4 إضافةً إلى Gemini-3.6 Flash.
لم يكن المشاركون يعرفون أيّ النماذج يرون. وانسحب تسعة أطباء مقيمين بسبب أعطال في الشبكة أو توعّك، فبقي 123 في التحليل.
قرأ الجميع 60 صورة الأشعة نفسها للصدر والبطن. وفي كل صورة، قدّموا أولًا تشخيصًا بمفردهم وثبّتوه، ثم اطّلعوا على اقتراح الذكاء الاصطناعي أو اقتراحاته، ثم قدّموا إجابة نهائية. واختيرت الحالات عمدًا بحيث يكون كل نموذج محقًا في 39 حالة من 60 بالضبط (65%) — وأخطأ GPT-5.4، النموذج المشترك، في 21 حالة. وللمقارنة، سجّل خمسة أطباء أشعة لديهم خبرة من سنة إلى خمس سنوات 54.3% دون ذكاء اصطناعي.
ما الذي يفعله ذكاء اصطناعي مخطئ
على مستوى جميع المشاركين، ارتفعت الدقة من 46.3% إلى 61.5% بمساعدة الذكاء الاصطناعي. لكن الجزء المثير للاهتمام هو ما حدث في الصور الـ21 التي أخطأ فيها GPT-5.4:
- انتهى أطباء الأشعة المقيمون مع نموذج واحد إلى دقة 20.0% في تلك الحالات. ومن دون ذكاء اصطناعي، كانت المجموعة نفسها قد سجّلت 31.4%: فقد جرّهم الاقتراح الخاطئ إلى الأسفل.
- ومع نموذجين، بلغ أطباء الأشعة المقيمون 40.1% و40.4%.
- ويُظهر الأطباء المقيمون من التخصصات الأخرى النمط نفسه، من 12.1% مع نموذج واحد إلى نحو 31% مع نموذجين.
وعلى الحالات الستين كلها، تحسّن أطباء الأشعة المقيمون بمقدار 9.6 نقطة مئوية مع نموذج واحد، وبمقدار 16.3 و17.5 نقطة مع نموذجين — أي نحو 7 نقاط إضافية. ولم يختلف زمن القراءة ولا مستوى الثقة بين المجموعات.
لا شيء بلا ثمن
للرأي الثاني ثمن. فلدى الأطباء المقيمين من خارج الأشعة، حين كان GPT-5.4 محقًا، أدت إضافة نموذج ثانٍ إلى خفض الدقة من 87.4% إلى نحو 75%: إذ يمكن لذكاء اصطناعي مخالف أن يثنيهم عن إجابة صحيحة. وإجمالًا، لم يختلف تحسّنهم بين نموذج واحد ونموذجين. وحين أخطأ النموذجان كلاهما، لم يجد تحليل استكشافي أي فائدة معتبرة من النموذج الثاني.
ويخلص المؤلفون إلى أن اقتراحين «قد» يحدّان من تأثير الذكاء الاصطناعي المخطئ، مع مكسب إجمالي لأطباء الأشعة المقيمين وحدهم.
حدود ينبغي تذكّرها
- اختيرت الحالات الستون بحيث تكون دقة كل النماذج واحدة، لذا فهي لا تعكس الممارسة اليومية.
- قد يتوقف الأثر على مدى تكرار اختلاف النموذجين، وهو ما يتفاوت من زوج إلى آخر.
- لم يُجرَ حساب رسمي لحجم العيّنة؛ واستند عدد المشاركين إلى ما أمكن تجنيده.
- أما التوزيع العشوائي نفسه، فقد أُعدّ بطلب قائمة متوازنة من نموذج لغوي آخر، هو DeepSeek، واستُخدمت دون تعديل.
ووفقًا للمؤلفين، تأتي بعد ذلك دراسات على مرضى غير منتقَين مع تتبّع حركة العين، لمعرفة كيف يوازن الأطباء فعليًا بين آلتين مختلفتين في الرأي.
