وقتی هوش مصنوعی اشتباه میکند، هوش مصنوعی دوم به پزشکان جوان کمک میکند
مدلهای هوش مصنوعی اکنون میتوانند به یک پرتونگاری و پیشینهٔ بیمار نگاه کنند و تشخیصی همراه با استدلالی نوشتهشده پیشنهاد دهند. اینکه آیا این کار کمک میکند، نه تنها به مدل، بلکه به واکنش پزشکان بستگی دارد — بهویژه وقتی پیشنهاد نادرست است. پژوهشهای پیشینی که مقاله به آنها استناد میکند نشان دادهاند که پزشکان کمتجربهتر بیشترین سود را از کمک هوش مصنوعی میبرند، اما همچنین بیشترین احتمال را دارند که با خطاهای آن به بیراهه بروند.
گروهی از دانشگاه نانچانگ و دانشگاه علم و فناوری هنگکنگ ایدهای ساده برگرفته از هوش جمعی را آزمود: نشان دادن دو نظر مستقل هوش مصنوعی به جای یکی به پزشکان.
کارآزمایی تصادفیشده با سه بازو
لین وو، ژه شو، فوچینگ ژو و همکارانشان این کارآزمایی را میان ژوئیه و سپتامبر ۲۰۲۶ در سه بیمارستان در چین انجام دادند که در سامانهٔ ثبت کارآزماییهای بالینی چین (Chinese Clinical Trial Registry) ثبت شده است. آنها ۱۳۲ دستیار با کمتر از سه سال تجربه را، هم در رادیولوژی و هم در تخصصهای دیگر (پزشکی داخلی، جراحی عمومی، طب اورژانس)، به کار گرفتند و بهطور تصادفی در سه گروه قرار دادند:
- گروه A: پیشنهادهای GPT-5.4 بهتنهایی؛
- گروه B: GPT-5.4 بهاضافهٔ Kimi-K2.6؛
- گروه C: GPT-5.4 بهاضافهٔ Gemini-3.6 Flash.
شرکتکنندگان نمیدانستند کدام مدلها را میبینند. نُه دستیار به دلیل اختلال شبکه یا ناخوشی کنار رفتند و ۱۲۳ نفر در تحلیل ماندند.
همه همان ۶۰ پرتونگاری قفسهٔ سینه و شکم را خواندند. برای هر کدام، نخست بهتنهایی تشخیصی دادند و آن را قفل کردند، سپس پیشنهاد یا پیشنهادهای هوش مصنوعی را دیدند و آنگاه پاسخ نهایی دادند. موارد عمداً طوری برگزیده شدند که هر مدل دقیقاً در ۳۹ مورد از ۶۰ (۶۵٪) درست بگوید — و GPT-5.4، مدل مشترک، در ۲۱ مورد اشتباه کرد. برای مقایسه، پنج رادیولوژیست با یک تا پنج سال تجربه بدون هوش مصنوعی ۵۴٫۳٪ امتیاز گرفتند.
یک هوش مصنوعی اشتباه چه میکند
در مجموع شرکتکنندگان، دقت با کمک هوش مصنوعی از ۴۶٫۳٪ به ۶۱٫۵٪ رسید. بخش جالب، اتفاقی است که روی ۲۱ پرتونگاریای افتاد که GPT-5.4 در آنها اشتباه کرده بود:
- دستیاران رادیولوژی با یک هوش مصنوعی روی این موارد با دقت ۲۰٫۰٪ به پایان رسیدند. بدون هوش مصنوعی، همین گروه ۳۱٫۴٪ گرفته بود: پیشنهاد نادرست آنها را پایین کشید.
- با دو هوش مصنوعی، دستیاران رادیولوژی به ۴۰٫۱٪ و ۴۰٫۴٪ رسیدند.
- دستیاران تخصصهای دیگر همین الگو را نشان میدهند، از ۱۲٫۱٪ با یک هوش مصنوعی به حدود ۳۱٪ با دو هوش مصنوعی.
روی همهٔ ۶۰ مورد، دستیاران رادیولوژی با یک هوش مصنوعی ۹٫۶ واحد درصد و با دو هوش مصنوعی ۱۶٫۳ و ۱۷٫۵ واحد بهبود یافتند — حدود ۷ واحد بیشتر. زمان خواندن و اطمینان میان گروهها تفاوتی نداشت.
ناهار مجانی در کار نیست
نظر دوم هزینهای دارد. برای دستیاران خارج از رادیولوژی، وقتی GPT-5.4 درست میگفت، افزودن مدل دوم دقت را از ۸۷٫۴٪ به حدود ۷۵٪ پایین آورد: یک هوش مصنوعی مخالف میتوانست آنها را از پاسخی درست منصرف کند. در مجموع، بهبود آنها میان یک و دو هوش مصنوعی تفاوتی نداشت. و وقتی هر دو مدل اشتباه میکردند، یک تحلیل اکتشافی هیچ سود معناداری از مدل دوم نیافت.
نویسندگان نتیجه میگیرند که دو پیشنهاد «ممکن است» نفوذ هوش مصنوعی خطاکار را محدود کند، و سود کلی تنها برای دستیاران رادیولوژی وجود دارد.
محدودیتهایی که باید در نظر داشت
- ۶۰ مورد طوری برگزیده شدند که به هر مدل دقت یکسانی بدهند، پس بازتاب کار روزمره نیستند.
- اثر ممکن است به این بستگی داشته باشد که دو مدل هر چند وقت یک بار با هم اختلاف دارند، که از جفتی به جفت دیگر فرق میکند.
- هیچ محاسبهٔ رسمی حجم نمونه انجام نشد؛ شمار شرکتکنندگان بر اساس امکان جذب تعیین شد.
- خودِ تخصیص تصادفی با درخواست یک فهرست متوازن از یک مدل زبانی دیگر، DeepSeek، تولید شد و بدون تغییر به کار رفت.
به گفتهٔ نویسندگان، گام بعدی پژوهشهایی با بیماران گزینشنشده و ردیابی چشم است، تا ببینند پزشکان در عمل چگونه دو ماشین ناهمنظر را سبکسنگین میکنند.
