پزشکی و سلامتپیش‌چاپآزمایش۳ دقیقه مطالعه

وقتی هوش مصنوعی اشتباه می‌کند، هوش مصنوعی دوم به پزشکان جوان کمک می‌کند

مدل‌های هوش مصنوعی اکنون می‌توانند به یک پرتونگاری و پیشینهٔ بیمار نگاه کنند و تشخیصی همراه با استدلالی نوشته‌شده پیشنهاد دهند. این‌که آیا این کار کمک می‌کند، نه تنها به مدل، بلکه به واکنش پزشکان بستگی دارد — به‌ویژه وقتی پیشنهاد نادرست است. پژوهش‌های پیشینی که مقاله به آن‌ها استناد می‌کند نشان داده‌اند که پزشکان کم‌تجربه‌تر بیشترین سود را از کمک هوش مصنوعی می‌برند، اما همچنین بیشترین احتمال را دارند که با خطاهای آن به بیراهه بروند.

گروهی از دانشگاه نانچانگ و دانشگاه علم و فناوری هنگ‌کنگ ایده‌ای ساده برگرفته از هوش جمعی را آزمود: نشان دادن دو نظر مستقل هوش مصنوعی به جای یکی به پزشکان.

کارآزمایی تصادفی‌شده با سه بازو

لین وو، ژه شو، فوچینگ ژو و همکارانشان این کارآزمایی را میان ژوئیه و سپتامبر ۲۰۲۶ در سه بیمارستان در چین انجام دادند که در سامانهٔ ثبت کارآزمایی‌های بالینی چین (Chinese Clinical Trial Registry) ثبت شده است. آن‌ها ۱۳۲ دستیار با کمتر از سه سال تجربه را، هم در رادیولوژی و هم در تخصص‌های دیگر (پزشکی داخلی، جراحی عمومی، طب اورژانس)، به کار گرفتند و به‌طور تصادفی در سه گروه قرار دادند:

  • گروه A: پیشنهادهای GPT-5.4 به‌تنهایی؛
  • گروه B: GPT-5.4 به‌اضافهٔ Kimi-K2.6؛
  • گروه C: GPT-5.4 به‌اضافهٔ Gemini-3.6 Flash.

شرکت‌کنندگان نمی‌دانستند کدام مدل‌ها را می‌بینند. نُه دستیار به دلیل اختلال شبکه یا ناخوشی کنار رفتند و ۱۲۳ نفر در تحلیل ماندند.

همه همان ۶۰ پرتونگاری قفسهٔ سینه و شکم را خواندند. برای هر کدام، نخست به‌تنهایی تشخیصی دادند و آن را قفل کردند، سپس پیشنهاد یا پیشنهادهای هوش مصنوعی را دیدند و آنگاه پاسخ نهایی دادند. موارد عمداً طوری برگزیده شدند که هر مدل دقیقاً در ۳۹ مورد از ۶۰ (۶۵٪) درست بگوید — و GPT-5.4، مدل مشترک، در ۲۱ مورد اشتباه کرد. برای مقایسه، پنج رادیولوژیست با یک تا پنج سال تجربه بدون هوش مصنوعی ۵۴٫۳٪ امتیاز گرفتند.

یک هوش مصنوعی اشتباه چه می‌کند

در مجموع شرکت‌کنندگان، دقت با کمک هوش مصنوعی از ۴۶٫۳٪ به ۶۱٫۵٪ رسید. بخش جالب، اتفاقی است که روی ۲۱ پرتونگاری‌ای افتاد که GPT-5.4 در آن‌ها اشتباه کرده بود:

  • دستیاران رادیولوژی با یک هوش مصنوعی روی این موارد با دقت ۲۰٫۰٪ به پایان رسیدند. بدون هوش مصنوعی، همین گروه ۳۱٫۴٪ گرفته بود: پیشنهاد نادرست آن‌ها را پایین کشید.
  • با دو هوش مصنوعی، دستیاران رادیولوژی به ۴۰٫۱٪ و ۴۰٫۴٪ رسیدند.
  • دستیاران تخصص‌های دیگر همین الگو را نشان می‌دهند، از ۱۲٫۱٪ با یک هوش مصنوعی به حدود ۳۱٪ با دو هوش مصنوعی.

روی همهٔ ۶۰ مورد، دستیاران رادیولوژی با یک هوش مصنوعی ۹٫۶ واحد درصد و با دو هوش مصنوعی ۱۶٫۳ و ۱۷٫۵ واحد بهبود یافتند — حدود ۷ واحد بیشتر. زمان خواندن و اطمینان میان گروه‌ها تفاوتی نداشت.

ناهار مجانی در کار نیست

نظر دوم هزینه‌ای دارد. برای دستیاران خارج از رادیولوژی، وقتی GPT-5.4 درست می‌گفت، افزودن مدل دوم دقت را از ۸۷٫۴٪ به حدود ۷۵٪ پایین آورد: یک هوش مصنوعی مخالف می‌توانست آن‌ها را از پاسخی درست منصرف کند. در مجموع، بهبود آن‌ها میان یک و دو هوش مصنوعی تفاوتی نداشت. و وقتی هر دو مدل اشتباه می‌کردند، یک تحلیل اکتشافی هیچ سود معناداری از مدل دوم نیافت.

نویسندگان نتیجه می‌گیرند که دو پیشنهاد «ممکن است» نفوذ هوش مصنوعی خطاکار را محدود کند، و سود کلی تنها برای دستیاران رادیولوژی وجود دارد.

محدودیت‌هایی که باید در نظر داشت

  • ۶۰ مورد طوری برگزیده شدند که به هر مدل دقت یکسانی بدهند، پس بازتاب کار روزمره نیستند.
  • اثر ممکن است به این بستگی داشته باشد که دو مدل هر چند وقت یک بار با هم اختلاف دارند، که از جفتی به جفت دیگر فرق می‌کند.
  • هیچ محاسبهٔ رسمی حجم نمونه انجام نشد؛ شمار شرکت‌کنندگان بر اساس امکان جذب تعیین شد.
  • خودِ تخصیص تصادفی با درخواست یک فهرست متوازن از یک مدل زبانی دیگر، DeepSeek، تولید شد و بدون تغییر به کار رفت.

به گفتهٔ نویسندگان، گام بعدی پژوهش‌هایی با بیماران گزینش‌نشده و ردیابی چشم است، تا ببینند پزشکان در عمل چگونه دو ماشین ناهم‌نظر را سبک‌سنگین می‌کنند.

Legal notice