YAPAY ZEKÂ YANILDIĞINDA, İKİNCİ BİR YAPAY ZEKÂ GENÇ HEKİMLERE YARDIM EDİYOR
Yapay zekâ modelleri artık bir radyografiye ve hastanın öyküsüne bakıp yazılı bir gerekçeyle birlikte bir tanı önerebiliyor. Bunun yardımcı olup olmadığı yalnızca modele değil, hekimlerin nasıl tepki verdiğine de bağlı — özellikle öneri yanlış olduğunda. Makalenin alıntıladığı önceki çalışmalar, daha az deneyimli hekimlerin yapay zekâ yardımından en çok yararlananlar olduğunu, ama aynı zamanda onun hataları tarafından yanlış yönlendirilmeye en yatkın olanlar olduğunu bulmuştu.
Nanchang Üniversitesi ve Hong Kong Bilim ve Teknoloji Üniversitesi’nden bir ekip, kolektif zekâdan alınan basit bir fikri sınadı: hekimlere bir yerine iki bağımsız yapay zekâ görüşü göstermek.
Üç kollu randomize bir deneme
Lin Wu, Zhe Xu, Fuqing Zhou ve meslektaşları denemeyi Temmuz–Eylül 2026 arasında Çin’deki üç hastanede yürüttü; deneme Çin Klinik Deney Kayıt Sistemi’ne (Chinese Clinical Trial Registry) kayıtlı. Hem radyolojiden hem de diğer uzmanlık dallarından (iç hastalıkları, genel cerrahi, acil tıp) üç yıldan az deneyimi olan 132 asistan hekim topladılar ve onları rastgele üç gruba ayırdılar:
- A grubu: yalnızca GPT-5.4’ten öneriler;
- B grubu: GPT-5.4 artı Kimi-K2.6;
- C grubu: GPT-5.4 artı Gemini-3.6 Flash.
Katılımcılar hangi modelleri gördüklerini bilmiyordu. Dokuz asistan ağ arızaları ya da rahatsızlık nedeniyle ayrıldı; analizde 123 kişi kaldı.
Hepsi aynı 60 göğüs ve karın radyografisini okudu. Her biri için önce kendi başlarına bir tanı verip kilitlediler, sonra yapay zekâ önerisini ya da önerilerini gördüler, ardından son bir yanıt verdiler. Vakalar kasıtlı olarak her modelin 60 vakadan tam 39’unda (%65) haklı olacağı şekilde seçildi — ortak model olan GPT-5.4 ise 21’inde yanıldı. Karşılaştırma için, bir ila beş yıllık deneyime sahip beş radyolog yapay zekâ olmadan %54,3 puan aldı.
Yanlış bir yapay zekânın yaptığı
Tüm katılımcılarda doğruluk, yapay zekâ yardımıyla %46,3’ten %61,5’e yükseldi. İlginç olan kısım, GPT-5.4’ün yanıldığı 21 radyografide olanlar:
- Tek yapay zekâyla çalışan radyoloji asistanları bu vakalarda %20,0 doğrulukla bitirdi. Yapay zekâ olmadan aynı grup %31,4 almıştı: yanlış öneri onları aşağı çekti.
- İki yapay zekâyla radyoloji asistanları %40,1 ve %40,4’e ulaştı.
- Diğer uzmanlık dallarından asistanlar da aynı örüntüyü gösteriyor: tek yapay zekâyla %12,1’den, ikiyle yaklaşık %31’e.
60 vakanın tamamında radyoloji asistanları tek yapay zekâyla 9,6 yüzde puanı, ikiyle 16,3 ve 17,5 puan iyileşti — yaklaşık 7 puan fazlası. Okuma süresi ve güven, gruplar arasında farklılık göstermedi.
Bedava değil
İkinci görüşün bir bedeli var. Radyoloji dışındaki asistanlar için GPT-5.4 haklıyken ikinci bir model eklemek doğruluğu %87,4’ten yaklaşık %75’e düşürdü: karşı çıkan bir yapay zekâ onları doğru bir yanıttan vazgeçirebiliyordu. Genel olarak onların iyileşmesi tek ve iki yapay zekâ arasında farklılık göstermedi. Ve her iki model de yanıldığında, keşif amaçlı bir analiz ikinci modelden anlamlı bir yarar bulmadı.
Yazarlar, iki önerinin hatalı yapay zekânın etkisini sınırlayabileceği (“may”) sonucuna varıyor; genel bir kazanç ise yalnızca radyoloji asistanları için var.
Akılda tutulması gereken sınırlar
- 60 vaka, her modele aynı doğruluğu verecek şekilde seçildi; bu yüzden günlük pratiği yansıtmıyor.
- Etki, iki modelin ne sıklıkla anlaşmazlığa düştüğüne bağlı olabilir; bu da bir çiftten diğerine değişiyor.
- Resmî bir örneklem büyüklüğü hesabı yapılmadı; katılımcı sayısı yapılabilir işe alıma göre belirlendi.
- Rastgele atamanın kendisi, başka bir dil modelinden, DeepSeek’ten dengeli bir liste istenerek üretildi ve değiştirilmeden kullanıldı.
Yazarlara göre sırada, seçilmemiş hastalarla ve göz izlemeyle yapılacak çalışmalar var; amaç, hekimlerin anlaşamayan iki makineyi gerçekte nasıl tarttığını görmek.
