SAAT AI KELIRU, AI KEDUA MEMBANTU DOKTER MUDA
Model AI kini dapat melihat foto rontgen dan riwayat pasien lalu mengusulkan diagnosis disertai alasan tertulis. Apakah itu membantu tidak hanya bergantung pada modelnya, tetapi juga pada bagaimana dokter bereaksi — terutama ketika sarannya keliru. Studi-studi sebelumnya, yang dikutip makalah ini, menemukan bahwa dokter yang kurang berpengalaman paling diuntungkan oleh bantuan AI, tetapi juga paling mudah tersesat oleh kesalahannya.
Sebuah tim dari Universitas Nanchang dan Universitas Sains dan Teknologi Hong Kong menguji gagasan sederhana yang diambil dari kecerdasan kolektif: menunjukkan kepada dokter dua opini AI yang independen, bukan satu.
Uji acak dengan tiga kelompok
Lin Wu, Zhe Xu, Fuqing Zhou, dan rekan-rekan menjalankan uji ini di tiga rumah sakit di Tiongkok antara Juli dan September 2026, yang terdaftar di Registri Uji Klinis Tiongkok. Mereka merekrut 132 residen dengan pengalaman kurang dari tiga tahun, baik di radiologi maupun di spesialisasi lain (penyakit dalam, bedah umum, kedokteran gawat darurat), dan secara acak membaginya ke dalam tiga kelompok:
- Kelompok A: saran dari GPT-5.4 saja;
- Kelompok B: GPT-5.4 ditambah Kimi-K2.6;
- Kelompok C: GPT-5.4 ditambah Gemini-3.6 Flash.
Para peserta tidak tahu model mana yang mereka lihat. Sembilan residen mengundurkan diri karena gangguan jaringan atau merasa tidak enak badan, sehingga tersisa 123 dalam analisis.
Semuanya membaca 60 foto rontgen dada dan perut yang sama. Untuk setiap foto, mereka lebih dulu memberikan diagnosis sendiri dan menguncinya, lalu melihat saran atau saran-saran AI, kemudian memberikan jawaban akhir. Kasus-kasusnya sengaja dipilih agar setiap model benar tepat pada 39 dari 60 (65%) — dan GPT-5.4, model yang dipakai bersama, keliru pada 21. Sebagai perbandingan, lima ahli radiologi dengan pengalaman satu hingga lima tahun mencetak 54,3% tanpa AI.
Apa yang dilakukan AI yang keliru
Untuk semua peserta, akurasi naik dari 46,3% menjadi 61,5% dengan bantuan AI. Bagian yang menarik adalah apa yang terjadi pada 21 foto rontgen tempat GPT-5.4 keliru:
- Residen radiologi dengan satu AI berakhir dengan akurasi 20,0% pada kasus-kasus itu. Tanpa AI, kelompok yang sama mencetak 31,4%: saran yang keliru menyeret mereka turun.
- Dengan dua AI, residen radiologi mencapai 40,1% dan 40,4%.
- Residen dari spesialisasi lain menunjukkan pola yang sama, dari 12,1% dengan satu AI menjadi sekitar 31% dengan dua.
Atas seluruh 60 kasus, residen radiologi membaik 9,6 poin persentase dengan satu AI, dan 16,3 serta 17,5 poin dengan dua — sekitar 7 poin lebih banyak. Waktu membaca dan tingkat keyakinan tidak berbeda antarkelompok.
Tidak ada makan siang gratis
Opini kedua ada harganya. Bagi residen di luar radiologi, ketika GPT-5.4 benar, penambahan model kedua justru menurunkan akurasi dari 87,4% menjadi sekitar 75%: AI yang berbeda pendapat bisa membujuk mereka meninggalkan jawaban yang benar. Secara keseluruhan, peningkatan mereka tidak berbeda antara satu dan dua AI. Dan ketika kedua model keliru, sebuah analisis eksploratif tidak menemukan manfaat yang signifikan dari model kedua.
Para penulis menyimpulkan bahwa dua saran “mungkin” membatasi pengaruh AI yang keliru, dengan keuntungan secara keseluruhan hanya bagi residen radiologi.
Keterbatasan yang perlu diingat
- Ke-60 kasus dipilih agar semua model memiliki akurasi yang sama, sehingga tidak mencerminkan praktik sehari-hari.
- Efeknya mungkin bergantung pada seberapa sering kedua model berbeda pendapat, yang bervariasi dari satu pasangan ke pasangan lain.
- Tidak ada perhitungan besar sampel secara formal; jumlah peserta didasarkan pada perekrutan yang memungkinkan.
- Alokasi acak itu sendiri dihasilkan dengan meminta model bahasa lain, DeepSeek, membuat daftar yang seimbang, yang dipakai tanpa diubah.
Selanjutnya, menurut para penulis, akan ada studi dengan pasien yang tidak diseleksi dan pelacakan gerak mata, untuk melihat bagaimana dokter sebenarnya menimbang dua mesin yang berbeda pendapat.
