Tıp ve sağlıkÖn baskıVeri analizi3 dk okuma

YAPAY ZEKÂNIN DEPRESYON PUANLARI YAPAY ZEKÂYA BAĞLI

Depresyonun tanı koyduran bir kan testi yok. Büyük dil modelleri, klinik konuşmalardan elde edilen yorulmak bilmeyen, ucuz ve tekrarlanabilir değerlendirmeler vaat ediyor ve ilk değerlendirmeler cesaret verici oldu. Psikiyatri benzer bir soruyla daha önce de karşılaştı: 1971’de bir çalışma, Amerikalı ve İngiliz psikiyatristlerin aynı video kaydı görüşmeleri izledikten sonra farklı sonuçlara vardığını ortaya koydu; alan da buna açık ölçütler ve yapılandırılmış görüşmelerle yanıt verdi.

Ama bir dil modeli ancak bir dizi seçim sonucunda “değerlendirici” hâline gelir. Biri modeli seçer, isteği ifade eder — bir anket olarak, bir psikiyatristin ağzından ya da hastanın kendisi hakkında yanıt vermesi şeklinde —, yanıtlar için rakam ya da harf seçer, modelin yalnızca hastanın sözlerini mi yoksa tüm konuşmayı mı okuyacağına karar verir ve çıktıyı bir puana dönüştürür. Değerlendirmeler bu alternatifleri nadiren gösterir.

Tek bir değerlendirici kurmanın 880 yolu

New York’taki Mount Sinai Icahn Tıp Fakültesi’nden Baihan Lin, 11 açık modeli (1 ila 21 milyar parametre arası) beş ifade biçimi, konuşmanın iki görünümü, yanıtı okumanın iki yolu ve puanı oluşturmanın dört yoluyla çaprazladı. Bu da her biri, animasyonlu bir sanal görüşmeci tarafından yürütülen aynı 189 kayıtlı görüşmeye uygulanan 880 değerlendirici ediyor. Her görüşmeden önce katılımcılar, 0’dan 24’e kadar puanlanan sekiz maddelik bir depresyon anketi olan PHQ-8’i doldurmuştu; 10 ve üzeri puan olağan tarama eşiğidir. Katılımcıların yaklaşık %30’u bu eşiği aştı.

Çalışma önceden kayıt altına alındı (pre-registered): analiz kodu, anketle herhangi bir karşılaştırma yapılmadan önce donduruldu. Kilitlenen prosedür daha sonra tamamen otonom bir sanal görüşmecinin yürüttüğü, otomatik transkriptli 86 yeni görüşme üzerinde bir kez çalıştırıldı. Tüm işlemler yerel bir iş istasyonunda kaldı.

Değerlendirici hastadan ağır basıyor

  • Bir görüşme, zıt kararlar. Hafif belirtileri olan bir katılımcı (PHQ-8 puanı 5, eşiğin altında), 880 değerlendiricinin yarısı tarafından tarama pozitif olarak işaretlendi. Hiçbir katılımcı oybirliğiyle bir karar almadı.
  • İsabetli değerlendiriciler bile anlaşamıyor. İyi ayırt etme gücüne sahip (AUC 0,70 ve üzeri) 540 değerlendirici arasından rastgele seçilen ikisi, katılımcıların %40’ı için tarama kararında anlaşamadı.
  • Model, kişiden daha önemli. Model seçimi puanlardaki değişkenliğin %30,0’ını açıkladı; katılımcılar arasındaki kalıcı farklar ise %10,5’ini — 2,8 kat daha az.

Sıfırı kaymış bir tartı

Genellikle ölçüldüğü şekliyle isabet, bir değerlendiricinin insanları ne kadar iyi sıraladığını söyler. Kaç kişiyi işaretlediğini söylemez. Değerlendiriciler, gerçekte %30 iken, katılımcıların %0’ı ile %100’ü arasında herhangi bir oranı işaretledi. Bu oranı belirleyen, her değerlendiricinin ortalamada fazla ya da eksik puanlama eğilimiydi (R² = 0,91). Yazar bunu sıfırı kaymış bir banyo tartısına benzetiyor: insanları iyi sıralayabilir, ama çizgiyi kimin aşacağına kayması karar verir. Neredeyse aynı isabete sahip iki model, Qwen2.5 7B ve Mistral 7B, 100 kişiden sırasıyla 24 ve 80 kişiyi işaretlerdi.

Küçük teknik ayrıntılar bu çizgiyi oynattı. Cevap harflerini ters çevirmek — “A”nın “hiç” yerine “neredeyse her gün” anlamına gelmesi, klinik açıdan anlamsız bir değişiklik — işaretlenenlerin oranını medyan 21 puan, en fazla 85 puan kaydırdı. Aynı modeli sıkıştırılmış bir dosya olarak farklı yazılımlarda çalıştırmak, kararların medyan %21’ini değiştirdi.

Puanlar depresyondan fazlasını da yakaladı. Travma sonrası stres belirtilerini depresyon kadar yakından izlediler, konuşkan katılımcılar daha sık işaretlendi ve değerlendiricilerin %16’sı, anketin bildirdiği kadınlar ile erkekler arasındaki küçük farkın yönünü tersine çevirdi.

Kalibrasyon bir noktaya kadar işe yarıyor

Kayma bu kadar belirleyici olduğu için yazar bir onarım denedi: her değerlendiricinin eşiğini yerel olarak etiketlenmiş 40 katılımcıyla yeniden ayarlamak. İsabet yaklaşık %60’tan %75’e yükseldi ve anlaşmazlık yarıya, %40’tan %20’ye indi. Ama her değerlendirici aynı sayıda kişi seçmeye zorlandığında bile, yaklaşık beş seferden birinde yine farklı kişileri seçtiler.

86 yeni görüşmede, test edilebilen önceden kayıtlı altı öngörüden beşi doğrulandı. Yazar açık sınırlamaları sıralıyor: veriler iş istasyonundan çıkamadığı için yalnızca 21 milyar parametreye kadar açık modeller; ölçüt olarak bir tanı değil, öz bildirime dayalı bir anket; aynı transkriptleri değerlendiren klinisyen yok; ve tek bir laboratuvardan İngilizce görüşmeler.

Bir puana güvenmeden önce beş kontrol

Makale pratik önerilerle sona eriyor: tek bir sayı yerine makul yapılandırmalar arasındaki karar aralığını raporlayın; önceden tarafsız bir yapılandırma belirleyin; yerel olarak kalibre edin ve kalan anlaşmazlığı ölçün; değerlendiricinin başka neleri yakaladığını test edin; ve model, yazılım, transkripsiyon ya da ifadedeki her değişikliği yeni bir araç olarak ele alın. Yazarın deyişiyle, nasıl sorduğumuzu değiştirmek kimi tespit ettiğimizi değiştiriyorsa, araç açıklamanın bir parçası hâline gelir.

Legal notice