Kedokteran & kesehatanPracetakAnalisis data3 menit baca

SKOR DEPRESSI DARI AI BERGANTUNG PADA AI-NYA

Depresi tidak punya tes darah untuk diagnosis. Model bahasa besar menjanjikan penilaian yang tak kenal lelah, murah, dan dapat diulang dari percakapan klinis, dan evaluasi awalnya cukup menggembirakan. Psikiatri pernah menghadapi pertanyaan serupa: pada 1971, sebuah studi menemukan bahwa psikiater Amerika dan Inggris berbeda pendapat setelah menonton rekaman video wawancara yang sama, dan bidang ini menjawabnya dengan kriteria eksplisit dan wawancara terstruktur.

Namun sebuah model bahasa baru menjadi “penilai” melalui serangkaian pilihan. Seseorang memilih modelnya, merumuskan permintaannya — sebagai kuesioner, dengan suara seorang psikiater, atau sebagai pasien yang menjawab tentang dirinya sendiri — memilih angka atau huruf untuk jawaban, memutuskan apakah model hanya membaca ucapan pasien atau seluruh percakapan, lalu mengubah keluarannya menjadi skor. Evaluasi jarang memperlihatkan alternatif-alternatif ini.

880 cara membangun satu penilai

Baihan Lin, dari Icahn School of Medicine at Mount Sinai di New York, menyilangkan 11 model terbuka (dari 1 hingga 21 miliar parameter) dengan lima rumusan, dua cara pandang terhadap percakapan, dua cara membaca jawaban, dan empat cara menyusun skor. Hasilnya 880 penilai, masing-masing diterapkan pada 189 wawancara rekaman yang sama, yang dipandu oleh pewawancara virtual beranimasi. Sebelum setiap wawancara, peserta telah mengisi PHQ-8, kuesioner depresi berisi delapan butir dengan skor 0 sampai 24; skor 10 atau lebih adalah ambang penapisan yang lazim. Sekitar 30% peserta melewatinya.

Studi ini dipraregistrasi: kode analisisnya dibekukan sebelum dibandingkan dengan kuesioner. Prosedur yang telah dikunci itu kemudian dijalankan sekali pada 86 wawancara baru yang dipandu pewawancara virtual yang sepenuhnya otonom, dengan transkrip otomatis. Semua pemrosesan dilakukan di sebuah workstation lokal.

Penilai lebih berpengaruh daripada pasien

  • Satu wawancara, putusan yang bertolak belakang. Seorang peserta dengan gejala ringan (PHQ-8 bernilai 5, di bawah ambang) ditandai positif dalam penapisan oleh separuh dari 880 penilai. Tidak ada peserta yang mendapat putusan bulat.
  • Penilai yang akurat pun berbeda pendapat. Di antara 540 penilai dengan daya pembeda yang baik (AUC 0,70 atau lebih), dua penilai yang dipilih acak berbeda pendapat tentang keputusan penapisan untuk 40% peserta.
  • Model lebih penting daripada orangnya. Pilihan model menjelaskan 30,0% variasi skor; perbedaan yang stabil antarpeserta menjelaskan 10,5% — 2,8 kali lebih kecil.

Timbangan dengan titik nol yang meleset

Akurasi, sebagaimana biasa diukur, menunjukkan seberapa baik seorang penilai mengurutkan orang. Akurasi tidak mengatakan berapa banyak orang yang ditandai. Para penilai menandai mulai dari 0% hingga 100% peserta, padahal kenyataannya 30%. Yang menentukan proporsi itu adalah kecenderungan rata-rata tiap penilai untuk memberi nilai terlalu tinggi atau terlalu rendah (R² = 0,91). Penulis membandingkannya dengan timbangan badan yang titik nolnya meleset: timbangan itu mungkin mengurutkan orang dengan baik, tetapi pergeserannya yang menentukan siapa yang melewati garis. Dua model dengan akurasi hampir sama, Qwen2.5 7B dan Mistral 7B, masing-masing akan menandai 24 dan 80 orang dari 100.

Detail teknis kecil menggeser garis itu. Membalik huruf jawaban — sehingga “A” berarti “hampir setiap hari”, bukan “tidak sama sekali”, perubahan yang tidak bermakna secara klinis — menggeser proporsi yang ditandai dengan median 21 poin, dan hingga 85. Menjalankan model yang sama sebagai berkas terkompresi di perangkat lunak yang berbeda mengubah median 21% keputusan.

Skor itu juga menangkap hal lain selain depresi. Skor mengikuti gejala stres pascatrauma sedekat mengikuti depresi, peserta yang banyak bicara lebih sering ditandai, dan 16% penilai membalik arah perbedaan kecil antara perempuan dan laki-laki yang tercatat dalam kuesioner.

Kalibrasi membantu, sampai batas tertentu

Karena pergeseran itu sangat menentukan, penulis mencoba sebuah perbaikan: menyetel ulang ambang setiap penilai dengan 40 peserta yang dilabeli secara lokal. Akurasi naik dari sekitar 60% menjadi 75%, dan ketidaksepakatan berkurang separuh, dari 40% menjadi 20%. Namun, bahkan ketika setiap penilai dipaksa memilih jumlah orang yang sama, mereka tetap memilih orang yang berbeda sekitar satu dari lima kali.

Pada 86 wawancara baru, lima dari enam prediksi praregistrasi yang dapat diuji terbukti. Penulis mencantumkan batasan yang jelas: hanya model terbuka hingga 21 miliar parameter, karena data tidak boleh keluar dari workstation; kuesioner yang diisi sendiri sebagai kriteria, bukan diagnosis; tidak ada klinisi yang menilai transkrip yang sama; dan wawancara berbahasa Inggris dari satu laboratorium saja.

Lima pemeriksaan sebelum memercayai skor

Makalah ini ditutup dengan saran praktis: laporkan rentang keputusan di berbagai konfigurasi yang masuk akal, bukan satu angka; tetapkan konfigurasi netral sejak awal; lakukan kalibrasi lokal dan ukur ketidaksepakatan yang tersisa; uji apa lagi yang ditangkap oleh penilai; dan perlakukan setiap perubahan model, perangkat lunak, transkripsi, atau rumusan sebagai instrumen baru. Seperti kata penulis, ketika mengubah cara kita bertanya mengubah siapa yang kita identifikasi, instrumen itu menjadi bagian dari penjelasan.

Legal notice