ĐIỂM TRẦM CẢM DO AI CHẤM TÙY VÀO CHÍNH AI
Trầm cảm không có xét nghiệm máu để chẩn đoán. Các mô hình ngôn ngữ lớn hứa hẹn những đánh giá không biết mệt, rẻ và lặp lại được, rút ra từ các cuộc trò chuyện lâm sàng, và những đánh giá ban đầu khá đáng khích lệ. Ngành tâm thần học từng đối mặt với một câu hỏi tương tự: năm 1971, một nghiên cứu phát hiện các bác sĩ tâm thần Mỹ và Anh bất đồng sau khi xem cùng những đoạn băng phỏng vấn, và ngành này đã đáp lại bằng các tiêu chí rõ ràng và phỏng vấn có cấu trúc.
Nhưng một mô hình ngôn ngữ chỉ trở thành “người chấm” qua một loạt lựa chọn. Có người chọn mô hình, soạn lời yêu cầu — dưới dạng bảng hỏi, bằng giọng một bác sĩ tâm thần, hay như thể bệnh nhân tự trả lời về mình — chọn số hay chữ cái cho các câu trả lời, quyết định mô hình chỉ đọc lời của bệnh nhân hay cả cuộc trò chuyện, rồi chuyển kết quả đầu ra thành điểm số. Các đánh giá hiếm khi cho thấy những phương án thay thế này.
880 cách để tạo ra một người chấm
Baihan Lin, thuộc Trường Y Icahn tại Mount Sinai ở New York, đã kết hợp 11 mô hình mở (từ 1 đến 21 tỉ tham số) với năm cách diễn đạt, hai cách nhìn cuộc trò chuyện, hai cách đọc câu trả lời và bốn cách tính điểm. Như vậy có 880 người chấm, mỗi người được áp dụng cho cùng 189 buổi phỏng vấn được ghi lại, do một người phỏng vấn ảo dạng hoạt hình thực hiện. Trước mỗi buổi phỏng vấn, người tham gia đã điền PHQ-8, một bảng hỏi trầm cảm gồm tám mục, chấm điểm từ 0 đến 24; điểm từ 10 trở lên là ngưỡng sàng lọc thông thường. Khoảng 30% người tham gia vượt ngưỡng này.
Nghiên cứu được đăng ký trước: mã phân tích đã được cố định trước khi có bất kỳ so sánh nào với bảng hỏi. Quy trình đã khóa này sau đó được chạy một lần trên 86 buổi phỏng vấn mới do một người phỏng vấn ảo hoàn toàn tự động thực hiện, với bản ghi lời tự động. Toàn bộ quá trình xử lý đều diễn ra trên một máy trạm tại chỗ.
Người chấm lấn át bệnh nhân
- Một buổi phỏng vấn, hai phán quyết trái ngược. Một người tham gia có triệu chứng nhẹ (PHQ-8 bằng 5, dưới ngưỡng) bị một nửa trong 880 người chấm xếp vào nhóm sàng lọc dương tính. Không người tham gia nào nhận được phán quyết nhất trí.
- Người chấm chính xác vẫn bất đồng. Trong số 540 người chấm có khả năng phân biệt tốt (AUC từ 0,70 trở lên), hai người chọn ngẫu nhiên bất đồng về quyết định sàng lọc với 40% người tham gia.
- Mô hình quan trọng hơn con người. Việc chọn mô hình giải thích 30,0% độ biến thiên của điểm số; những khác biệt ổn định giữa người tham gia giải thích 10,5% — ít hơn 2,8 lần.
Chiếc cân lệch số không
Độ chính xác, theo cách đo thông thường, cho biết một người chấm xếp hạng mọi người tốt đến đâu. Nó không cho biết người chấm gắn cờ bao nhiêu người. Các người chấm gắn cờ từ 0% đến 100% số người tham gia, trong khi thực tế là 30%. Điều quyết định tỉ lệ đó là xu hướng trung bình của mỗi người chấm chấm cao hoặc chấm thấp (R² = 0,91). Tác giả so sánh nó với một chiếc cân sức khỏe lệch số không: nó có thể xếp hạng mọi người tốt, nhưng độ lệch của nó quyết định ai vượt qua vạch. Hai mô hình có độ chính xác gần như y hệt nhau, Qwen2.5 7B và Mistral 7B, sẽ gắn cờ lần lượt 24 và 80 trên 100 người.
Những chi tiết kỹ thuật nhỏ cũng làm xê dịch vạch đó. Đảo ngược các chữ cái trả lời — để “A” nghĩa là “gần như mỗi ngày” thay vì “hoàn toàn không”, một thay đổi vô nghĩa về mặt lâm sàng — làm tỉ lệ bị gắn cờ thay đổi trung vị 21 điểm, và tới 85 điểm. Chạy cùng một mô hình dưới dạng tệp nén trên các phần mềm khác nhau làm thay đổi trung vị 21% số quyết định.
Các đánh giá cũng bắt được nhiều thứ hơn là trầm cảm. Chúng bám theo các triệu chứng căng thẳng sau sang chấn sát như bám theo trầm cảm, những người tham gia nói nhiều bị gắn cờ thường xuyên hơn, và 16% người chấm đảo ngược chiều của khác biệt nhỏ giữa phụ nữ và nam giới mà bảng hỏi ghi nhận.
Hiệu chỉnh giúp ích, nhưng có giới hạn
Vì độ lệch chi phối nhiều đến vậy, tác giả thử một cách sửa: đặt lại ngưỡng của từng người chấm bằng 40 người tham gia được gắn nhãn tại chỗ. Độ chính xác tăng từ khoảng 60% lên 75%, và mức bất đồng giảm một nửa, từ 40% xuống 20%. Nhưng ngay cả khi buộc mọi người chấm phải chọn cùng một số lượng người, họ vẫn chọn những người khác nhau khoảng một lần trong năm.
Trong 86 buổi phỏng vấn mới, năm trong sáu dự đoán đã đăng ký trước có thể kiểm tra được đều đứng vững. Tác giả nêu rõ các giới hạn: chỉ dùng mô hình mở đến 21 tỉ tham số, vì dữ liệu không được rời khỏi máy trạm; tiêu chí là một bảng hỏi tự khai, không phải chẩn đoán; không có bác sĩ lâm sàng chấm cùng các bản ghi lời; và các buổi phỏng vấn bằng tiếng Anh từ một phòng thí nghiệm duy nhất.
Năm điều cần kiểm tra trước khi tin một điểm số
Bài báo kết thúc bằng lời khuyên thực tế: báo cáo khoảng dao động của các quyết định qua những cấu hình hợp lý thay vì một con số duy nhất; cố định trước một cấu hình trung lập; hiệu chỉnh tại chỗ và đo mức bất đồng còn lại; kiểm tra xem người chấm còn bắt được những gì khác; và coi mọi thay đổi về mô hình, phần mềm, bản ghi lời hay cách diễn đạt là một công cụ đo mới. Như tác giả viết, khi thay đổi cách ta hỏi làm thay đổi người mà ta nhận diện, thì công cụ đo trở thành một phần của lời giải thích.
