KHI AI SAI, MỘT AI THỨ HAI GIÚP CÁC BÁC SĨ TRẺ
Các mô hình AI giờ đây có thể xem một phim chụp X-quang và tiền sử bệnh nhân rồi đề xuất chẩn đoán kèm lời giải thích bằng văn bản. Điều đó có giúp ích hay không không chỉ phụ thuộc vào mô hình, mà còn vào cách các bác sĩ phản ứng — đặc biệt khi gợi ý sai. Các nghiên cứu trước đây mà bài báo trích dẫn cho thấy bác sĩ ít kinh nghiệm hưởng lợi nhiều nhất từ sự trợ giúp của AI nhưng cũng dễ bị các lỗi của nó dẫn sai đường nhất.
Một nhóm từ Đại học Nam Xương và Đại học Khoa học và Công nghệ Hồng Kông đã thử một ý tưởng đơn giản rút ra từ trí tuệ tập thể: cho bác sĩ xem hai ý kiến AI độc lập thay vì một.
Một thử nghiệm ngẫu nhiên ba nhánh
Lin Wu, Zhe Xu, Fuqing Zhou và các đồng nghiệp tiến hành thử nghiệm tại ba bệnh viện ở Trung Quốc từ tháng 7 đến tháng 9 năm 2026, có đăng ký với Cơ quan Đăng ký Thử nghiệm Lâm sàng Trung Quốc. Họ tuyển 132 bác sĩ nội trú có dưới ba năm kinh nghiệm, cả ở chuyên ngành chẩn đoán hình ảnh lẫn các chuyên khoa khác (nội khoa, ngoại tổng quát, cấp cứu), và phân ngẫu nhiên họ vào ba nhóm:
- Nhóm A: gợi ý chỉ từ GPT-5.4;
- Nhóm B: GPT-5.4 cộng Kimi-K2.6;
- Nhóm C: GPT-5.4 cộng Gemini-3.6 Flash.
Người tham gia không biết mình đang xem các mô hình nào. Chín bác sĩ nội trú bỏ cuộc vì sự cố mạng hoặc cảm thấy không khỏe, còn lại 123 người trong phân tích.
Tất cả đọc cùng 60 phim X-quang ngực và bụng. Với mỗi phim, trước tiên họ tự đưa ra chẩn đoán và khóa lại, sau đó xem gợi ý của AI, rồi đưa ra câu trả lời cuối cùng. Các ca được cố ý chọn sao cho mỗi mô hình đúng chính xác 39 trên 60 ca (65%) — và GPT-5.4, mô hình chung, sai ở 21 ca. Để so sánh, năm bác sĩ chẩn đoán hình ảnh có một đến năm năm kinh nghiệm đạt 54,3% khi không có AI.
Một AI sai gây ra điều gì
Tính trên tất cả mọi người, độ chính xác tăng từ 46,3% lên 61,5% nhờ AI. Điều thú vị là những gì xảy ra với 21 phim mà GPT-5.4 sai:
- Bác sĩ nội trú chẩn đoán hình ảnh có một AI kết thúc ở mức chính xác 20,0% trên những ca đó. Không có AI, chính nhóm này từng đạt 31,4%: gợi ý sai đã kéo họ xuống.
- Với hai AI, bác sĩ nội trú chẩn đoán hình ảnh đạt 40,1% và 40,4%.
- Bác sĩ nội trú các chuyên khoa khác cũng cho thấy cùng kiểu mẫu, từ 12,1% với một AI lên khoảng 31% với hai AI.
Trên toàn bộ 60 ca, bác sĩ nội trú chẩn đoán hình ảnh cải thiện 9,6 điểm phần trăm với một AI, và 16,3 cùng 17,5 điểm với hai AI — nhiều hơn khoảng 7 điểm. Thời gian đọc phim và mức độ tự tin không khác nhau giữa các nhóm.
Không có bữa trưa miễn phí
Ý kiến thứ hai có cái giá của nó. Với bác sĩ nội trú ngoài chuyên ngành chẩn đoán hình ảnh, khi GPT-5.4 đúng, việc thêm một mô hình thứ hai đã làm giảm độ chính xác từ 87,4% xuống khoảng 75%: một AI bất đồng có thể thuyết phục họ từ bỏ một câu trả lời đúng. Tính chung, mức cải thiện của họ không khác nhau giữa một và hai AI. Và khi cả hai mô hình đều sai, một phân tích thăm dò không thấy lợi ích đáng kể nào từ mô hình thứ hai.
Các tác giả kết luận rằng hai gợi ý “có thể” hạn chế ảnh hưởng của AI sai, với lợi ích tổng thể chỉ dành cho bác sĩ nội trú chẩn đoán hình ảnh.
Những giới hạn cần ghi nhớ
- 60 ca được chọn để mọi mô hình có cùng độ chính xác, nên chúng không phản ánh thực hành hằng ngày.
- Hiệu ứng có thể phụ thuộc vào mức độ thường xuyên mà hai mô hình bất đồng, vốn thay đổi từ cặp này sang cặp khác.
- Không có phép tính cỡ mẫu chính thức nào; số người tham gia dựa trên khả năng tuyển chọn thực tế.
- Bản thân việc phân bổ ngẫu nhiên được tạo ra bằng cách yêu cầu một mô hình ngôn ngữ khác, DeepSeek, lập một danh sách cân bằng, và danh sách này được dùng mà không hề sửa đổi.
Theo các tác giả, bước tiếp theo là những nghiên cứu với bệnh nhân không qua chọn lọc và có theo dõi chuyển động mắt, để xem các bác sĩ thực sự cân nhắc hai cỗ máy bất đồng ra sao.
