Bài báo khoa học T67 Số CDD10 - HN Bệnh viện Nhi Đồng 2 - HN Trường Đại học Nguyễn Tất Thành

ĐÁNH GIÁ CHẤT LƯỢNG CÂU TRẢ LỜI CỦA CÁC NỀN TẢNG TRÍ TUỆ NHÂN TẠO ĐỐI VỚI CÂU HỎI CỦA PHỤ HUYNH TRẺ MẮC BỆNH TIM BẨM SINH

Trịnh Hữu Tùng1,2,3,4, Trương Việt Dũng5,6, Nguyễn Thị Ngọc Phượng1,3, Phan Thành Thọ1,3, Trần Văn Hưng1,3, Trần Tuấn Kiệt1,3
1 Children's Hospital 2
2 Nguyen Tat Thanh University
3 Bệnh viện Nhi Đồng 2
4 Trường Đại Học Nguyễn Tất Thành
5 Tam Anh University
6 Đại học Tâm Anh
DOI: 10.52163/yhc.v67icd10.5869
0 Lượt xem
0 Lượt tải xuống
Tóm tắt

Đặt vấn đề: Các nền tảng trí tuệ nhân tạo (AI) dạng chatbot như ChatGPT, Microsoft Copilot và Gemini ngày càng được người dân sử dụng để tìm kiếm thông tin y tế. Tuy nhiên, độ chính xác và độ an toàn của các câu trả lời y khoa do AI cung cấp, đặc biệt trong lĩnh vực tim bẩm sinh ở trẻ em, vẫn chưa được đánh giá đầy đủ.

Mục tiêu: So sánh chất lượng câu trả lời của ba nền tảng AI (ChatGPT Go, Gemini Pro và Microsoft Copilot free) đối với các câu hỏi thường gặp của phụ huynh trẻ mắc bệnh tim bẩm sinh.

Phương pháp nghiên cứu: Nghiên cứu mô tả so sánh cắt ngang. Bộ câu hỏi gồm 86 câu hỏi thực tế của phụ huynh trẻ mắc bệnh tim bẩm sinh được đưa vào ba nền tảng AI. Hai bác sĩ chuyên khoa tim mạch nhi đánh giá độc lập các câu trả lời bằng thang Likert 1–5 dựa trên năm tiêu chí: tính đúng, tính đầy đủ, tính rõ ràng, tính phù hợp y khoa và khuyến cáo an toàn. Phân tích thống kê sử dụng trung bình, độ lệch chuẩn và kiểm định McNemar.

Kết quả: Tổng cộng 258 câu trả lời được đánh giá. Điểm trung bình của các chatbot dao động từ 4,38 đến 4,76 điểm, trung vị đều đạt 5 điểm. Khi sử dụng điểm cắt ≥3 điểm, tất cả câu trả lời của ba chatbot đều đạt yêu cầu (100%). Khi áp dụng tiêu chuẩn cao hơn (≥4 điểm), tỷ lệ đạt từ 91,9% đến 100%. Sự khác biệt giữa ba nền tảng AI không có ý nghĩa thống kê (p > 0,05). Mức độ phù hợp giữa hai bác sỹ đánh giá ở mức chấp nhận (Kappa >=0,7)

Kết luận: Các chatbot AI có khả năng cung cấp thông tin tư vấn cơ bản về bệnh tim bẩm sinh cho người bệnh với mức độ tin cậy, đầy đủ và an toàn tương đối cao. Chưa thấy sự khác nhau có ý nghĩa giữa các câu trả lời của 3 chatbot AI trên cùng câu hỏi.

Tài liệu tham khảo
[1]
Topol EJ (2019). High-performance medicine: the convergence of human and artificial intelligence. Nat Med.;25:44–56. Google Scholar
[2]
Rajkomar A, Dean J, Kohane I (2019). Machine learning in medicine. N Engl J Med.;380:1347–58. Google Scholar
[3]
Kung TH, et al (2023). Performance of ChatGPT on USMLE. PLOS Digit Health.;2:e0000198. Google Scholar
[4]
Nadarzynski T, et al (2019). Acceptability of AI-led chatbots in healthcare. Digit Health.;5:1–12. Google Scholar
[5]
Ayers JW, et al (2023). Comparing physician and AI chatbot responses to patient questions. JAMA Intern Med. 2023;183:589–96. Google Scholar
[6]
Hallucinations in neural machine translation. ACL. 2018. Google Scholar
[7]
Shaw J, et al (2020). Risks of AI in pediatric healthcare. Pediatrics.;145:e20194000. Google Scholar
[8]
McCoy LG, et al (2023). Chatbots and health misinformation. NPJ Digit Med.;6:1–9. Google Scholar
[9]
Singhal K, et al (2023). Large language models encode clinical knowledge. Nature.;620:172–80. Google Scholar
[10]
Gilson A, et al (2023). How does ChatGPT perform on medical questions? Med Educ.;57:565–73. Google Scholar
[11]
Hirosawa T, et al (2023). Evaluation of ChatGPT in clinical decision support. JMIR Med Educ;9:e48023. Google Scholar
[12]
Koo TK, Li MY (2016). A guideline of selecting and reporting ICC. J Chiropr Med.;15:155–63 Google Scholar