Học cách ngành y thử nghiệm thuốc để kiểm soát "hộp đen" AI trong bệnh viện
Các nhà nghiên cứu tại Đại học Bristol đề xuất bộ khung đánh giá AI y tế dựa trên quy trình cấp phép dược phẩm, giúp phát hiện sớm các lỗi sai nguy hiểm trước khi đưa vào lâm sàng.

Đề xuất kiểm định AI y tế theo chuẩn dược phẩm
Nhiều mô hình trí tuệ nhân tạo (AI) trong y tế đạt kết quả xuất sắc trong phòng thí nghiệm nhưng lại nhanh chóng bộc lộ điểm yếu khi triển khai thực tế tại bệnh viện. Để giải quyết bài toán này, các nhà nghiên cứu tại Đại học Bristol (Anh) vừa đề xuất một khung kiểm tra độ tin cậy mang tên "Learning Ensemble", áp dụng chính quy trình mà ngành y tế đã dùng nhiều thập kỷ qua để quản lý các loại thuốc tân dược.
Về bản chất, nhiều loại dược phẩm được sử dụng rộng rãi dù giới y khoa chưa hiểu tường tận 100% cơ chế tác động chính xác của chúng trong cơ thể — tương tự như bản chất "hộp đen" của mạng nơ-ron sâu. Dẫu vậy, ngành y vẫn biến các hợp chất hóa học này thành liệu pháp điều trị an toàn nhờ hệ thống tài liệu hướng dẫn nghiêm ngặt: chỉ rõ liều dùng, thời điểm dùng, chống chỉ định và nhóm bệnh nhân phù hợp. Nhóm nghiên cứu cho rằng các hệ thống AI phục vụ chẩn đoán và điều trị cũng cần được đóng gói trong một quy chuẩn kiểm định tương tự.
Ba trụ cột của bộ khung "Learning Ensemble"
Bộ khung do hai nhà nghiên cứu Ratti và Zuchowski đề xuất yêu cầu các kỹ sư và đơn vị phát triển phải kiểm tra, lập hồ sơ minh bạch ở ba khía cạnh then chốt trước khi áp dụng AI trên cơ thể người bệnh:
- Giới hạn vận hành và dữ liệu đào tạo: Xác định rõ AI được thiết kế cho đối tượng bác sĩ nào, triển khai trên phần cứng gì và được huấn luyện từ tệp dữ liệu nào. Tầm quan trọng của yếu tố này từng được chứng minh qua một nghiên cứu năm 2021 của DeGrave và các cộng sự: một mô hình AI nhận diện COVID-19 qua ảnh chụp X-quang thực chất không học tổn thương ở phổi, mà lại dựa vào các chi tiết ngẫu nhiên mang tính kỹ thuật của máy chụp tại bệnh viện đó. Kết quả là khi mang sang phòng khám khác, hệ thống lập tức sụp đổ.
- Độ tin cậy giữa các nhóm bệnh nhân: Tỷ lệ chính xác trung bình không phản ánh đúng thực tế vì AI có thể hoạt động tốt trên toàn cục nhưng lại liên tục báo sai ở một nhóm cá biệt. Dẫn chứng từ nghiên cứu năm 2021 của Seyyed-Kalantari cho thấy các mô hình đọc X-quang thường có tỷ lệ phát hiện bệnh thấp hơn rõ rệt ở những nhóm bệnh nhân yếu thế hoặc ít được tiếp cận dịch vụ y tế — vô tình làm trầm trọng thêm sự bất bình đẳng trong chăm sóc sức khỏe.
- Mức độ phù hợp với mục đích lâm sàng: Đây được xem là yếu tố then chốt nhất. Một mô hình chuẩn xác về mặt kỹ thuật toán học vẫn có thể hoàn toàn vô giá trị trong bệnh viện. Điển hình là trường hợp một AI chấm điểm nguy cơ tử vong thấp cho bệnh nhân viêm phổi có tiền sử hen suyễn. Trên tập dữ liệu huấn luyện, nhóm bệnh nhân này thực sự có tỷ lệ sống sót cao hơn, nhưng nguyên nhân là do họ luôn được phòng cấp cứu ưu tiên điều trị tích cực ngay từ đầu. Khi đưa vào quy trình phân loại bệnh nhân (triage) để xếp thứ tự ưu tiên, kết luận của AI trở nên sai lệch và nguy hiểm.
Hướng đi chuẩn hóa thay vì mò mẫm thủ công
Nhóm tác giả tại Đại học Bristol nhấn mạnh "Learning Ensemble" là bước khởi đầu nhằm thiết lập một ngôn ngữ chung và cấu trúc chuẩn cho các nhà phát triển AI y tế. Việc đưa AI vào lâm sàng an toàn hiện vẫn là hành trình phức tạp, đòi hỏi thử nghiệm liên tục, có sự giám sát độc lập từ chuyên gia y khoa và tinh chỉnh thường xuyên.
Thay vì để các kỹ sư tự mò mẫm hay chờ đến khi xảy ra sự cố lâm sàng mới khắc phục, việc áp dụng tư duy kiểm soát dược phẩm sẽ giúp nhận diện sớm các biến số gây nhiễu, hạn chế tình trạng AI "học vẹt" dữ liệu và bảo đảm an toàn tính mạng cho người bệnh.



