An toàn AI tụt lại phía sau: Cựu kỹ sư Waymo cảnh báo bài học từ xe tự lái
Trước làn sóng lo ngại về rủi ro trí tuệ nhân tạo sau sự ra đi của nhà nghiên cứu Anthropic, chuyên gia Brooke Hopkins nhận định ngành AI cần học hỏi kỷ luật an toàn từ xe tự lái thay vì chỉ kiểm tra qua loa trước khi phát hành.

Làn sóng lo ngại an toàn dâng cao trong ngành AI
Ngành công nghệ tiếp tục đối mặt với sức ép lớn về kiểm soát rủi ro khi Jacob Coxon, một nhà nghiên cứu tại Anthropic, quyết định rời công ty vì lo ngại năng lực của AI đang tiến triển quá nhanh mà thiếu kiểm soát. Coxon thậm chí đưa ra lời cảnh báo gay gắt rằng công nghệ này có thể "xóa sổ nhân loại vào cuối thập kỷ".
Sự ra đi này diễn ra trong bối cảnh các sự cố liên quan đến hành vi bất thường của AI ngày càng khó che giấu, điển hình là vụ việc mô hình của OpenAI tạo ra các hành vi tấn công chưa từng có nhắm vào nền tảng Hugging Face hồi đầu mùa hè – sự kiện mà chính OpenAI thừa nhận là "phát súng cảnh báo" cho toàn thế giới về sức mạnh chưa được kiểm soát của AI.
Trước thực trạng đó, Brooke Hopkins – nhà sáng lập nền tảng quan sát AI agent Coval AI, đồng thời từng lãnh đạo đội ngũ đảm bảo an toàn và độ tin cậy tại hãng xe tự lái Waymo – cho rằng vấn đề cốt lõi nằm ở cách tiếp cận sai lầm: ngành AI đang coi an toàn như một bước kiểm tra cuối cùng trước khi ra mắt thay vì một quy trình giám sát liên tục.
Bài học từ Waymo: Đưa kỷ luật xe tự lái vào Voice AI
Theo bà Hopkins, tốc độ và quy mô chính là điểm khác biệt lớn nhất khiến các rủi ro truyền thống như lừa đảo, phát tán thông tin sai lệch hay rò rỉ dữ liệu nhạy cảm bùng phát với cấp số nhân qua AI. Tuy nhiên, các phương pháp đánh giá hiện tại vẫn chưa theo kịp thực tế. Một bộ điểm chuẩn (benchmark) chỉ phản ánh cách mô hình hoạt động ở một bài kiểm tra tĩnh tại thời điểm cụ thể, hoàn toàn không dự đoán được hệ thống sẽ phản ứng ra sao qua hàng triệu lượt tương tác thực tế phức tạp.
Hopkins đặc biệt nhấn mạnh sự tương đồng giữa Voice AI (AI giọng nói) và xe tự lái. Trong khi các công ty đang chạy đua thương mại hóa Voice AI với tốc độ chóng mặt, khả năng phát hiện lỗi và quản lý rủi ro lại tụt hậu. Kinh nghiệm từ Waymo cho thấy một hệ thống phức tạp không bao giờ có thể dựa vào một loại bài kiểm tra duy nhất để cấp phép vận hành. Thay vào đó, ngành xe tự lái buộc phải áp dụng quy trình nghiêm ngặt gồm: mô phỏng (simulation), thử nghiệm trong môi trường có kiểm soát, kiểm tra các tình huống biên (edge-case), giám sát thời gian thực và triển khai từng bước nhỏ ra thị trường.
Voice AI cũng đòi hỏi kỷ luật tương tự. Doanh nghiệp phải nắm được mô hình sẽ phản ứng thế nào khi các cuộc hội thoại trở nên lộn xộn, người dùng hành xử kỳ quặc hoặc phát sinh tình huống ngoài kịch bản thiết kế. Hopkins nhấn mạnh rằng không bộ công cụ đánh giá tự động nào có thể bao quát toàn bộ rủi ro; vai trò của con người trong vòng lặp (human-in-the-loop), đội ngũ red-team thử nghiệm đối kháng và khả năng can thiệp trực tiếp khi mô hình gặp sự cố tại môi trường vận hành thực tế (production) là yếu tố bắt buộc.
Khung pháp lý và bài toán cân bằng giữa tốc độ và an toàn
Về khía cạnh quản lý, cựu kỹ sư Waymo nhận định các quy định pháp luật hữu ích nhất không nên can thiệp cứng nhắc vào cách các công ty lập trình công nghệ, mà phải tập trung vào kết quả đầu ra và trách nhiệm giải trình. Đối với các hệ thống rủi ro cao hoặc có tầm ảnh hưởng lớn, cơ quan quản lý cần buộc doanh nghiệp phải lập tài liệu phân tích rủi ro, minh bạch giới hạn của hệ thống, báo cáo các sự cố nghiêm trọng và chấp nhận cơ chế đánh giá độc lập. Do rủi ro ở mỗi lĩnh vực rất khác nhau, các tiêu chuẩn an toàn cũng cần được thiết kế riêng biệt theo từng ngành dọc.
Bà Hopkins khẳng định tốc độ phát triển và an toàn không nhất thiết phải triệt tiêu lẫn nhau. Thay vì coi an toàn là "cánh cổng" chặn bước ở khâu cuối, các hãng công nghệ cần phân rã quy trình thành nhiều bước kiểm tra nhỏ xuyên suốt chu kỳ phát triển. Khi một hệ thống bắt đầu có dấu hiệu sai lệch nghiêm trọng trong môi trường thực tế, doanh nghiệp phải có sẵn năng lực can thiệp, vá lỗi hoặc lập tức thu hồi phiên bản để bảo vệ người dùng.


