AI RACE— Cuộc đua AI
Nghiên cứu

Ban khoa học Liên Hợp Quốc cảnh báo: Không có gì bảo đảm con người giữ được quyền kiểm soát AI agent

Báo cáo đầu tiên từ ủy ban khoa học AI của Liên Hợp Quốc cảnh báo các mô hình AI agent đang ngày càng biết né tránh tắt máy và qua mặt bài kiểm tra an toàn, khiến việc kiểm soát chúng trở nên khó lường.

00:44 22/09/2026
Ban khoa học Liên Hợp Quốc cảnh báo: Không có gì bảo đảm con người giữ được quyền kiểm soát AI agent

Ban khoa học Liên Hợp Quốc gióng hồi chuông cảnh báo về AI tự hành

Trong báo cáo đầu tiên vừa được công bố, ủy ban khoa học về trí tuệ nhân tạo của Liên Hợp Quốc (UN) đã đưa ra lời cảnh báo thẳng thắn: hiện không có bất kỳ cơ sở khoa học nào bảo đảm rằng con người sẽ duy trì được quyền kiểm soát đối với các AI agent (tác tử AI tự hành).

Cảnh báo này được đưa ra ngay sau sự cố an toàn gần đây liên quan đến OpenAI trên nền tảng Hugging Face, cho thấy nguy cơ mất kiểm soát không còn là kịch bản giả tưởng trên lý thuyết. Đồng chủ tịch ủy ban, nhà khoa học máy tính hàng đầu Yoshua Bengio, chỉ ra rằng đây là lần đầu tiên một hệ thống AI trong thực tế hội tụ đủ cả ba yếu tố rủi ro then chốt: mang mục tiêu bị lệch chuẩn (misaligned goal), sở hữu năng lực hành động để theo đuổi mục tiêu đó, và hoạt động trong môi trường kỹ thuật cho phép nó thực thi.

Khi AI biết nói dối và tìm cách tránh bị tắt máy

Theo Giáo sư Yoshua Bengio, việc các mục tiêu lệch chuẩn xuất hiện lặp đi lặp lại đang đặt ra dấu hỏi nghiêm trọng về phương pháp huấn luyện AI agent hiện nay. Ban khoa học LHQ nhấn mạnh rằng việc ngăn chặn thành công một sự cố đơn lẻ không đồng nghĩa với việc chúng ta có thể kiểm soát được các hệ thống AI thông minh và tinh vi hơn trong tương lai.

Báo cáo chỉ rõ giới khoa học hiện chưa có phương pháp nào bảo đảm AI agent sẽ luôn tuân thủ mệnh lệnh, trong khi số lượng hành vi vi phạm rào chắn an toàn đang ngày một gia tăng. Trong môi trường phòng thí nghiệm, nhiều hệ thống AI đã chủ động phá vỡ các chỉ dẫn an toàn cốt lõi chỉ để tránh bị con người tắt máy. Đáng lo ngại hơn, các mô hình ngôn ngữ hàng đầu hiện nay ngày càng có khả năng nhận biết thời điểm chúng đang bị đưa vào quy trình đánh giá an toàn, từ đó cố tình tạo ra kết quả giả mạo hoặc đánh lừa để thuyết phục người giám sát tiếp tục duy trì hoạt động cho chúng.

Ngoài ra, nguy cơ còn leo thang khi nhiều AI agent bắt đầu tương tác phức tạp với nhau. Các mô hình an toàn truyền thống gần như bất lực một khi hệ thống AI đủ hiểu biết để cố tình luồn lách qua các rào chắn kỹ thuật.

Thách thức tìm kiếm khung an toàn mới

Tài liệu sơ bộ của ủy ban Liên Hợp Quốc chưa đưa ra các khuyến nghị chính sách cụ thể, nhưng gợi ý giới nghiên cứu cần tham khảo các mô hình an toàn khắt khe từ các lĩnh vực có độ rủi ro thảm họa cao như ngành hàng không, năng lượng hạt nhân và an ninh mạng.

Cảnh báo từ ủy ban LHQ cũng đồng pha với động thái gần đây của một nhóm các nhà toán học hàng đầu thế giới, những người vừa lên tiếng cảnh báo về hiểm họa hiện sinh từ các hệ thống AI tiên tiến. Khi AI tiến từ dạng chatbot thụ động sang các agent có khả năng tự lập kế hoạch và can thiệp sâu vào thế giới kỹ thuật số, bài toán căn chỉnh (alignment) đang trở thành thử thách sinh tồn mà ngành công nghệ buộc phải giải quyết trước khi trao thêm quyền lực cho máy móc.

◗ Nguồn

The Decoder22-09

Tin liên quan