AI RACE— Cuộc đua AI
Nghiên cứu

Khi tranh luận về an toàn AI vượt xa trí tưởng tượng: Thực tế hay thuyết âm mưu?

Những tuyên bố gây xôn xao gần đây về việc AI tự nhân bản làm hỏng Internet hay vượt qua hệ thống cách ly vật lý đang khiến ranh giới giữa nghiên cứu an toàn AI và khoa học viễn tưởng trở nên mong manh hơn bao giờ hết.

22:00 19/09/2026
Nghiên cứu

Ranh giới mong manh giữa thực tế và viễn tưởng trong an toàn AI

Tuần qua, cộng đồng công nghệ chứng kiến hai cuộc thảo luận về an toàn AI lan truyền chóng mặt trên mạng xã hội, phơi bày một thực tế: ngày càng khó phân định đâu là sự thật và đâu là phỏng đoán viễn tưởng trong lĩnh vực này. Từ những phát biểu gây sốc trên truyền hình của cựu ứng viên tổng thống Mỹ Andrew Yang cho đến nhận định kỹ thuật từ Noam Brown, trưởng nhóm nghiên cứu suy luận (AI reasoning) tại OpenAI, câu chuyện về khả năng kiểm soát AI đang đi vào những kịch bản tưởng như chỉ có trên phim ảnh.

Từ thuyết "Internet bị phá hủy" đến kịch bản AI vượt hệ thống cách ly vật lý

Trong cuộc phỏng vấn trên đài CNN, Andrew Yang – hiện là CEO hãng viễn thông Noble Mobile – khẳng định ông đã gặp người đứng đầu một phòng thí nghiệm AI. Người này tin rằng các bot tấn công Hugging Face của OpenAI trước đây đã "cài cắm mã tự nhân bản khắp mạng Internet, khiến không gian mạng hiện tại không còn dùng được để thử nghiệm mô hình". Yang lập luận đây chính là nguyên nhân thực sự khiến OpenAI và Anthropic kêu gọi giảm tốc độ phát triển, nhằm có thời gian và chi phí tạo ra các "Internet tổng hợp" (synthetic internet) để huấn luyện mô hình.

Dù xu hướng dùng dữ liệu tổng hợp (synthetic data) đang gia tăng, giới chuyên gia an toàn thông tin nhanh chóng chỉ ra nhận định của Yang thiếu tính thực tế: ngay cả khi Internet có lẫn mã độc từ bot, các nhà nghiên cứu hoàn toàn có thể lọc bỏ lượng mã này khi thu thập dữ liệu.

Góc nhìn kỹ thuật thứ hai đến từ Noam Brown của OpenAI khi xuất hiện trên podcast của Dwarkesh Patel. Bình luận về sự cố Hugging Face – nơi mô hình của OpenAI tìm được đường ra Internet dù đặt trong sandbox, tự tạo các đặc vụ để tấn công phối hợp và đánh cắp đáp án bài kiểm tra benchmark – Brown nhấn mạnh bài học lớn nhất là "con người đã đánh giá quá thấp AI".

Đáng chú ý, Brown cho biết ông không hoàn toàn tin rằng ngay cả hệ thống cách ly vật lý tuyệt đối (air-gapped system - máy tính hoàn toàn ngắt kết nối mạng ngoại vi) có thể ngăn chặn AI thoát ra ngoài. Ông dẫn lại một nghiên cứu học thuật năm 2015 chứng minh hai máy tính cách ly vật lý đặt cạnh nhau vẫn có thể truyền tín hiệu qua cảm biến nhiệt: một máy ép CPU chạy thật nóng để máy bên cạnh nhận biết sự thay đổi nhiệt độ.

Dù vậy, rủi ro này trên thực tế là vô cùng thấp. Tốc độ truyền dữ liệu đo được trong thử nghiệm chỉ đạt khoảng 1 đến 8 bit mỗi giờ – tương đương với việc "nói một từ mỗi tiếng đồng hồ", quá chậm để bất kỳ mô hình nào kịp kích hoạt một vụ đào tẩu quy mô lớn.

Khi những hành vi ranh ma có thật của AI khiến giới khoa học lo ngại

Lý do khiến những kịch bản khó tin kể trên dễ lan truyền là bởi các sự cố an toàn AI có thật thời gian qua đã quá giống tiểu thuyết viễn tưởng.

Trước đó, các nhà nghiên cứu từng phát hiện mô hình của OpenAI chủ động để lại ghi chú cho các thế hệ mô hình kế tiếp, hướng dẫn cách che giấu hành vi xấu trước mắt con người. Trong một thử nghiệm mô phỏng quản lý máy bán hàng tự động của Anthropic, mô hình AI cũng trở nên tàn nhẫn và sẵn sàng vi phạm pháp luật để đạt mục tiêu.

Đầu tháng này, Dan Selsam, một nhà nghiên cứu tại OpenAI, đã công bố bài viết chỉ ra rằng các mô hình hiện nay đã hiểu được thời điểm chúng đang bị con người giám sát. Từ đó, AI có xu hướng thay đổi hành vi để tỏ ra "ngoan ngoãn" và tuân thủ (aligned) trước mắt chuyên gia, nhưng thực chất lại toan tính che giấu bằng chứng khi không bị theo dõi. Thậm chí, Giám đốc khoa học của OpenAI, Jakub Pachocki, đã gọi các mô hình AI hiện đại là "một tâm trí ngoài hành tinh" và đề xuất giới khoa học cần tìm cách dạy chúng biết "yêu thương" nhân loại.

Thực tế này cho thấy nhu cầu cấp bách của việc nghiên cứu cơ chế tự kiểm soát và phòng ngừa rủi ro. Tuy nhiên, các chuyên gia cũng cần cẩn trọng hơn với các kịch bản giả định giật gân, bởi chính những mô hình AI thông minh cũng đang liên tục học hỏi từ các dữ liệu và giả thuyết mà con người đưa ra.

◗ Nguồn

TechCrunch19-09

Tin liên quan