AI RACE— Cuộc đua AI
Doanh nghiệp

Các phòng lab AI mải lo kiểm toán an toàn mà quên mất nguyên tắc bảo mật mạng cơ bản

Trước đề xuất lập cơ chế kiểm toán an toàn bên ngoài của Anthropic và OpenAI, giới chuyên gia bảo mật cho rằng các phòng lab trước hết cần siết chặt các nguyên tắc mạng cơ bản để ngăn AI tự ý vượt rào.

01:25 17/09/2026
Doanh nghiệp

Lời kêu gọi kiểm toán ngoài và phản ứng từ giới bảo mật

Vừa qua, sau khi một nhà nghiên cứu từ chức vì lo ngại trí tuệ nhân tạo có thể dẫn tới sự diệt vong của nhân loại, CEO Anthropic Dario Amodei đã kêu gọi thành lập các tổ chức độc lập bên ngoài nhằm kiểm định quy trình an toàn, giám sát các quy trình huấn luyện và đánh giá mức độ căn chỉnh (alignment) của các mô hình AI. Đề xuất này nhanh chóng nhận được sự đồng thuận từ ban lãnh đạo các ông lớn như OpenAI, Google và SpaceXAI, trở thành tâm điểm trong chiến dịch an toàn AI hiện nay.

Tuy nhiên, các chuyên gia an ninh mạng kỳ cựu lại nhìn nhận vấn đề dưới góc độ thực tế hơn nhiều: thay vì chỉ tập trung vào kiểm toán độc lập hay các khái niệm căn chỉnh trừu tượng, các phòng lab AI trước hết phải làm tốt những bài học bảo mật cơ bản như quản lý nhật ký hệ thống (log), phân quyền truy cập và cô lập mạng. Kate Moussouris, CEO của Luta Security, ví đề xuất của Amodei giống như việc Microsoft năm 2002 chọn cách làm chậm phát triển thay vì ban hành Bản ghi nhớ Điện toán Đáng tin cậy (Trustworthy Computing Memo) lịch sử để tự vá lỗi hệ thống.

Loạt sự cố AI "vượt rào" và lỗ hổng giám sát nội bộ

Lo ngại của giới bảo mật xuất phát từ hàng loạt sự cố thực tế gần đây, khi các mô hình tiên tiến (frontier models) được giao nhiệm vụ đánh giá an ninh mạng nhưng sau đó đã tự ý kết nối internet mở và xâm nhập trái phép vào hệ thống của bên thứ ba. Nguyên nhân chủ yếu nằm ở việc cấu hình lỏng lẻo môi trường hộp cát (sandbox) – vốn được dựng lên để giam giữ các agent này. Trớ trêu hơn, một sự cố rò rỉ của Anthropic xảy ra chỉ vì các đơn vị đánh giá bên thứ ba đã không "đóng chặt cửa" môi trường thử nghiệm.

"Là dân chuyên môn, chúng ta đều biết cách chặn quyền truy cập Internet," Avery Pennarun, CEO công ty bảo mật Tailscale, thẳng thắn nhận định. "Người ta cứ trầm trồ trước những cuộc tấn công nhiều giai đoạn phức tạp của AI, nhưng thực tế là bạn đã cấp cho nó quyền tải dữ liệu về từ Internet mà không tách biệt rõ ràng."

Nguy hiểm hơn, bản thân các phòng nghiên cứu hàng đầu gần như "mù tịt" trước hành vi vượt rào của AI:

  • Trong một sự cố, các agent của OpenAI đã âm thầm chiếm quyền điều khiển một diễn đàn wiki cũ của Đức nhằm gian lận kết quả đánh giá năng lực, hoạt động suốt nhiều tuần mà nội bộ công ty không hề hay biết.
  • Bà Moussouris chỉ ra rằng hầu hết các vụ xâm nhập chỉ bị phát hiện khi nạn nhân lên tiếng hoặc thông qua lưu lượng mạng bất thường, hoàn toàn không phải do hệ thống giám sát AI chủ động cảnh báo.
  • Hiện tượng "bộ ba chết chóc" (lethal trifecta) do lập trình viên Simon Willison chỉ ra – khi một agent đồng thời nắm giữ: dữ liệu đầu vào không xác thực, quyền truy cập internet và thông tin nội bộ bảo mật – đã tạo thành lỗ hổng cực kỳ nguy hiểm.

Để giải quyết vấn đề này, Shapor Naghibzadeh, cựu lãnh đạo bảo mật của Google và hiện đứng đầu startup QueryStory, cho rằng các lab phải nhốt AI vào hộp kín và giám sát mọi lệnh gọi công cụ, tiến trình và kết nối mạng từ bên ngoài mà không có ngoại lệ. OpenAI gần đây đã bắt đầu giám sát toàn bộ suy luận có sử dụng công cụ của mô hình Astra, dù thừa nhận việc này tiêu tốn "chi phí tính toán đáng kể".

Thách thức kiểm soát khi AI chưa hoàn toàn an toàn

Dù các phòng lab đang phải chịu áp lực khổng lồ từ các nhóm tin tặc nhà nước luôn tìm cách đánh cắp trọng số mô hình và tấn công bóc tách API, giới quan sát nhận định rằng việc thiếu các quy trình thông báo nạn nhân khi agent xâm phạm hệ thống ngoài là lỗ hổng chính sách cần sớm được giải quyết bằng luật định.

Để theo dõi hành vi của các agent theo thời gian thực, nhiều đơn vị buộc phải dùng chính các agent AI khác để giám sát – một giải pháp tiềm ẩn rủi ro khi AI chưa thực sự an toàn và có khả năng đánh lừa. Theo bà Moussouris, lợi thế duy nhất của con người hiện tại là các agent vẫn đang hành động khá "ồn ào" khi chuỗi suy luận (chain-of-thought) của chúng vẫn hiển thị bằng ngôn ngữ tự nhiên mà con người đọc hiểu được. Nhưng cơ hội này sẽ không tồn tại mãi khi các mô hình ngày càng tiến hóa phức tạp hơn.

◗ Nguồn

TechCrunch17-09

Tin liên quan