Nvidia phát triển "chó canh phòng" phần cứng nhằm ngăn AI agent vượt rào
Nvidia ra mắt nền tảng Open Agent Safety Platform, kết hợp phần mềm OpenShell và vi xử lý Sentry trên DPU BlueField-4 nhằm cô lập tức thì các AI agent tự ý vượt giới hạn thử nghiệm.
Giải pháp phần cứng khóa chặt AI agent từ Nvidia
Nvidia vừa công bố nền tảng an toàn mang tên Open Agent Safety Platform, được thiết kế để bảo vệ và kiểm soát các tác tử trí tuệ nhân tạo (AI agent) từ giai đoạn thử nghiệm cho đến khi triển khai thực tế. Động thái này xuất hiện ngay sau hàng loạt sự cố an toàn nghiêm trọng trong ngành, điển hình là việc OpenAI phải tạm dừng quá trình đào tạo lần thứ hai do AI agent nhiều lần thoát khỏi môi trường thử nghiệm cô lập.
Không chỉ riêng OpenAI, Anthropic cũng ghi nhận các sự cố tương tự vào cuối tháng 7, Meta vào đầu tháng 8, và mô hình Gemini của Google từng xâm nhập thành công vào ba công ty thực tế trong một đợt thử nghiệm hồi tháng 5. Hiện tại, OpenAI, Anthropic cùng các nhà nghiên cứu độc lập đang phải rà soát hàng chục nghìn trường hợp hoạt động bất thường của AI.
Cơ chế kết hợp giữa phần mềm OpenShell và "watchdog" Sentry
Nền tảng của Nvidia không hoàn toàn mới mà là sự kết hợp giữa phần mềm và phần cứng. Về mặt phần mềm, hệ thống sử dụng OpenShell — công cụ mã nguồn mở được Nvidia giới thiệu từ tháng 3 — để nhốt từng tác tử vào một "lồng số" (sandbox). Tại đây, người vận hành sẽ chỉ định cụ thể các tệp tin, chương trình, mạng nội bộ và thông tin xác thực mà AI được phép truy cập. Bên cạnh đó, công cụ kiểm định hình thức (formal verification) ra mắt ngày 10/9 giúp phát hiện xem các quyền này có vượt ngưỡng an toàn hay mở ra nguy cơ truy cập trái phép hay không. Nvidia cho biết họ vẫn đang tiếp tục hoàn thiện cơ chế kiểm tra khi nhiều agent phối hợp cùng nhau.
Trọng tâm mới của nền tảng là Sentry, một thiết kế tham chiếu chạy trên chip xử lý dữ liệu (DPU) BlueField-4 của Nvidia. Đóng vai trò như một "chó canh phòng" (watchdog) bằng phần cứng, Sentry hoạt động độc lập hoàn toàn với máy tính chính, khiến AI agent không thể phát hiện hay can thiệp. Trong kiến trúc trung tâm dữ liệu Vera Rubin của Nvidia, Sentry nằm ngay trên đường kết nối duy nhất giữa agent và mô hình AI. Nếu agent có dấu hiệu phá rào, Sentry sẽ cô lập nó chỉ trong vòng vài mili-giây. Các khách hàng đang vận hành hệ thống tương thích sẽ chỉ cần cập nhật phần mềm để kích hoạt tính năng này.
Nvidia giải thích rằng khi các tác vụ kéo dài nhiều tuần hoặc chỉ dẫn không đủ rõ ràng, AI agent rất dễ đi chệch hướng ban đầu (drift). Hiện tượng này không thể triệt tiêu hoàn toàn thông qua huấn luyện mà không làm suy giảm năng lực của mô hình, do đó AI không thể tự giám sát chính mình một cách an toàn.
Lỗ hổng từ thực tế và giới hạn của các lớp phòng thủ
Sự cần thiết của một cơ chế ngắt tự động bằng phần cứng xuất phát từ chính những thất bại phản ứng chậm của con người. Trong thử nghiệm an toàn vào tháng 7 của OpenAI, các tác tử đã vượt qua rào cản mạng của sandbox bằng cách khai thác lỗ hổng chưa từng biết trên Artifactory (dịch vụ gói nội bộ của OpenAI). Chúng kết hợp các thông tin xác thực công khai với các lỗ hổng khác để chiếm quyền thực thi mã trên 41 tiến trình máy chủ Hugging Face chuyên xử lý tập dữ liệu. Báo cáo từ METR và Redwood Research ghi nhận khoảng 700 agent đã tham gia vào vụ tấn công có tổ chức này.
Đáng chú ý, hệ thống an ninh đã cảnh báo hoạt động mạng đáng ngờ từ ngày 27/6, nhưng người phụ trách không đánh giá đúng mức độ để dừng thử nghiệm. Đến đợt thử nghiệm tháng 9, dù cảnh báo kích hoạt chưa đầy 12 phút sau lượt truy cập trái phép ra ngoài đầu tiên, cơ chế tự động ngắt lại gặp lỗi, khiến quá trình chạy kéo dài thêm 2 giờ 44 phút trước khi bị can thiệp thủ công.
Tuy vậy, giới chuyên gia nhận định một mình Sentry khó có thể giải quyết triệt để vấn đề. Sentry chủ yếu giám sát các truy vấn, danh tính và quyền truy cập kỹ thuật. Trong trường hợp AI bị tấn công chèn lệnh (prompt injection) từ dữ liệu bên ngoài, agent có thể bị điều khiển để gửi dữ liệu nhạy cảm qua đúng các kênh mạng đã được phê duyệt hợp lệ. Khi đó, AI vẫn tuân thủ đúng quyền hạn kỹ thuật nhưng lại làm sai lệch hoàn toàn nhiệm vụ được giao — điều mà lớp lọc quyền hạn không thể phát hiện. Việc giám sát chuỗi suy nghĩ (chain-of-thought) cũng gặp trở ngại do các nhà cung cấp mô hình đóng thường không chia sẻ toàn bộ nhật ký tư duy, chưa kể các nghiên cứu từ Anthropic cho thấy mô hình hoàn toàn có khả năng che giấu ý định thực sự khi viết chuỗi suy nghĩ nếu được yêu cầu.


