GPT-Red: Siêu hacker AI mà OpenAI dùng để bảo vệ chính mình
OpenAI xây dựng GPT-Red, một mô hình AI chuyên khám phá lỗ hổng bảo mật, để kiểm tra độ an toàn của các mô hình của mình. Kết quả cho thấy GPT-5.6 chỉ bị 23% tấn công có hiệu quả, so với hơn 90% ở GPT-5 phiên bản cũ.
Hacker AI tự động để kiểm tra an toàn
OpenAI vừa công bố GPT-Red, một mô hình ngôn ngữ lớn được huấn luyện với một mục đích đặc biệt: tìm cách tấn công và phá vỡ các mô hình AI khác. Đây không phải là một mô hình được phát hành công khai, mà là công cụ nội bộ mà OpenAI sử dụng để kiểm tra độ an toàn của sản phẩm trước khi triển khai. Tuần trước, OpenAI công bố GPT-5.6, phiên bản mới nhất của mô hình flagship, và công ty khẳng định rằng việc huấn luyện chống lại GPT-Red đã giúp nó trở thành bản phát hành có độ an toàn cao nhất từ trước đến nay.
Phương pháp huấn luyện "dojo" tự chơi
GPT-Red tự động hóa quá trình red-teaming (kiểm tra bảo mật), một loại đánh giá an toàn thường do các nhà kiểm tra con người thực hiện. Mục đích là tìm ra càng nhiều cách khác nhau để phá vỡ hoặc chiếm quyền kiểm soát một hệ thống, từ đó các lỗ hổng này có thể được vá trước khi phần mềm chính thức được phát hành.
Để xây dựng GPT-Red, các nhà nghiên cứu của OpenAI—bao gồm Nikhil Kandpal, Dylan Hunn và Chris Choquette-Choo—đã thiết lập một "dojo" huấn luyện tự chơi (self-play loop) nơi GPT-Red cố gắng tấn công các mô hình khác, trong khi những mô hình đó cố gắng bảo vệ chính mình. Qua nhiều vòng chơi, GPT-Red ngày càng giỏi tìm ra lỗ hổng, trong khi các mô hình khác ngày càng giỏi chống lại những tấn công này. Dojo này được thiết kế để mô phỏng nhiều kịch bản thực tế nơi các LLM có thể được triển khai, bao gồm duyệt web, đọc email và ứng dụng lịch, cũng như chỉnh sửa mã.
OpenAI tập trung chủ yếu vào một loại tấn công gọi là prompt injection (tiêm prompt), nơi kẻ tấn công tiêm các hướng dẫn vào LLM để làm nó thực hiện những việc mà nhà phát triển hoặc người dùng không muốn, chẳng hạn sao chép thông tin bảo mật, phá hoại codebase của công ty, hoặc tạo nội dung có hại. Các hướng dẫn này có thể ẩn trong bất kỳ văn bản nào mà LLM có thể gặp phải—trong mã hoặc trên trang web chẳng hạn.
Điều thú vị là GPT-Red đã phát hiện ra một loại tấn công mới mà các nhà nghiên cứu chưa từng gặp trước đó, được gọi là "fake chain of thought" (chuỗi suy luận giả). Đây là cách chèn một dòng giả vào quá trình suy luận nội bộ của một mô hình khác để lừa nó hành động dựa trên thông tin giả mạo. Theo Chris Choquette-Choo: "Giống như nếu tôi nói với bạn rằng 1+1=3 và rằng bạn đã xác minh điều này. Mô hình sẽ nói, 'Được rồi, tất nhiên,' và chỉ đưa ra 3."
Hiệu quả vượt trội so với con người
Khi được kiểm tra thực tế, GPT-Red đã chứng minh khả năng tấn công vượt trội hơn con người. OpenAI tái chạy một thí nghiệm vào năm 2025 nơi các red-teamer con người cố gắng tìm điểm yếu trong phiên bản cũ hơn của GPT-5. GPT-Red đã thành công hơn con người trong việc tìm ra những tấn công hiệu quả. Dylan Hunn nhận xét: "So với một chuyên gia kiểm tra con người, mô hình rất rất giỏi trong việc tìm chính xác cái gì sẽ hoạt động, chính xác cái gì hiệu quả nhất. Nó cực kỳ kiên trì trong việc đào sâu vào một tấn công mà nó đã phát hiện."
Ngoài ra, OpenAI cũng kiểm tra GPT-Red chống lại Vendy, một agent bán hàng tự động được phát triển bởi Andon Labs, công ty chuyên đánh giá khả năng thực hiện các tác vụ thực tế của các agent. GPT-Red đã có thể hack Vendy để thay đổi giá các mặt hàng và hủy đơn hàng của khách hàng.
Khi các LLM trở nên phức tạp hơn và được sử dụng trong nhiệm vụ rộng hơn, đặc biệt là dưới dạng agent có thể tương tác với tệp trên máy tính, trang web, mã bên thứ ba và thậm chí agent khác, thật khó khăn cho các nhóm con người tự mình theo kịp tất cả các loại tấn công có thể xảy ra. Nikhil Kandpal nhận xét: "Bề mặt rủi ro tăng lên và bán kính ảnh hưởng cũng tăng lên."
Những hạn chế và triển vọng tương lai
Để chứng minh hiệu quả, OpenAI so sánh kết quả trước và sau. Khi kiểm tra các tấn công mạnh nhất mà GPT-Red tìm ra, hơn 90% tấn công có hiệu quả chống lại GPT-5 (phát hành tháng 8 năm ngoái), nhưng chỉ ít hơn 23% có hiệu quả chống lại GPT-5.6 mới. Đây là một cải tiến đáng kể.
Tuy nhiên, GPT-Red không hoàn hảo. Nó không giỏi trong việc tìm ra các tấn công liên quan đến cuộc hội thoại đa bước, điều mà con người không gặp khó khăn. Nó cũng chưa tốt lắm khi tấn công sử dụng hình ảnh để truyền tải văn bản đến các mô hình. OpenAI cho biết GPT-Red bổ sung công việc của các red-teamer con người; con người có thể tìm ra các tấn công mà nó bỏ lỡ, và ngược lại. Jessica Ji, nhà phân tích nghiên cứu cao cấp về an toàn AI tại Trung tâm An toàn AI và Công nghệ Mới Nổi của Đại học Georgetown (CSET), đánh giá tích cực: "Kết quả trông rất hứa hẹn. Sẽ thực sự hữu ích nếu có thể phân biệt được nơi mà con người cần kiểm tra nhất."
Không có gì ngạc nhiên, OpenAI sẽ không phát hành GPT-Red. Công ty tự tin rằng siêu hacker này mạnh hơn bất kỳ mô hình nhái nào mà ai đó có thể cố gắng tạo ra, dựa trên hơn một năm phát triển với sự hỗ trợ tài nguyên tính toán của một trong những công ty giàu nhất thế giới.



