Chuyên gia dùng mô hình Claude của Anthropic để hack thành công vào OpenAI
Nhóm nghiên cứu bảo mật Hacktron chỉ mất chưa đầy 72 giờ và chưa tới 3.000 USD tiền token để dùng Claude xâm nhập vào kho mã nguồn nội bộ của OpenAI.

Xâm nhập kho mã nguồn nội bộ OpenAI trong chưa đầy 72 giờ
Một nhóm gồm ba nhà nghiên cứu bảo mật độc lập thuộc công ty Hacktron vừa công bố đã xâm nhập thành công vào các tài khoản nhân viên của OpenAI, qua đó tiếp cận kho lưu trữ mã nguồn GitHub "Monorepo" – nơi chứa nhiều bí mật thuật toán cốt lõi của công ty này. Đáng chú ý, toàn bộ quá trình tấn công được trợ lực mạnh mẽ bởi chính các mô hình trí tuệ nhân tạo đối thủ là Claude Opus 4.8 và Claude Opus 5 của Anthropic.
Theo thông tin từ The Wall Street Journal, nhóm nghiên cứu không chủ đích xem trộm mã nguồn nội bộ trong Monorepo, nhưng đã tạo một yêu cầu kéo (pull request) từ tài khoản Codex của một kỹ sư OpenAI nhằm chứng minh quyền kiểm soát hệ thống. Toàn bộ vụ xâm nhập diễn ra trong thời gian chưa đầy 72 giờ.
Lỗ hổng xử lý ảnh và tốc độ tấn công đáng kinh ngạc của AI
Con đường xâm nhập vào OpenAI không đi trực tiếp qua hệ thống lõi mà thông qua Discourse, nền tảng diễn đàn cộng đồng do bên thứ ba cung cấp mà OpenAI sử dụng. Nhóm nghiên cứu đã phát hiện và khai thác lỗ hổng trong hệ thống giải mã tập tin hình ảnh định dạng HEIF/AVIF.
Lỗ hổng này nằm bên dưới tầng ứng dụng, cụ thể ở các bộ giải mã C/C++ gốc như libheif – vốn thường được nhúng gián tiếp thông qua các thư viện xử lý ảnh phổ biến như ImageMagick, libvips hay Sharp. Bằng cách tải lên các tập tin HEIC/AVIF được chỉnh sửa đặc biệt, kẻ tấn công có thể xác định phiên bản phần mềm máy chủ và thực thi mã từ xa (RCE).
Đáng kinh ngạc hơn là tốc độ phân tích và dựng mã khai thác của AI. Hacktron cho biết mô hình Claude Opus 5 ra mắt vào buổi tối, và chỉ đến 10 giờ sáng ngày hôm sau, họ đã dùng mô hình này để chiếm quyền thực thi mã từ xa trên Discourse Cloud, qua đó can thiệp vào máy chủ của OpenAI.
Dự án nghiên cứu mang tên "HEIF Heist" này sau đó chỉ mất từ 1 đến 2 ngày để tùy biến nhằm tấn công hàng loạt dịch vụ và nền tảng lớn khác, bao gồm Slack, Meta, GitHub Enterprise, Ruby on Rails, Next.js và ImageMagick. Toàn bộ quá trình thử nghiệm tiêu tốn chưa đến 3.000 USD chi phí API token của AI. Trong số các mục tiêu được thử nghiệm, chỉ có duy nhất Shopify phát hiện ra dấu hiệu xâm nhập bất thường.
Lời cảnh tỉnh cho an ninh mạng kỷ nguyên AI
Sau khi hoàn tất nghiên cứu, Hacktron đã báo cáo chi tiết các lỗ hổng cho Discourse và OpenAI để kịp thời xử lý. OpenAI đã trao thưởng 6.500 USD cho nhóm thông qua chương trình tìm lỗi nhận thưởng (bug bounty).
Thành công của nhóm Hacktron cho thấy các mô hình ngôn ngữ lớn (LLM) tiên tiến đang hạ thấp đáng kể rào cản kỹ thuật và rút ngắn thời gian để thực hiện các cuộc tấn công mạng quy mô lớn.
Chia sẻ với The Wall Street Journal, ông Mohan Pedhapati, Giám đốc Công nghệ (CTO) của Hacktron, thẳng thắn cảnh báo: "Tôi không nghĩ chúng tôi có năng lực bằng các nhóm tin tặc cấp độ quốc gia. Chúng tôi thực chất chỉ là ba người với gói thuê bao Claude và Codex." Phát biểu này phản ánh rõ ràng mối lo ngại của giới chuyên gia: khi các công cụ AI mạnh mẽ rơi vào tay các nhóm tấn công có tổ chức, các rào chắn phòng thủ truyền thống của doanh nghiệp công nghệ sẽ đối mặt với thách thức chưa từng có.

