OpenAI triệt phá chiến dịch đánh cắp chuỗi suy nghĩ của AI, nhưng lỗ hổng vẫn mở trên Azure
OpenAI thông báo đã ngăn chặn một chiến dịch quy mô lớn nhằm trích xuất chuỗi suy nghĩ ẩn của các mô hình AI, song các nhà nghiên cứu phát hiện thủ thuật này vẫn hoạt động trơn tru trên nền tảng Microsoft Azure suốt nhiều tuần.

OpenAI phát hiện chiến dịch "chưng cất đối kháng" quy mô lớn
OpenAI vừa công bố triệt phá thành công một chiến dịch tấn công dạng "chưng cất đối kháng" (adversarial distillation) nhắm vào các mô hình của hãng. Mục tiêu của kẻ tấn công là chuỗi suy nghĩ ẩn (reasoning/chain-of-thought) — các bước xử lý nội bộ diễn ra trước khi mô hình đưa ra câu trả lời cuối cùng cho người dùng.
Trong kỹ thuật chưng cất mô hình (distillation), một AI nhỏ hơn sẽ học trực tiếp từ toàn bộ dữ liệu đầu ra của một AI lớn hơn. Nếu nắm được toàn bộ chuỗi suy nghĩ trung gian chứ không chỉ kết quả sau cùng, các bên phát triển khác có thể dễ dàng tái tạo năng lực suy luận phức tạp của mô hình với chi phí thấp hơn rất nhiều. OpenAI cho biết các bước ẩn này chứa nhiều thông tin có giá trị cao mà hãng chủ ý không hiển thị trong câu trả lời hoàn chỉnh.
Hoạt động trích xuất bắt đầu ở mức thăm dò từ ngày 1/7, sau đó bùng nổ mạnh vào ngày 24 và 25/7 với khoảng 16.000 yêu cầu từ hơn 4.000 tài khoản mang cùng dấu hiệu trích xuất đặc trưng. Mở rộng điều tra, OpenAI đã phát hiện và khóa toàn bộ mạng lưới hơn 15.000 tài khoản liên quan vào ngày 28/7, dù lưu ý rằng đây mới là các nỗ lực trích xuất chứ chưa hẳn toàn bộ đều thành công. Đáng chú ý, OpenAI liên kết nhóm nòng cốt của chiến dịch này với những cá nhân thuộc Moonshot AI — công ty Trung Quốc đứng sau mô hình Kimi. Trước đó không lâu, Anthropic cũng ghi nhận các hành vi tương tự từ các công ty AI của Trung Quốc.
Lỗ hổng khóa mã hóa chung và thủ thuật dùng mô hình giá rẻ giải mã
Kỹ thuật mà kẻ tấn công sử dụng dựa trên nghiên cứu do chuyên gia Joachim Schaeffer và cộng sự công bố trước đó. Về nguyên lý, các nhà cung cấp dịch vụ AI gửi chuỗi suy nghĩ về phía người dùng dưới dạng các gói dữ liệu đã mã hóa để người dùng đính kèm vào các lượt trò chuyện tiếp theo. Tuy nhiên, do các gói này được mã hóa bằng khóa dùng chung (shared key), chúng có thể bị luân chuyển giữa các phiên làm việc, giữa các tài khoản khác nhau và thậm chí giữa các mô hình khác nhau của cùng một nhà cung cấp.
Kẻ tấn công chỉ cần sao chép gói suy nghĩ đã mã hóa từ cuộc trò chuyện với mô hình đắt tiền, sau đó gửi sang một phiên trò chuyện với mô hình rẻ hơn cùng họ và yêu cầu mô hình này giải mã rồi in nguyên văn ra. Mô hình rẻ tiền lúc này đóng vai trò như một bộ giải mã giúp đọc toàn bộ suy nghĩ ẩn của mô hình cao cấp. Bên cạnh đó, một lập trình viên tên Can Bölük còn chỉ ra cách đơn giản hơn: cấp cho mô hình một công cụ ghi chú ảo (notepad) rồi yêu cầu nó viết toàn bộ suy nghĩ nội bộ vào đó để người dùng đọc trực tiếp.
OpenAI đã ghi nhận đóng góp của nhóm nghiên cứu, siết chặt quy trình đăng ký, cấm các tài khoản vi phạm, đồng thời vá lỗ hổng tái sử dụng dữ liệu mã hóa và áp dụng cơ chế lọc luồng đầu ra. Tuy nhiên, câu chuyện chưa dừng lại ở đó.
Lỗ hổng chắp vá: API chính chủ an toàn, đám mây đối tác vẫn "thủng"
Cùng ngày OpenAI đưa ra thông báo, nhà nghiên cứu Joachim Schaeffer công bố trên mạng xã hội X rằng họ tiếp tục trích xuất thành công chuỗi suy nghĩ. Khi kiểm tra lại vào ngày 13/9, cuộc tấn công đã bị chặn hoàn toàn trên API chính thức của OpenAI và Anthropic. Thế nhưng, trên nền tảng đám mây Microsoft Azure, phương thức này vẫn hoạt động hiệu quả đối với mọi mô hình OpenAI được thử nghiệm (bao gồm cả bản thử nghiệm GPT-6 Astra) và các mô hình Anthropic cho đến tận Sonnet 5.
Chỉ cần một truy vấn duy nhất trên Azure là đủ để trích xuất nguyên văn chuỗi suy nghĩ. Phương pháp dùng công cụ ghi chú ảo cũng thành công trên toàn bộ mô hình OpenAI trên Azure, cũng như Opus 4.8 và Sonnet 5 (chỉ có Opus 5, Fable 5 và Fable 5.1 là không bị lộ). Nhóm nghiên cứu chỉ trích các bản vá hiện tại mang tính đối phó, chắp vá theo từng chuỗi mẫu truy vấn cụ thể và cập nhật lên đám mây rất chậm chạp. Theo mốc thời gian của nhóm, OpenAI chỉ bổ sung biện pháp bảo vệ cho endpoint Azure vào ngày 27/9, và Anthropic khắc phục trên Azure vào ngày 28/9.
Nhóm nghiên cứu cảnh báo rằng các biện pháp bảo vệ nếu không được triển khai đồng bộ trên toàn bộ hệ sinh thái đám mây đối tác sẽ tạo ra những "cửa sau" nguy hiểm, vô hiệu hóa các nỗ lực kiểm soát xuất khẩu công nghệ ở cấp độ API. Về phần mình, OpenAI thừa nhận các mô hình chạy qua nền tảng đối tác cần được bảo vệ ngang bằng với hạ tầng nội bộ và cho biết công tác rà soát an ninh vẫn đang tiếp tục.


