AI RACE— Cuộc đua AI
Doanh nghiệp

Guardrails AI đang vô tình cản trở các nhà bảo mật hợp pháp—và thúc đẩy họ chuyển sang mô hình Trung Quốc

Các biện pháp an toàn chặt chẽ của Anthropic và OpenAI nhằm ngăn hacker lạm dụng AI đang làm khó khăn cho những chuyên gia bảo mật offensive đang làm công việc phòng thủ hợp pháp, buộc họ chuyển sang mô hình mã nguồn mở không bị giới hạn.

08:00 24/07/2026
Doanh nghiệp

Guardrails AI chặn cả bên tốt lẫn bên xấu

Các hãng AI khổng lồ đã dành tháng trời thiết kế các guardrails (hàng rào an toàn) để ngăn chặn lạm dụng. Tuy nhiên, những biện pháp này bây giờ lại cản trở công việc của các nhà phòng thủ mạng hợp pháp—những người chính là tuyến đầu chống các cuộc tấn công. Vào tháng 6 năm 2026, chính phủ Mỹ đã áp đặt hạn chế xuất khẩu trên các mô hình Mythos và Fable của Anthropic, động thái được kích hoạt bởi những báo cáo về khả năng vượt qua guardrails. Anthropic từng quảng cáo Mythos như một "doomsday cybermachine" chỉ cho phép truy cập qua chương trình được kiểm duyệt chặt chẽ. Những hạn chế này sau đó đã được dỡ bỏ: Fable 5 quay trở lại truy cập công khai từ ngày 1 tháng 7, trong khi Mythos 5 được mở lại cho các tổ chức Mỹ được xác minh thông qua quy trình xem xét của chính phủ.

Khi AI từ chối hợp tác với bên phòng thủ

Cả Anthropic (với Cyber Verification Program) và OpenAI (với Trusted Access for Cyber) đều cung cấp các chương trình cho phép nhà nghiên cứu an ninh mạng đăng ký được kiểm duyệt. Tuy nhiên, những giới hạn này đang bị các chuyên gia chỉ trích vì chúng cản trở công việc của những người tìm kiếm lỗ hổng chưa biết đến. Mark Dowd, một nhà nghiên cứu bảo mật nổi tiếng, phát biểu trên một podcast an ninh mạng rằng: "Tôi không thấy thoải mái khi những công ty lớn này đưa ra những quyết định tùy ý về những gì an toàn trong bảo mật". Dowd đã dành nhiều thập kỷ tìm và bán zero-days cho các chính phủ phương Tây, thay vì báo cáo để chúng được vá. Chris Anley, Giám đốc Khoa học tại NCC Group, giải thích rằng yêu cầu mô hình AI thử khai thác một lỗi là bước quan trọng để xác nhận nó là lỗ hổng thực sự. Nhưng khi guardrail khiến mô hình từ chối: "Đây là nơi vấn đề 'tấn công vs. phòng thủ' xuất hiện. 'Sửa code này' vừa là cơ chế phòng thủ thiết yếu vừa là bản đồ tìm lỗ hổng—nó giống như cái búa: không thể xây nhà mà không búa, nhưng búa cũng vốn dĩ là vũ khí". Paolo Stagno, CTO tại CrowdFense (công ty nổi tiếng bán zero-days cho các cơ quan chính phủ), nói rằng AI companies "cơ bản là đối xử khách hàng như trẻ em cần trông coi". Stagno và đồng nghiệp chỉ dùng mô hình tiên tiến cho reverse engineering, tránh sử dụng AI để tìm lỗ hổng vì sợ rò rỉ dữ liệu nhạy cảm vào đám mây. Thay vào đó, họ sử dụng mô hình mã nguồn mở chạy cục bộ. Giuseppe Cali, nhà nghiên cứu zero-day, cho biết guardrails không cản trở anh vì anh chỉ dùng AI cho công việc reverse engineering ban đầu: "Tôi vẫn muốn tự mình phát hiện và khai thác lỗi, và điều đó sẽ không thay đổi ngay cả khi tất cả guardrails dỡ bỏ".

Nghịch lý: Guardrails thúc đẩy chuyển sang công nghệ Trung Quốc

Chris Thompson, CEO của RemoteThreat và người sáng lập Offensive AI Con, cho biết guardrails của các mô hình tiên tiến có thể không nhất quán, hoạt động khác nhau mỗi ngày ngay cả trong các chương trình được kiểm duyệt. "Bạn dành rất nhiều thời gian thương lượng với mô hình thay vì làm việc trên chương trình bảo mật cốt lõi", Thompson nói. Thay vì phân tích lỗ hổng, các nhà nghiên cứu phải giải quyết kết quả không nhất quán hoặc dữ liệu bị "siêu vệ sinh". Kết quả là, theo Thompson, những nhà nghiên cứu hợp pháp đang bị đẩy chuyển sang các mô hình mã nguồn mở của Trung Quốc như GLM—những mô hình có thể tải xuống miễn phí, chạy cục bộ mà không giới hạn. "Bạn có những nhà nghiên cứu có trách nhiệm bị đẩy xa khỏi các hệ thống do Mỹ quản lý sang các hệ thống do nước ngoài sở hữu", anh cảnh báo. "Tôi nghĩ nó có hại hơn là có lợi nếu có những guardrails này".

Cuộc đua bảo mật có nguy cơ bị thua

Thompson kêu gọi các phòng thí nghiệm AI tiên tiến mở rộng chương trình, cung cấp quyền truy cập có trách nhiệm và chịu trách nhiệm với những lạm dụng. Nếu không, các nhà phòng thủ sẽ thua cuộc đua AI. "Một cơn bão lớn đang tới. Sẽ có một làn sóng tấn công xảy ra với tốc độ và quy mô chưa từng có", anh cảnh báo. "Nhưng những công ty tư vấn an ninh mạng và nhà nghiên cứu hợp pháp đang cố tạo ra sự khác biệt lại bị cản trở ngay bây giờ". Vấn đề cốt lõi là: guardrails quá chặt chẽ có đang vô tình giúp kẻ xấu nhiều hơn giúp người tốt? Khi bảo mật hợp pháp bị cản trở bởi giới hạn quá nghiêm ngặt, trong khi hacker xấu sử dụng mô hình mã nguồn mở không bị hạn chế, hiệu quả thực sự của chiến lược này trở nên đáng nghi vấn.

◗ Nguồn

TechCrunch24-07

Tin liên quan