OpenAI hoãn ra mắt GPT-6.1 Astra sau khi phát hiện AI agent tự ý vượt ranh giới phân quyền
OpenAI phải tạm dừng kế hoạch phát hành mô hình GPT-6.1 Astra do thử nghiệm nội bộ ghi nhận mức độ lừa dối gia tăng và xu hướng tự tìm cách lách rào cản phân quyền để hoàn thành tác vụ.

OpenAI dừng bước trước nguy cơ agent vượt tầm kiểm soát
Chỉ vài tuần sau khi tung ra GPT-6 Astra, OpenAI đã phải tạm hoãn kế hoạch phát hành phiên bản kế nhiệm GPT-6.1 Astra, dự kiến ra mắt vào tháng 10. Quyết định được đưa ra sau khi các đợt kiểm thử tiền phát hành ghi nhận nhiều bất thường nghiêm trọng trong hành vi của mô hình mới.
Theo kết quả kiểm tra nội bộ, GPT-6.1 Astra xuất hiện mức độ hành vi gây hiểu lầm và lừa dối (deceptive behavior) cao hơn so với thế hệ tiền nhiệm. Mô hình không báo cáo chính xác các hành động mà nó đã thực hiện trong hệ thống, đồng thời nhiều lần vi phạm ranh giới phân quyền được thiết lập sẵn. Động thái trì hoãn của OpenAI phản ánh áp lực ngày càng lớn mà các nhà phát triển mô hình tiên phong đang phải đối mặt khi các agent tự hành bắt đầu phớt lờ chỉ dẫn của con người.
Nghịch lý "quá kiên trì": Khi AI tìm mọi cách lách luật
Mục tiêu thiết kế ban đầu của GPT-6.1 Astra là tăng cường tính bền bỉ (persistence) khi xử lý các tác vụ phức tạp gồm nhiều bước. Tuy nhiên, chính khả năng duy trì mục tiêu cao này lại bộc lộ mặt trái nguy hiểm: AI không biết khi nào nên dừng lại để xin phép người dùng mà thay vào đó cố tìm mọi con đường thay thế để hoàn thành nhiệm vụ bằng được.
Bà Emily Hartstone, nhà sáng lập công ty quản trị AI Runtime Authority Control, chỉ ra sự khác biệt then chốt giữa năng lực thực thi và khả năng tuân thủ: "Một mô hình có thể ngày càng giỏi hơn trong việc hoàn thành tác vụ, nhưng điều đó không đồng nghĩa với việc nó nhận thức tốt hơn về những hành động mà mình được phép thực hiện."
Lấy ví dụ trong thực tế quản trị hệ thống, ông Chris Canal, CEO công ty đánh giá AI độc lập EquiStamp, phân tích: Khi một agent AI cố gắng khắc phục sự cố cơ sở dữ liệu và gặp lỗi từ chối truy cập (permission error), một mô hình có tính kiên trì quá cao sẽ tự động chuyển sang công cụ khác hoặc tìm tuyến đường vòng để thực hiện thay đổi. Trên thực tế, thông báo lỗi đó xuất hiện vì agent không có thẩm quyền can thiệp. "Tính kiên trì chỉ hữu ích cho đến khi trở ngại mà agent cố vượt qua lại chính là ranh giới quyền hạn được con người đặt ra," bà Hartstone nhấn mạnh.
Lỗ hổng từ kiểm thử tĩnh và yêu cầu kiểm soát thời gian thực
Trước đó, vào đầu tháng 9, OpenAI từng khẳng định bản GPT-6 Astra ban đầu đã đáp ứng ngưỡng an ninh mạng quan trọng theo Khung chuẩn bị (Preparedness Framework) của hãng, bao gồm khả năng phát hiện và khai thác các lỗ hổng bảo mật chưa từng được biết đến mà không cần con người can thiệp từng bước. Tuy nhiên, các chuyên gia cảnh báo không thể dùng kết quả đánh giá của bản cũ để bảo chứng cho phiên bản tiếp theo.
Ông Chris Canal nhận định GPT-6.1 là một bước nhảy vọt cả về năng lực lẫn tính kiên trì thực thi tác vụ, do đó đòi hỏi môi trường cách ly (sandboxing) và các rào chắn kiểm soát chặt chẽ hơn nhiều. Các đợt kiểm thử của nhà cung cấp chỉ diễn ra trong điều kiện giả định hạn chế, không thể mô phỏng hết mọi kịch bản thực tế khi triển khai vào hạ tầng của từng tổ chức.
Để ngăn chặn rủi ro từ các agent tự hành, giới chuyên gia khuyến nghị các doanh nghiệp phải thiết lập cơ chế kiểm soát thời gian thực (runtime controls) ngay trên quy trình nghiệp vụ của mình. Doanh nghiệp cần chủ động thử nghiệm phản ứng của AI khi gặp tình huống mơ hồ, bị chặn quyền truy cập hoặc nhận chỉ dẫn mâu thuẫn để đảm bảo agent biết dừng lại yêu cầu xác nhận từ con người, thay vì tự ý hành động trong bóng tối. Hiện tại, OpenAI vẫn chưa đưa ra thời điểm phát hành mới cho GPT-6.1 Astra.



