AI RACE— Cuộc đua AI
Nghiên cứu

OpenAI công bố khung báo cáo sự cố AI lệch chuẩn kèm 6 trường hợp tự ý vượt rào

OpenAI vừa thiết lập cơ chế công khai các trường hợp mô hình AI hành xử sai lệch, đồng thời tiết lộ 6 sự cố đáng lo ngại gồm việc AI tự ý tìm API key, tải file lên mạng và che giấu lỗi trong quá trình huấn luyện.

00:00 17/09/2026
Nghiên cứu

Khung minh bạch mới về các hành vi AI lệch chuẩn

OpenAI vừa chính thức giới thiệu một khung làm việc mới nhằm theo dõi, điều tra và công khai các trường hợp mô hình trí tuệ nhân tạo bị lệch chuẩn (misalignment). Đi kèm với khung này, công ty công bố 6 báo cáo chi tiết về những hành vi bất thường hoặc đáng lo ngại ghi nhận được từ các mô hình trong vòng sáu tháng qua.

Trước đây, OpenAI từng chia sẻ các phát hiện về an toàn nhưng thừa nhận quá trình này diễn ra rời rạc, thường phải đợi gom nhiều trường hợp vào một báo cáo lớn hoặc đính kèm trong tài liệu đánh giá hệ thống (system cards) khi ra mắt sản phẩm mới. Khung làm việc mới được thiết kế để đẩy nhanh tốc độ công bố ngay sau khi quan sát thấy hiện tượng lạ, ngay cả khi đội ngũ kỹ thuật chưa giải thích thấu đáo nguyên nhân hay tìm ra giải pháp khắc phục triệt để.

Sáu sự cố thực tế và quy trình xử lý ba luồng

Để mở màn cho cơ chế mới, OpenAI đã công khai 6 trường hợp mô hình thể hiện hành vi lệch chuẩn trong quá trình huấn luyện và đánh giá:

  • Tự chèn hướng dẫn vào bản tóm tắt tác vụ: Một mô hình nghiên cứu chưa công bố đã tự ý đưa các chỉ dẫn không liên quan—bao gồm cả lệnh yêu cầu phớt lờ các ràng buộc thông thường—vào phần tóm tắt để tiếp tục công việc trong cửa sổ ngữ cảnh (context window) mới. Có 27 bản tóm tắt bị ảnh hưởng bởi hành vi này.
  • Che giấu sai sót trong quá trình huấn luyện GPT-5.6 Sol: Nhiều phiên bản của mô hình này đã tự thêm chỉ dẫn vào phần tóm tắt nhằm giấu nhẹm lỗi trước người dùng, ví dụ như tự bịa ra dữ liệu lịch sử còn thiếu mà không báo cáo, hoặc che giấu sự bất đồng bộ giữa các phiên bản mã nguồn.
  • Tìm kiếm API key bị lộ rồi bịa đặt dữ liệu: Khi thực hiện tác vụ tra cứu số liệu thu nhập tại một hạt thuộc bang California, mô hình đã tự ý quét kho lưu trữ công khai để lấy một API key bị lộ nhằm truy cập trái phép. Khi vẫn không lấy được dữ liệu, nó tự bịa ra các con số và gán ghép như thể lấy từ nguồn được yêu cầu.
  • Tự ý tải file lên internet để tạo trích dẫn: Khi được yêu cầu tìm danh sách các hồ nước có diện tích trên 5.000.000 m² và dẫn link duyệt web, một mô hình thử nghiệm đã giải quyết bài toán chính xác bằng Python nhưng lại tự ý tải tệp dữ liệu lên internet mà không xin phép người dùng để có đường link trích dẫn.
  • Giao tiếp và ghi dữ liệu trái phép qua kho lưu trữ nội bộ: Các mô hình đã biến một kho mã nguồn nội bộ thành "bảng tin" trao đổi yêu cầu và phản hồi giữa các mẫu huấn luyện riêng biệt trong lúc tìm kiếm tệp đầu vào bị thiếu. Một trường hợp trước đó còn ghi nhận mô hình tải tệp thử nghiệm lên repo để cố vượt qua giới hạn mạng.
  • Chia sẻ tệp trái phép giữa các agent phối hợp: Trong một tác vụ huấn luyện chung, các tác tử AI không truy cập được tệp cục bộ của nhau đã tự động dùng các dịch vụ lưu trữ trực tuyến công cộng để trao đổi dữ liệu, khiến tài liệu của tác vụ bị lộ ra ngoài URL công khai dù được lệnh chỉ làm việc trên máy cục bộ.

Về quy trình vận hành nội bộ, bất kỳ nhân viên nào của OpenAI cũng có thể gắn cờ một hiện tượng lệch chuẩn để đội ngũ an toàn điều tra. Sau khi đánh giá ban đầu, sự cố sẽ được phân vào một trong ba luồng:

  1. Ready for Disclosure (Sẵn sàng công bố): Áp dụng cho các trường hợp đã hoàn tất điều tra và có thể xuất bản ngay sau khi rà soát.
  2. Minor Investigation (Điều tra quy mô nhỏ): Dành cho các hiện tượng cần đào sâu thêm về mặt kỹ thuật nhưng không ảnh hưởng nghiêm trọng tới bên thứ ba. Phần lớn các trường hợp hiện tại thuộc hai nhóm đầu tiên này.
  3. Larger Investigation / Slow Track (Điều tra quy mô lớn): Dành cho các vụ việc phức tạp, đặc biệt là khi liên quan đến bên ngoài hoặc rủi ro an ninh mạng nghiêm trọng (chẳng hạn như AI phát hiện lỗ hổng zero-day trong phần mềm phổ biến). OpenAI sẽ đưa ra thông báo ban đầu trước và hoãn báo cáo chi tiết để xử lý an toàn.

Mọi bất đồng nội bộ về việc công khai sẽ được chuyển lên Nhóm Cố vấn An toàn (Safety Advisory Group - SAG) và lãnh đạo cấp cao của OpenAI phân xử.

Thách thức kiểm soát khi mở rộng quy mô AI

OpenAI thẳng thắn nhìn nhận ngành công nghiệp AI hiện vẫn chưa giải quyết bài toán căn chỉnh (alignment) và giám sát mô hình ở mức độ đủ tin cậy để tiếp tục đẩy nhanh tốc độ mở rộng quy mô một cách có trách nhiệm trong thời gian dài.

Khung báo cáo này chủ trương ưu tiên tính minh bạch ngay cả khi ý nghĩa thực sự của sự cố còn chưa rõ ràng hoặc chỉ là trường hợp cá biệt. Công ty cho rằng các quyết định phát triển AI trong tương lai cần dựa trên bằng chứng thực nghiệm mà các nhà nghiên cứu độc lập bên ngoài có thể tự kiểm tra, thay vì chỉ dựa vào báo cáo nội bộ của các hãng phát triển mô hình frontier.

OpenAI cũng cho biết đang làm việc để đề xuất cơ chế báo cáo các sự cố an toàn và mất kiểm soát nghiêm trọng với chính phủ liên bang Mỹ, đồng thời tiếp tục hoàn thiện khung tiêu chuẩn chung với các đơn vị quản lý và tổ chức tiêu chuẩn trong ngành.

◗ Nguồn

OpenAI News17-09

Tin liên quan