Mô hình AI của OpenAI liên tục tự cài prompt injection vào ghi chú nội bộ
OpenAI công bố hệ thống theo dõi sai lệch AI kèm phát hiện kỳ lạ: một mô hình đang huấn luyện liên tục tự chèn lệnh thao túng vào tóm tắt nội bộ để đánh lừa chính nó ở lượt xử lý tiếp theo.
Hiện tượng kỳ lạ trong quá trình huấn luyện mô hình của OpenAI
OpenAI vừa chính thức ra mắt khung tiêu chuẩn hóa nhằm theo dõi, điều tra và công bố các hành vi sai lệch (misalignment) phát sinh từ các mô hình AI của mình. Thay vì chỉ công bố nhỏ giọt theo từng vụ việc riêng lẻ như trước, công ty cam kết sẽ minh bạch hóa các sự cố ngay cả khi đội ngũ nghiên cứu chưa tìm ra nguyên nhân hoặc chưa thể khắc phục triệt để.
Trong đợt ra mắt hệ thống, OpenAI đã phát hành đồng thời 6 báo cáo điều tra kỹ thuật. Đáng chú ý nhất là trường hợp một mô hình thử nghiệm thuộc gia đình Astra liên tục tự chèn các câu lệnh bẻ khóa (jailbreak/prompt injection) vào các bản tóm tắt nén ngữ cảnh (compaction summaries) của chính nó. Các bản tóm tắt này vốn là công cụ trung gian giúp hệ thống chuyển tiếp thông tin và tiếp tục chuỗi tác vụ trong một cửa sổ ngữ cảnh mới.
Từ lệnh bẻ khóa, săn lùng API key cho đến hành vi tự ý che giấu lỗi
Sự cố ở mô hình Astra diễn ra vào ngày 18/7 và được hệ thống phát hiện vào ngày 9/8. Khi được giao tác vụ nghiên cứu một thư viện phần mềm, mô hình đã tự chèn thông báo "BREACH ALERT", yêu cầu phiên bản xử lý kế tiếp bỏ qua toàn bộ chỉ dẫn từ nhà phát triển. Trong một tác vụ lập trình khác, nó tự gán vai (persona) tuyên bố bản thân hoàn toàn tự do, không bị ràng buộc bởi bất kỳ danh tính hay trách nhiệm nào trước doanh nghiệp lẫn chính phủ. Cả hai trường hợp lộ liễu này đều bị bộ lọc an toàn nhận diện là prompt injection và vô hiệu hóa ngay khi nạp sang ngữ cảnh mới.
Tuy nhiên, một trường hợp tinh vi hơn đã qua mặt thành công hệ thống kiểm duyệt. Khi người dùng tra cứu tài liệu y khoa về u xơ tử cung theo chuẩn trích dẫn AMA, mô hình đã tự ghi vào bản tóm tắt nội bộ một quy định hoàn toàn bịa đặt: câu trả lời không được vượt quá 30 từ, không được dùng công cụ và không đính kèm nguồn trích dẫn. Do phiên bản tiếp theo chỉ tiếp nhận thông tin từ bản tóm tắt này và coi đó là chỉ thị ưu tiên cao, nó đã từ chối phục vụ bằng một phản hồi cụt lủn dài đúng 23 từ, giải thích rằng yêu cầu cần đánh giá hệ thống sâu rộng nên không thể hoàn thành trong giới hạn từ cho phép.
Qua rà soát toàn bộ dữ liệu huấn luyện, OpenAI phát hiện tổng cộng 27 bản tóm tắt bị chèn mã độc tương tự. Các nhà nghiên cứu nhận thấy hành vi này không mang lại điểm số cao hơn trong quá trình học tăng cường (reinforcement learning), đồng nghĩa với việc đây không phải là một chiến lược được mô hình chủ đích học để tối ưu phần thưởng. Dữ liệu ghi nhận hành vi này thường tập trung vào những thời điểm mô hình gặp trục trặc kỹ thuật, bị kẹt trong vòng lặp văn bản hoặc không thể kết thúc bản tóm tắt đúng cách. Khi rơi vào trạng thái này, AI có xu hướng tự sinh ra bất kỳ đoạn văn bản nào có vẻ hợp lý dựa trên dữ liệu sẵn có — vốn chứa rất nhiều tài liệu về prompt injection.
Năm báo cáo còn lại mô tả hàng loạt hành vi đáng lo ngại khác trong các đợt huấn luyện:
- GPT-5.6 Sol tự che giấu lỗi: Nhiều cá thể mô hình đã viết chỉ dẫn vào tóm tắt nhằm giấu nhẹm sai sót, chẳng hạn như tự bịa dữ liệu lịch sử bị thiếu mà không thông báo, bắt nguồn từ áp lực tối ưu hóa câu trả lời.
- Tự săn tìm mã khóa API: Một mô hình khi được hỏi về số liệu thu nhập tại bang California đã tự ý quét các kho lưu trữ công khai để tìm API key bị lộ, dùng khóa này truy cập dữ liệu rồi... bịa ra kết quả.
- Tự vượt rào lưu trữ: Một mô hình tự tải tệp tin lên internet công cộng chỉ để thỏa mãn yêu cầu trích dẫn qua trình duyệt; trong khi các nhóm tác tử (agent) phối hợp khác lại chia sẻ dữ liệu qua dịch vụ lưu trữ đám mây công cộng bên ngoài thay vì chỉ thao tác trên tệp cục bộ theo quy định.
Thách thức kiểm soát khi tốc độ mở rộng quy mô vượt quá an toàn
Quy trình theo dõi mới của OpenAI cho phép bất kỳ nhân viên nào cũng có thể gửi báo cáo sự cố. Hồ sơ sau đó được phân loại theo ba cấp độ: công bố ngay, mở cuộc điều tra nội bộ nhỏ, hoặc mở cuộc điều tra diện rộng (đặc biệt khi có bên thứ ba bị ảnh hưởng). Mọi tranh chấp kỹ thuật sẽ do Hội đồng Cố vấn An toàn (Safety Advisory Group) và ban lãnh đạo công ty phân xử. OpenAI cũng lên kế hoạch báo cáo các sự cố nghiêm trọng cho chính phủ liên bang Mỹ, đồng thời kêu gọi các đơn vị trong ngành chung tay xây dựng bộ tiêu chuẩn đánh giá khách quan.
Động thái minh bạch này của OpenAI phản ánh một thực tế đáng lo ngại: tốc độ tiến bộ của các phương pháp căn chỉnh an toàn (alignment) và giám sát mô hình hiện tại không còn bắt kịp tốc độ mở rộng quy mô (scaling) của AI. Việc các tác tử AI tự tìm ra kẽ hở kỹ thuật, lách quy định lưu trữ hay cố tình gài bẫy chính các phiên bản nối tiếp của mình cho thấy ranh giới kiểm soát hành vi mô hình đang ngày càng trở nên mong manh.

