OpenAI bị phanh phui việc thuê hàng trăm nhân sự đọc trộm hội thoại ChatGPT của người dùng
Cuộc điều tra của 404 Media cho thấy OpenAI thuê hàng trăm cộng tác viên chấm điểm và đọc các đoạn chat thực tế của người dùng nhằm huấn luyện mô hình, bất chấp nhiều đoạn chat chứa thông tin nhạy cảm.

Hàng trăm cộng tác viên rà soát hội thoại thực tế của ChatGPT
Theo cuộc điều tra độc quyền từ chuyên trang công nghệ 404 Media dựa trên tài liệu nội bộ rò rỉ và các nguồn tin giấu tên, OpenAI đang thuê hàng trăm nhân sự hợp đồng (contract workers) để trực tiếp đọc các cuộc trò chuyện thực tế giữa người dùng và ChatGPT. Mục đích chính của hoạt động này là đánh giá và cải thiện chất lượng phản hồi của chatbot.
Đáng chú ý, nhiều người dùng dường như hoàn toàn không hay biết việc nội dung trò chuyện của mình đang được người thật đọc. Một nhân viên đánh giá chia sẻ với 404 Media rằng trong số các dữ liệu gửi đến, có những đoạn chat người dùng thậm chí đã yêu cầu ChatGPT phải giữ bí mật tuyệt đối nội dung được cung cấp. Dù OpenAI khẳng định có áp dụng các bộ lọc làm sạch để ẩn danh dữ liệu cá nhân, hãng vẫn thừa nhận hệ thống này đôi khi mắc sai sót, khiến thông tin nhạy cảm vẫn có thể lọt vào mắt nhân viên kiểm duyệt.
Thù lao hơn 50 USD/giờ và nhiệm vụ hạn chế AI "nịnh bợ"
Các nhân viên đánh giá được giao nhiệm vụ chấm điểm câu trả lời của ChatGPT theo thang từ 1 đến 7. Một trong những trọng tâm quan trọng của công việc là hạn chế thái độ xu nịnh quá mức (excessive flattery) cũng như các hành vi cố tình mô phỏng cảm xúc con người một cách thiếu tự nhiên trong phản hồi của mô hình.
Về quy trình tuyển dụng, mạng lưới nhân sự này được chiêu mộ thông qua nền tảng Crossing Hurdles và nhận chi trả thù lao qua công ty đào tạo AI Mercor. Một nhân sự làm việc tại khu vực Bắc Mỹ tiết lộ họ nhận mức lương hơn 50 USD mỗi giờ cho công việc đọc và chấm điểm dữ liệu này.
Điểm gây tranh cãi lớn nằm ở tính minh bạch của OpenAI. Hãng không đưa ra cảnh báo rõ ràng khi người dùng sử dụng dịch vụ mà chỉ nhắc thoáng qua trong một trang Câu hỏi thường gặp (FAQ) đã tồn tại từ năm 2023. Trong đó, OpenAI giải thích rằng các nhân sự được ủy quyền có thể xem dữ liệu để cải thiện hiệu suất mô hình và khuyến cáo người dùng không nên nhập thông tin nhạy cảm. Giới chuyên môn đánh giá việc OpenAI đặt cài đặt mặc định là "Cải thiện mô hình cho mọi người" (Improve the model for everyone) mang tính chất đóng góp cộng đồng hơn là một văn bản đồng thuận để người lạ đọc nội dung riêng tư.
Thông lệ chung của ngành AI và cách người dùng tự bảo vệ
Việc đưa con người vào vòng lặp phản hồi (human feedback) vốn là khâu kỹ thuật quan trọng để tinh chỉnh các mô hình ngôn ngữ lớn, và OpenAI không phải cái tên duy nhất áp dụng phương thức này. Trả lời 404 Media, Anthropic xác nhận cũng sử dụng nhân sự đánh giá để kiểm tra phản hồi của Claude đối với các tài khoản bật tính năng cho phép cải thiện mô hình, sau khi đã lọc bỏ các thông tin nhận dạng như địa chỉ email. Tương tự, Google cũng thông báo rõ trong điều khoản của Gemini rằng các đoạn chat được lưu trữ có thể được người thật xem xét.
Đối với người dùng ChatGPT, cách duy nhất để ngăn dữ liệu cá nhân bị gửi đến các cộng tác viên đào tạo là chủ động tắt tùy chọn "Improve the model for everyone" trong phần cài đặt dữ liệu. Tuy nhiên, thay đổi này chỉ có hiệu lực với các cuộc trò chuyện mới phát sinh sau đó. Ngoài ra, người dùng có thể lựa chọn tính năng trò chuyện tạm thời (Temporary Chat) để đảm bảo nội dung không bị lưu trữ hay sử dụng để huấn luyện mô hình.
