Dự án “AI Observatory” hé lộ thực trạng sử dụng AI: 48% cuộc trò chuyện bị lọc bỏ trong báo cáo của Anthropic
Nghiên cứu độc lập từ các trường đại học Mỹ phân tích hơn 24.000 cuộc hội thoại AI cho thấy các báo cáo của Anthropic và OpenAI chỉ phản ánh một phần nhỏ thực tế, với gần một nửa nội dung không liên quan đến công việc bị loại bỏ.
Khởi đầu
Vào tháng 8/2026, một nhóm nghiên cứu đa trường đại học tại Mỹ công bố kết quả của dự án “AI Observatory” – một nền tảng công khai thu thập và phân tích các cuộc hội thoại thực tế với các mô hình ngôn ngữ lớn như Claude, ChatGPT, Gemini và Grok. Dự án do Anka Reuel, tiến sĩ nghiên cứu khoa học máy tính tại Stanford Trustworthy AI Research (STAIR) Lab, đồng dẫn dắt cùng Shayne Longpre (cựu tiến sĩ MIT Media Lab) và các cộng tác viên từ MIT, Stanford và Data Provenance Initiative. Mục tiêu: cung cấp nguồn dữ liệu độc lập, minh bạch, giúp các nhà nghiên cứu và nhà hoạch định chính sách đánh giá đúng mức cách người dùng thực sự tương tác với AI.
Chi tiết cụ thể
AI Observatory tổng hợp 24.521 cuộc hội thoại, tương đương 85.633 lượt trao đổi (mỗi lượt gồm câu hỏi người dùng và phản hồi của AI), thu thập từ bảy bộ dữ liệu công khai đã được người dùng đồng ý cung cấp. Những cuộc trò chuyện này đến từ khoảng 5.000 người dùng, trải rộng trên 52 mô hình AI khác nhau, trong khoảng thời gian 2023‑2025.
Khi áp dụng cùng một phương pháp lọc dữ liệu như “Anthropic Economic Index” – chỉ tập trung vào các tương tác liên quan đến công việc và năng suất – nhóm nghiên cứu phát hiện 48 % (gần một nửa) các cuộc hội thoại sẽ bị loại bỏ. Những nội dung bị lọc ra không chỉ là những cuộc trò chuyện “vui vẻ” mà còn chứa các chủ đề nhạy cảm:
- Sức khỏe và các mối quan hệ: 44,2 % (so với 31,2 % trong báo cáo của Anthropic).
- Chủ đề người lớn hoặc bất hợp pháp: 7,9 % (so với 2,1 %).
- Quấy rối và ngôn từ thù địch: 27,5 % (so với 5,66 %).
- Nội dung tình dục: 16,7 % (so với 2,4 %).
Đối chiếu với báo cáo năm 2025 của OpenAI về ChatGPT, chỉ 30 % mức tiêu dùng của người dùng cuối liên quan đến công việc, cho thấy xu hướng sử dụng cá nhân rộng rãi hơn so với những gì các công ty muốn công bố.
Các bộ dữ liệu chi tiết hơn, như “WildChat” – một trong những nguồn dữ liệu phong phú nhất của AI Observatory – cho thấy các cuộc hội thoại ngày càng dài hơn và phong phú hơn theo thời gian: số token đầu vào, số token phản hồi và số vòng trao đổi đều tăng lên. Đặc biệt, tần suất “small talk” (nói chuyện phi công việc) tăng đáng kể, chỉ ra sự gia tăng của vai trò “bạn đồng hành” của AI. Ngược lại, mức độ tự công khai của AI (ví dụ: bot tự nhận mình là chatbot) giảm, đồng thời các trường hợp được đánh dấu là “sử dụng nhạy cảm” (như quấy rối, ngôn từ thù địch) giảm, gợi ý các nền tảng đang áp dụng các biện pháp bảo vệ hiệu quả hơn.
Về mặt mô hình, AI Observatory phát hiện sự khác biệt rõ rệt:
- Grok và Gemini được sử dụng nhiều cho việc truy xuất thông tin; Grok đặc biệt phổ biến trong các câu hỏi về tin tức và chính trị, nhưng cũng là “điểm nóng” của tin giả.
- Anthropic (Claude) thường được dùng cho lập trình;
- Gemini lại nổi bật trong các hoạt động xã hội và nhập vai;
- ChatGPT được người dùng lựa chọn chủ yếu để hỗ trợ làm bài tập.
Thậm chí, trong cùng một mô hình, cách dùng cũng thay đổi theo phiên bản: người dùng có các cuộc hội thoại ngắn hơn với ChatGPT dựa trên GPT‑3.5, trong khi phiên bản GPT‑4o tạo ra các cuộc trò chuyện dài, lặp lại và “gây nghiện cảm xúc” hơn.
Các báo cáo của các công ty AI hiện nay không phản ánh đầy đủ những đa dạng này. “Không có một báo cáo công ty nào có thể kể hết câu chuyện,” Shayne Longpre nhấn mạnh. So sánh với quy mô dữ liệu mà các hãng công bố – 1 triệu cuộc trò chuyện Claude trong Anthropic Economic AI Index và 1,5 triệu cuộc trò chuyện ChatGPT trong báo cáo OpenAI – thì bộ dữ liệu 24.521 cuộc hội thoại của AI Observatory chỉ là một “giọt trong bể” nhưng lại là nguồn dữ liệu độc lập duy nhất hiện có.
Một đại diện của Anthropic cho biết các báo cáo của họ chỉ phản ánh các câu hỏi nghiên cứu nội bộ và họ luôn ủng hộ việc nghiên cứu độc lập. OpenAI không phản hồi yêu cầu bình luận. Nhóm AI Observatory cũng lưu ý rằng vì dữ liệu được thu thập từ những nguồn tự nguyện, có khả năng các trường hợp nhạy cảm chưa được phản ánh đầy đủ. Tuy nhiên, việc công khai dữ liệu này sẽ mở rộng khả năng nghiên cứu cho cộng đồng và tạo tiền đề cho các công ty AI chia sẻ dữ liệu một cách bảo mật hơn trong tương lai.
Bối cảnh và so sánh
Trong bối cảnh các công ty AI ngày càng chiếm vị thế quan trọng trong nền kinh tế và đời sống, việc hiểu rõ cách người dùng thực sự tương tác với các mô hình ngôn ngữ lớn trở nên cấp bách. Các chỉ số như “Anthropic Economic Index” hay báo cáo sử dụng của OpenAI thường chỉ tập trung vào khía cạnh công việc và năng suất, bỏ qua phần lớn các nhu cầu cá nhân, giải trí và thậm chí là các hành vi vi phạm quy tắc.
AI Observatory cung cấp một góc nhìn toàn diện hơn, cho thấy AI không chỉ là công cụ làm việc mà còn là “bạn đồng hành”, “cố vấn sức khỏe”, “đối tác trò chuyện” và thậm chí là “kênh truyền tin giả”. Những phát hiện này đặt ra câu hỏi về cách các nhà quản lý và nhà hoạch định chính sách đánh giá lợi ích và rủi ro của AI dựa trên dữ liệu hạn chế.
Nếu các hãng AI như Anthropic và OpenAI có thể mở rộng việc chia sẻ dữ liệu (đảm bảo quyền riêng tư), cộng đồng nghiên cứu sẽ có thể xây dựng các khung pháp lý và tiêu chuẩn bảo vệ người dùng tốt hơn. AI Observatory đã khởi động một bước tiến quan trọng trong việc lấp đầy khoảng trống dữ liệu độc lập, và hy vọng sẽ thu hút thêm nhiều nguồn dữ liệu, tạo nền tảng cho các nghiên cứu sâu hơn trong tương lai.
