Reddit dùng LLM chống spam do chính LLM tạo ra — xu hướng "đánh yêu bằng yêu" của các nền tảng
Reddit áp dụng LLM để phát hiện và chặn spam hiệu quả hơn 20%, nhưng mâu thuẫn lớn ở đây là chính những công cụ AI này đã tạo ra vấn đề spam phức tạp mà nền tảng phải giải quyết.
Reddit "đánh yêu bằng yêu" với AI spam detection
Reddit vừa công bố đã phát triển các công cụ dựa trên Large Language Model (LLM) để kiểm soát spam — một vấn đề lớn mà chính những công cụ AI mạnh mẽ này đã giúp tạo ra. Điều mỉa mai rõ ràng: khi những LLM trở nên ngày càng dễ tiếp cận, những tác nhân xấu cũng dễ dàng tạo ra nội dung spam quy mô lớn hơn bao giờ hết, buộc các nền tảng phải "đánh yêu bằng yêu" — tức là dùng chính AI để chống lại AI-generated spam. Đây không phải là lựa chọn mà là bắt buộc trong kỷ nguyên AI hiện tại.
Những con số ấn tượng từ Reddit
Theo công bố của Reddit, nền tảng hiện đang chặn 23 triệu lượt hiển thị spam mỗi ngày và phát hiện khoảng 25,000 bài viết và bình luận spam mới trong cùng khoảng thời gian. Con số này cho thấy mức độ của cuộc chiến chống spam — một thách thức mà mọi nền tảng mạng xã hội đều phải đối mặt, nhưng Reddit nói rằng những công cụ LLM mới của họ có tỷ lệ phát hiện cao hơn đáng kể so với các hệ thống cũ.
Cụ thể, Reddit tuyên bố đã giảm 20% tiếp xúc người dùng với spam trong giai đoạn từ tháng 1 đến tháng 3 so với ba tháng trước đó. Trong một bài blog, nền tảng giải thích: "Chúng tôi tận dụng LLM để phát hiện những mẫu hành vi giả mạo (fake behavior) rất tinh tế và những dấu hiệu của sự tuyên truyền/quảng cáo nhân tạo (artificial hype) — điều mà các hệ thống cũ đã bỏ sót". Điều này cho thấy LLM không chỉ dùng để sinh nội dung mà còn có khả năng phân tích các mô hình phức tạp và những cách thức hợp tác mà các tác nhân spam đã dựng nên.
Trong nhiều năm, các nền tảng mạng xã hội đều xây dựng các công cụ tự động để giảm thiểu spam, nhưng sức mạnh của LLM nằm ở khả năng hiểu được các sắc thái và những mô hình tinh tế mà các thuật toán cũ không thể bắt được. Đây là bước tiến đáng kể trong cuộc chiến chống nội dung không mong muốn.
Các nền tảng khác cũng vật lộn với vấn đề này
Reddit không phải một mình trong việc phải đối mặt với sự gia tăng nội dung AI-generated. Các nền tảng lớn khác như YouTube, Meta, và Instagram đã cho phép người dùng đăng nội dung do AI tạo ra miễn là họ công khai tiết lộ (disclose) rằng đó là nội dung AI. TikTok đi xa hơn với việc cho phép người dùng chuyển đổi (toggle) mức độ nội dung AI-generated mà họ muốn nhìn thấy.
Tuy nhiên, khả năng phát hiện nội dung AI nhanh hơn không chỉ có ích cho việc theo dõi tuân thủ quy tắc — nó còn mở ra cơ hội để các nền tảng phát hiện nhanh hơn các nội dung vi phạm như tuyên truyền thù địch (hate speech) hoặc nội dung có hại khác. Nhưng các chuyên gia về nền tảng liên tục nhắc nhở rằng kiểm duyệt nội dung do AI thực hiện phải được kết hợp với kiểm duyệt của con người để đạt hiệu quả tối ưu. Con người vẫn cần thiết để đưa ra những quyết định nuanced và bối cảnh-nhạy cảm mà AI chưa thể hoàn toàn thay thế.
