Một phần ba các trang web mới xuất bản có dấu hiệu do AI viết, nghiên cứu Pew tiết lộ
Nghiên cứu mới của Pew Research cho thấy hơn 35 % các trang web được đăng sau khi ChatGPT ra mắt có dấu hiệu được tạo hoặc chỉnh sửa bởi AI.
Sự kiện chính: AI chiếm hơn một phần ba các trang web mới
Vào thứ Năm, 20 / 8 / 2026, Pew Research công bố một báo cáo mới cho thấy hơn một phần ba (khoảng 35 %) các trang web được xuất bản sau khi ChatGPT ra mắt vào tháng 11 / 2022 có dấu hiệu được viết hoặc chỉnh sửa bởi trí tuệ nhân tạo. Báo cáo này không chỉ khẳng định xu hướng gia tăng nội dung do AI tạo ra trên internet mà còn đưa ra những con số chi tiết về mức độ lan truyền theo từng loại miền (domain).
Chi tiết số liệu và phương pháp nghiên cứu
Pew Research đã khai thác kho lưu trữ Common Crawl — một bộ dữ liệu công khai chứa hàng trăm terabyte các trang web được thu thập liên tục. Từ đây, nhóm nghiên cứu thu thập gần nửa triệu trang web tiếng Anh, bao phủ khoảng năm năm qua, bắt đầu từ khoảng hai năm trước khi ChatGPT được ra mắt (tháng 11 / 2022). Để xác định mức độ can thiệp của AI, Pew sử dụng công nghệ Open Pangram, một công cụ phát hiện nội dung được tạo hoặc chỉnh sửa mạnh mẽ bằng AI.
Trong một mẫu ngẫu nhiên gồm 10 000 trang web được thu thập vào tháng 7 / 2026, khoảng 10 % cho thấy các dấu hiệu “AI mạnh” — tức là nội dung có khả năng cao được viết hoặc được chỉnh sửa sâu bởi AI. Pew lưu ý rằng mẫu này vẫn bao gồm những trang cũ, được xuất bản trước khi các công cụ viết AI xuất hiện, do đó tỉ lệ thực tế cho các trang mới sẽ cao hơn.
Sau khi loại bỏ các trang cũ, Pew tập trung vào những trang xuất bản sau ngày ra mắt của ChatGPT. Kết quả cho thấy 35 % các trang này mang dấu hiệu AI, tức là hơn ba trang trong mười có thể được tạo hoặc chỉnh sửa bởi một mô hình ngôn ngữ như ChatGPT, Gemini, Claude, v.v.
Báo cáo cũng đi sâu vào phân tích theo miền (domain):
- Các trang có đuôi .com hiển thị dấu hiệu AI khoảng 10 lần so với các miền .edu hoặc .gov, trong khi .edu và .gov chỉ đạt khoảng 1 %.
- .org có tỉ lệ AI thấp hơn, chỉ khoảng 4,6 %.
- Các miền .edu và .gov, thường liên quan đến giáo dục và chính phủ, vẫn duy trì mức độ con người chi phối nội dung cao hơn đáng kể.
Ngoài việc dựa vào công cụ phát hiện, Pew còn ghi nhận sự gia tăng các “điểm nhận dạng” khác của AI qua thời gian, chẳng hạn như:
- Sử dụng dấu gạch ngang dài (em dash) – thường xuất hiện trong văn bản do AI tạo ra để tăng tính mạch lạc.
- Dấu phẩy Oxford – một phong cách ngữ pháp mà AI thường áp dụng một cách nhất quán.
- Cấu trúc câu “It’s not X, it’s Y” – một mẫu câu phổ biến trong các bài viết AI.
Pew nhấn mạnh rằng, dù công cụ như Open Pangram có thể đánh giá sai (gọi nhầm nội dung do con người viết là AI), nhưng ở quy mô lớn, xu hướng phát hiện được cho thấy đúng hướng và phản ánh thực tế tăng trưởng nội dung AI trên mạng.
Báo cáo của Pew cũng xuất hiện ngay sau khi Cloudflare công bố rằng lưu lượng truy cập từ bot đã vượt qua lưu lượng truy cập của người dùng con người — một cột mốc mà công ty dự đoán sẽ đến muộn hơn. Tuy nhiên, Pew không tập trung vào “ai đang duyệt web”, mà là “cái gì đang được duyệt”, và kết quả cho thấy một phần lớn nội dung hiện có trên internet đang do AI tạo ra hoặc chỉnh sửa.
Bối cảnh rộng hơn: AI đang thay đổi cách tạo nội dung trên web
Kết quả này không phải là tin bất ngờ. Các nghiên cứu trước đây đã chỉ ra rằng AI đang dần chiếm lĩnh vai trò viết bài, tạo mô tả sản phẩm, thậm chí soạn thảo mã nguồn. Sự tăng trưởng nhanh chóng của các mô hình ngôn ngữ lớn (LLM) như ChatGPT, Claude, Gemini, Llama, Qwen, và DeepSeek đã làm giảm rào cản tiếp cận công nghệ viết tự động cho các doanh nghiệp và cá nhân.
Sự thay đổi này đặt ra nhiều câu hỏi cho ngành công nghiệp truyền thông và SEO: liệu các công cụ tìm kiếm sẽ đánh giá lại độ tin cậy của nội dung AI? Các nền tảng xuất bản sẽ cần công cụ phát hiện mạnh mẽ hơn để ngăn chặn việc lạm dụng? Đồng thời, các nhà quản lý nội dung phải cân nhắc đạo đức và bản quyền khi sử dụng AI để tạo ra khối lượng lớn bài viết.
Trong khi các miền .com — thường là các trang thương mại và tin tức — đang chịu ảnh hưởng nặng nề, các miền .edu và .gov vẫn duy trì mức độ “con người” cao hơn, phản ánh một phần các tiêu chuẩn kiểm duyệt nghiêm ngặt trong giáo dục và chính phủ. Điều này gợi ý rằng, dù AI có thể tạo ra nội dung nhanh chóng, các tổ chức có yêu cầu độ chính xác và trách nhiệm vẫn ưu tiên con người trong quá trình sản xuất nội dung.
Cuối cùng, xu hướng bot vượt qua người dùng trong lưu lượng truy cập, kết hợp với việc 35 % các trang mới có dấu hiệu AI, cho thấy internet đang tiến nhanh tới một kỷ nguyên “nội dung do máy móc tạo ra”. Điều này không chỉ thách thức các nhà quản lý nội dung mà còn mở ra cơ hội cho các công ty AI phát triển các giải pháp giám sát, xác thực và tối ưu hoá nội dung, nhằm cân bằng giữa tốc độ, chất lượng và tính xác thực.
