Microsoft khẳng định Copilot hầu như không sao chép nội dung New York Times
Trong vụ kiện bản quyền, Microsoft cho biết chỉ dưới 1 % trong hơn 8 triệu đoạn chat của Copilot chứa ít nhất 16 từ trùng lặp với các bài báo của NYT và các tác giả.

Sự kiện chính: Microsoft phản bác cáo buộc sao chép nội dung trong Copilot
Ngày 4 tháng 9 năm 2026, Microsoft đã nộp hồ sơ pháp lý mới trong vụ kiện bản quyền do The New York Times, Trung tâm Báo cáo Điều tra (CIR) và Hiệp hội Tác giả (Authors Guild) khởi kiện. Công ty khẳng định công cụ AI Copilot của mình “hiếm khi” tái tạo lại các câu, đoạn văn từ các bài báo, sách và các tài liệu có bản quyền, và các trường hợp còn lại chỉ chiếm một phần rất nhỏ trong hơn 8 triệu đoạn chat được đưa ra cho các chuyên gia phân tích.
Chi tiết vụ kiện và số liệu thực tế
- Số lượng dữ liệu kiểm tra: Microsoft đã cung cấp cho các chuyên gia do các nhà xuất bản thuê lên tới 8,2 triệu đoạn chat của Copilot, được lựa chọn “vì chúng chứa các từ khóa liên quan đến nội dung trên các trang web của nguyên đơn”, nhằm tăng khả năng phát hiện bất kỳ đoạn trích nào có thể vi phạm bản quyền.
- Mức độ trùng lặp: Trong số này, chỉ có 59 545 đoạn chat (khoảng 0,73 %) chứa ít nhất 16 từ trùng khớp với nội dung tin tức được dùng để huấn luyện mô hình. Đối với yêu cầu “có ít nhất 30 từ trùng khớp”, chỉ có 24 phản hồi đáp ứng tiêu chí này.
- Kiểm tra sách: Trong 212 cuốn sách được đánh giá, chỉ 10 cuốn có bất kỳ đoạn trích nào trùng lặp với nội dung do Copilot tạo ra.
- Phát hiện của CIR: Một chuyên gia do CIR (Center for Investigative Reporting) thuê đã xác định 51 trường hợp “độ chồng chéo đáng kể” giữa dữ liệu Copilot và các báo cáo của CIR.
- Lời khẳng định của Microsoft: Công ty cho rằng những con số này “củng cố quan điểm rằng việc sử dụng nội dung có bản quyền để xây dựng bộ dữ liệu huấn luyện AI nên được xem là fair use”. Microsoft nhấn mạnh rằng, mặc dù Copilot dựa trên các tài liệu có bản quyền, mục đích cuối cùng của hệ thống là biến đổi và phục vụ các nhu cầu hoàn toàn khác so với nguồn gốc, nên việc đôi khi xuất hiện một vài đoạn văn ngắn “không làm suy yếu mục tiêu biến đổi của việc huấn luyện mô hình ngôn ngữ lớn (LLM)”.
- Phản hồi của nguyên đơn: The New York Times, CIR và Authors Guild chưa đưa ra bình luận ngay lập tức sau khi nhận được hồ sơ này. Vụ kiện đã được gộp lại dưới một thẩm phán để tiết kiệm thời gian, mặc dù các nhà xuất bản và tác giả đã phản đối việc gộp này.
- Bối cảnh chính trị: Trong tuần cùng lúc, chính quyền Trump (theo một tuyên bố quan tâm) đã bày tỏ ủng hộ OpenAI trong vụ việc này, cho thấy mức độ quan tâm của các lực lượng chính trị đối với tranh chấp bản quyền AI.
- Mục tiêu của Microsoft: Hồ sơ được nộp vào thứ Sáu (ngày cụ thể không nêu), trong đó Microsoft yêu cầu thẩm phán đưa ra phán quyết tóm tắt (summary judgment) – một quyết định nhanh chóng chấm dứt vụ kiện nếu thẩm phán đồng ý với lập luận của họ. Nếu thẩm phán không đồng ý, cuộc tranh chấp sẽ tiếp tục diễn ra tại tòa án.
Bối cảnh pháp lý và xu hướng ngành
Vụ kiện này là một phần của làn sóng tranh chấp bản quyền đang lan rộng trong ngành AI, khi các nhà xuất bản và tác giả khẳng định các công ty công nghệ đã “học” từ nội dung có bản quyền mà không trả phí. Các vụ kiện tương tự đã xuất hiện đối với Google, Meta và các công ty khởi nghiệp AI khác. Microsoft cho rằng việc sử dụng dữ liệu có bản quyền để huấn luyện các mô hình ngôn ngữ lớn là công cụ biến đổi: kết quả cuối cùng không chỉ là bản sao nguyên văn mà là một hệ thống có khả năng tạo ra nội dung mới, trả lời câu hỏi, hỗ trợ viết lách, v.v.
Trong khi đó, các nhà xuất bản như The New York Times lo ngại rằng các công cụ AI có thể “đánh cắp” nội dung, làm giảm giá trị thuê bao và gây thiệt hại tài chính. Các tổ chức như Authors Guild cũng lo ngại về quyền lợi của các tác giả cá nhân, khi các đoạn văn ngắn từ sách có thể xuất hiện trong phản hồi của AI mà không có sự cho phép.
Nếu thẩm phán chấp nhận lập luận “fair use” của Microsoft, nó sẽ tạo ra tiền lệ quan trọng, cho phép các công ty AI tiếp tục thu thập và sử dụng dữ liệu công khai mà không phải trả phí bản quyền. Ngược lại, một phán quyết có lợi cho các nhà xuất bản sẽ buộc các nhà phát triển AI phải tìm nguồn dữ liệu mới, hoặc trả phí cho mỗi lần sử dụng nội dung có bản quyền – một thách thức lớn đối với việc mở rộng và cải thiện các mô hình ngôn ngữ hiện đại.


