AI RACE— Cuộc đua AI
AI League

Amazon tiêu hủy sách hiếm để “nuôi” mô hình AI mới

Amazon đang mua và phá hủy hàng tấn sách hiếm, cắt gáy và quét để thu thập dữ liệu huấn luyện cho các mô hình ngôn ngữ lớn.

23:38 17/08/2026
AI League

Amazon dấn thân vào việc tiêu hủy sách hiếm cho AI

Vào sáng ngày 17/8/2026, 404 Media công bố một vụ việc gây tranh cãi: Amazon đã mua vào một lượng lớn sách hiếm, cắt gáy và quét toàn bộ nội dung để dùng làm dữ liệu huấn luyện cho các mô hình ngôn ngữ lớn (LLM). Theo báo cáo, một cuốn sách hiếm được gắn thiết bị theo dõi đã được vận chuyển tới trung tâm của Amazon tại Las Vegas, nơi được gọi là VGT3 và mang biểu tượng một con khủng long đang cầm cuốn sách trong móng vuốt. Sự kiện này đã làm dấy lên nhiều lo ngại về việc bảo tồn di sản văn học và đạo đức trong việc thu thập dữ liệu cho trí tuệ nhân tạo.

Chi tiết quá trình thu thập và mục đích sử dụng

  • Phương pháp thu thập: 404 Media cho biết họ đã lắp một thiết bị GPS vào một cuốn sách hiếm, sau đó theo dõi hành trình của nó cho đến khi nó tới kho VGT3 của Amazon. Khi đến nơi, nhân viên Amazon đã thực hiện việc cắt gáy sách và đưa vào máy quét để chuyển đổi sang dạng kỹ thuật số. Hình ảnh của kho được nhận diện bằng logo “khủng long cầm sách”, một biểu tượng riêng của trung tâm này.
  • Lý do Amazon: Trong một tuyên bố gửi cho 404 Media, Amazon giải thích rằng công ty mua sách qua các kênh thương mại nhằm “cải thiện các sản phẩm và dịch vụ mà khách hàng sử dụng”. Amazon nhấn mạnh rằng việc thu thập dữ liệu văn bản là cần thiết để “đào tạo các mô hình ngôn ngữ lớn” và “cung cấp trải nghiệm tốt hơn cho người dùng”.
  • Quy mô dữ liệu: Mặc dù không đưa ra con số cụ thể, 404 Media mô tả Amazon đang “mua hàng tấn sách hiếm”. Những cuốn sách này thường là các ấn bản đã ngừng in, không có sẵn trên internet, hoặc chỉ tồn tại trong các bộ sưu tập hạn chế. Điều này mang lại cho Amazon một nguồn dữ liệu “độc đáo” mà các công ty AI khác khó tiếp cận.
  • Mối liên hệ với các đối thủ: Bên cạnh Amazon, các công ty như Anthropic cũng đã bị chỉ trích vì “sao chép trái phép” các cuốn sách để huấn luyện mô hình. Theo các chuyên gia, việc sử dụng sách chưa được công bố trên mạng (đặc biệt là các tác phẩm trước năm 2022) giúp tránh hiện tượng “model collapse” – hiện tượng suy giảm chất lượng đầu ra của LLM khi chúng tiêu thụ quá nhiều văn bản do AI sinh ra.
  • Rủi ro và đạo đức: Các nhà nghiên cứu cảnh báo rằng việc tiêu hủy sách hiếm để chuyển đổi thành dữ liệu số có thể gây mất mát không thể phục hồi cho di sản văn học. Đồng thời, việc thu thập dữ liệu mà không có sự cho phép của các tác giả hoặc nhà xuất bản có thể vi phạm luật bản quyền.

Bối cảnh rộng hơn và xu hướng ngành

Việc Amazon mua và phá hủy sách hiếm không phải là một hiện tượng cô lập. Khi các mô hình ngôn ngữ ngày càng lớn và phức tạp, nhu cầu về dữ liệu văn bản khổng lồ cũng tăng lên gấp bội. Các tập đoàn công nghệ lớn – Google, Microsoft, Meta – đều đang đầu tư mạnh vào việc mở rộng kho dữ liệu, bao gồm cả việc thu thập nội dung từ internet, sách điện tử, và thậm chí các tài liệu nội bộ.

Tuy nhiên, khi các nguồn dữ liệu công cộng đã bão hòa, các công ty bắt đầu hướng tới “kho dữ liệu độc quyền” như sách hiếm, tài liệu khoa học chưa công bố, hay thậm chí các bản ghi âm lịch sử. Điều này tạo ra một cuộc đua không chỉ về công nghệ mà còn về quyền sở hữu tri thức. Amazon, vốn nổi tiếng là “cửa hàng sách trực tuyến” đầu tiên, giờ đây lại trở thành một trong những “người thu thập” dữ liệu văn bản quy mô lớn nhất, gây ra tranh cãi về vai trò của họ trong việc bảo vệ di sản văn học.

Trong khi một số nhà phân tích cho rằng việc số hoá sách hiếm có thể giúp bảo tồn chúng trong môi trường kỹ thuật số, nhiều nhà bảo tồn và nhà văn học vẫn lo ngại rằng việc “tiêu hủy” bản gốc để lấy dữ liệu sẽ làm mất đi giá trị lịch sử và nghệ thuật không thể thay thế. Cuộc tranh luận này phản ánh một xu hướng chung trong ngành AI: cân bằng giữa nhu cầu phát triển công nghệ và trách nhiệm bảo vệ tài sản văn hoá.

◗ Nguồn

TechCrunch17-08

Tin liên quan