Hồ sơ tòa án Mỹ hé lộ Anthropic đã chi hàng chục triệu USD để mua, cắt gáy và hủy hàng triệu cuốn sách giấy. Lý do nằm ở một thứ khan hiếm bất ngờ: chữ do con người viết, chưa lẫn nội dung máy tạo ra.
Trong tháng 7 và đầu tháng 8/2026, một loạt sự kiện tưởng như rời rạc lại kể chung một câu chuyện: kho văn bản do con người viết, miễn phí và dễ lấy trên internet, thứ đã nuôi lớn thế hệ mô hình ngôn ngữ đầu tiên, đang cạn dần và bị chính sản phẩm của AI làm loãng. Bài này tóm tắt chuyện gì đang xảy ra, vì sao nó quan trọng, và nó liên quan gì tới việc bạn dùng AI hàng ngày.
Sách in trước 2022 trở thành hàng hóa: các hãng AI mua gom cả kho để scan
Theo 404 Media (21/07/2026), một công ty tên ISBNdb, chủ sở hữu cơ sở dữ liệu sách mà họ tự nhận là lớn nhất thế giới, đang chào bán dịch vụ thu mua sách giấy số lượng lớn cho các hãng AI, với thông điệp đại ý rằng dữ liệu huấn luyện tốt nhất thế giới đang nằm trên giá sách [1]. Lập luận của họ rất đơn giản: sách in trước năm 2022 ra đời trước thời mô hình ngôn ngữ lớn, nên chắc chắn không chứa một chữ nào do AI viết [2].
Đây không phải chuyện hoài cổ. Sách được mô tả là nội dung đã qua biên tập, có kiểm chứng, cô đọng theo cách mà việc quét web không tạo ra được [1]. Nói cách khác, văn bản do con người viết giờ có giá trị mua bán, và ISBNdb cho biết có thể thu xếp những lô hàng lên tới một triệu cuốn, gom từ thư viện, nhà bán lẻ và các đợt thanh lý tài sản [2].
Hiệu ứng lan tới cả những hiệu sách nhỏ. Fortune (31/07/2026) kể chuyện một nhà buôn sách cũ ở Hà Lan nhận được đề nghị mua 3.000 đầu sách hiếm tiếng Anh và ban đầu tưởng là thư rác hoặc lừa đảo [3].
"Dự án Panama": hồ sơ tòa án hé lộ Anthropic đã mua và hủy hàng triệu cuốn sách
Câu chuyện có phiên bản cụ thể và được ghi nhận bằng hồ sơ pháp lý. Theo điều tra của The Washington Post dựa trên hơn 4.000 trang tài liệu được giải mật trong vụ kiện bản quyền do các tác giả sách khởi kiện, từ đầu năm 2024 Anthropic, công ty đứng sau chatbot Claude, đã triển khai một dự án nội bộ mang mật danh Project Panama, được mô tả trong tài liệu kế hoạch là nỗ lực scan theo cách hủy hoại toàn bộ sách trên thế giới [4].
Cách làm được mô tả trong hồ sơ: dùng máy cắt thủy lực xén gáy sách, đưa từng trang rời qua máy quét tốc độ cao, rồi bỏ phần còn lại đi. Công ty đã chi hàng chục triệu USD cho việc thu mua và xử lý này [4]. Một bản chào thầu cho thấy quy mô dự kiến vào khoảng 500.000 đến 2 triệu cuốn trong sáu tháng [5].

Điều đáng chú ý nhất với người đọc bài này nằm ở lý do. Theo các tài liệu được công bố, lãnh đạo Anthropic muốn tìm nguồn sách có trước thời kỳ nội dung trên mạng bị pha loãng, để dạy Claude cách viết tốt thay vì bắt chước lối viết chất lượng thấp trên internet, và để phòng hiện tượng model collapse [5].
Lưu ý khi đọc tin này: đây là những gì hồ sơ tòa án và báo chí điều tra ghi nhận, không phải công bố chính thức từ phía công ty. Về mặt pháp lý, thẩm phán liên bang William Alsup đã phán rằng việc mua sách hợp pháp rồi số hóa để huấn luyện mô hình có thể được coi là fair use [3][5]. Nói cách khác, hợp pháp không đồng nghĩa với việc dư luận thấy dễ chịu, và phản ứng từ giới xuất bản, thư viện và bảo tồn sách rất gay gắt [6].
Model collapse là gì và vì sao nó khiến sách giấy trở nên đắt giá
Hiện tượng mà tài liệu nội bộ nhắc tới đã được công bố trên tạp chí khoa học Nature năm 2024. Nhóm tác giả từ Oxford, Cambridge cùng vài đại học khác chỉ ra rằng nếu liên tục đem nội dung do mô hình sinh ra để huấn luyện mô hình đời sau, mô hình sẽ dần mất phần đuôi của phân bố dữ liệu gốc, tức là những chi tiết hiếm và đa dạng, và lỗi này không sửa được [7].
Hình dung cho dễ: giống như photocopy một bản photocopy. Mỗi lần sao thêm một đời, chữ mờ đi một chút, đến lúc nào đó thì không đọc được nữa.
Vấn đề là internet hôm nay đã lẫn rất nhiều nội dung máy viết. Nghiên cứu của công ty Graphite trên mẫu ngẫu nhiên các bài viết tiếng Anh lấy từ kho Common Crawl cho thấy tỉ lệ bài mới chủ yếu do AI tạo ra đã tăng từ khoảng 36% sau một năm ChatGPT ra mắt lên gần một nửa, và giữ quanh mốc 50% từ đầu năm 2025 tới quý 1/2026 [8][9].
Ba hướng thay thế mà các hãng đang đặt cược
Khi văn bản miễn phí trên web không còn là mỏ vàng, ngành AI đang dồn tiền vào ba hướng khác:
- Mua kho tư liệu của con người có nguồn gốc rõ ràng. Sách in, kho lưu trữ của nhà xuất bản, tài liệu chuyên ngành. Đây chính là câu chuyện sách cũ ở trên [1][4].
- Để AI tự tạo bài tập cho chính nó, kèm cơ chế chấm điểm. Một nghiên cứu công bố ngày 24/07/2026 mô tả cách tiếp cận tên Skill Self-Play: một phần của hệ thống ra đề, một phần đi giải, phần thứ ba kiểm tra kết quả thực thi rồi cập nhật lại kho kỹ năng [10]. Điểm mấu chốt là phải có khâu kiểm chứng, nếu không mô hình chỉ tự khen mình và học sai. Lưu ý: đây là bản preprint, chưa qua bình duyệt.
- Học từ thế giới vật lý thay vì từ chữ. Ngày 23/07/2026, NVIDIA giới thiệu Cosmos-H-Dreams, một mô hình mô phỏng học từ video phẫu thuật và dữ liệu chuyển động của robot, rồi dự đoán khung hình tiếp theo khi robot thực hiện một hành động [11]. Nhóm phát triển cố tình đưa cả những lần thao tác thất bại vào dữ liệu huấn luyện, vì một môi trường mô phỏng dùng để đánh giá thì phải tái hiện được hậu quả của hành động sai, không chỉ các ca làm đúng [11].
Điểm chung của cả ba: thứ khan hiếm không còn là "thêm nội dung", mà là quyền tiếp cận trải nghiệm đáng tin cậy.
Điều này nghĩa là gì với người dùng AI hàng ngày
Bạn không mua sách cũ và cũng không huấn luyện mô hình, nhưng câu chuyện trên có ba hệ quả rất thực tế:
- Luôn kiểm tra lại thông tin AI đưa ra, nhất là số liệu và tên riêng. Một phần dữ liệu mà mô hình học được đến từ web, nơi có tỉ lệ nội dung máy viết rất cao [8]. Với báo cáo gửi lãnh đạo hay tài liệu đối tác, hãy đối chiếu lại với nguồn gốc.
- Tài liệu do chính bạn viết là dữ liệu quý nhất khi làm việc với AI. Thay vì bảo AI tự nghĩ ra một bản báo cáo tiến độ, hãy dán vào một bản báo cáo kỳ trước của phòng làm mẫu, kèm dữ liệu thật xuất từ Jira hay Google Sheet. Bạn đang cung cấp đúng thứ đang khan hiếm, đó là nội dung sạch do con người viết, gắn với bối cảnh cụ thể.
- Nhưng "quý" không có nghĩa là đem cho. Chính vì dữ liệu người viết có giá trị, hãy tuân thủ nguyên tắc bảo mật: không dán dữ liệu khách hàng, thông tin hợp đồng hay tài liệu mật của VNPAY vào các công cụ AI chưa được phê duyệt cho mục đích đó. Nếu cần dùng mẫu thật, hãy che tên và số liệu nhạy cảm trước.
M��t cách đọc lạc quan: khi văn bản do con người viết trở nên đắt giá, thì kinh nghiệm, tài liệu nội bộ và cách diễn đạt riêng của mỗi phòng ban cũng có giá trị hơn, chứ không mất giá đi.
Tài liệu tham khảo
[1] 404 Media — AI Companies Are Buying Tons of Old Books Because They're Free of AI Slop (21/07/2026). https://www.404media.co/ai-companies-are-buying-tons-of-old-books-because-theyre-free-of-ai-slop/
[2] The Next Web — AI firms are buying up old books because they are the last slop-free data left (07/2026). https://thenextweb.com/news/ai-companies-buying-old-books-training-data-slop
[3] Fortune — This Dutch bookseller thought a request for 3,000 copies was 'spam or phishing' (31/07/2026). https://fortune.com/2026/07/31/dutch-bookseller-ai-spam-phishing-3000-book-copies-scan-destroy/
[4] The Washington Post — Anthropic 'destructively' scanned millions of books to build Claude (27/01/2026). https://www.washingtonpost.com/technology/2026/01/27/anthropic-ai-scan-destroy-books/
[5] Euronews — Project Panama: How Anthropic secretly destroyed millions of books to train its AI (05/08/2026). https://www.euronews.com/culture/2026/08/05/project-panama-how-anthropic-secretly-destroyed-millions-of-books-to-train-its-ai
[6] Znews (Tạp chí điện tử Tri Thức) — Công ty mẹ của Claude bị tố hủy hàng triệu cuốn sách để huấn luyện AI (01/08/2026). https://znews.vn/cong-ty-me-cua-claude-bi-to-huy-hang-trieu-cuon-sach-de-huan-luyen-ai-post1673548.html
[7] Nature — Shumailov, I., Shumaylov, Z., Zhao, Y., Papernot, N., Anderson, R., Gal, Y. "AI models collapse when trained on recursively generated data", Nature 631, 755–759 (24/07/2024). https://www.nature.com/articles/s41586-024-07566-y
[8] Axios — AI hasn't overtaken human writers online (15/05/2026). https://www.axios.com/2026/05/15/human-vs-ai-written-articles
[9] Graphite — AI Now Writes as Many Online Articles as Humans Do (13/05/2026). https://graphite.io/five-percent/ai-now-writes-as-many-online-articles-as-humans-do
[10] arXiv — Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills, arXiv:2607.22529 (24/07/2026, preprint chưa bình duyệt). https://arxiv.org/abs/2607.22529
[11] NVIDIA — NVIDIA Cosmos-H-Dreams: Bringing Real-Time Generative Simulation to Surgical Robotics (23/07/2026). https://huggingface.co/blog/nvidia/cosmos-h-dreams
