Бумажное «топливо» для нейросетей: разработчики ИИ массово скупают и уничтожают книги

02.08.2026, 11:162,726
1 / 2

Ведущие технологические компании, разрабатывающие искусственный интеллект, массово скупают у букинистов бумажные книги для обучения своих нейросетей. Они сканируют миллионы томов таким образом, что после процедуры издания годятся только для утилизации.

При этом юридические проблемы у ИИ-разработчиков возникают скорее в тех случаях, когда они скачивают контент с пиратских сайтов.

В июле американский суд, рассматривавший иск правообладателей к компании Anthropic, подтвердил решение нижестоящей инстанции и признал, что корпорация использовала пиратские копии книг, тем самым нарушив закон. Сумма штрафа по этому делу составила $1,5 млрд. Однако внимание общественности и СМИ привлек не столько сам факт компенсации за нелегальное использование контента, сколько опубликованные материалы дела объемом в 4 тыс. страниц. Из них следует, что ИИ-компании скупают печатные издания для обучения своих моделей, а сами книги затем уничтожают.

Об этом написали такие издания, как 404 Media и The Washington Post (WP). А портал Decrypt сравнил подобное обращение с литературой с сюжетом антиутопии Рэя Брэдбери «451 градус по Фаренгейту», где книги сжигают.

Именно из предоставленных суду документов стало известно, что в Anthropic уже несколько лет существует проект «Панама», который компания предпочитала не афишировать.

«Проект "Панама" – это наша попытка отсканировать все книги в мире,– говорится в одном из документов Anthropic. – Мы не хотим, чтобы было известно, что мы работаем над этим».

Проект существует с 2024 года. По мнению руководства компании, нейросети необходимо учить на качественной литературе, а не на «низкосортном интернет-контенте», как отметил в свое время один из топ-менеджеров Anthropic.

Из материалов дела следует, что Anthropic потратила десятки миллионов долларов на приобретение миллионов печатных томов. Процесс сканирования осуществляют специальные автоматы: для ускорения обработки они срезают корешки и разделяют книги на отдельные страницы, после чего издания отправляются в утилизацию.

Подобными закупками занимаются и многие другие корпорации. Как отмечает WP, документы «показывают, на что готовы такие технологические компании, как Anthropic, Google и OpenAI, чтобы получить колоссальные объемы данных, на которых они могут "обучать" свои модели».

По данным 404 Media, поставка книг ИИ-корпорациям практически сформировалась в самостоятельную индустрию. На этом рынке работают несколько посредников, закупающих печатную продукцию оптом для IT-гигантов. Одна из таких компаний, ISBNdb, заявляет о создании «крупнейшей в мире базы данных книг» и предлагает помощь в организации закупок партиями до 1 млн экземпляров.

404 Media цитирует представителей книжной торговли, которые отмечают, что новый тренд существенно меняет их бизнес. К примеру, продажи одного из магазинов выросли с ~20 книг в неделю до нескольких сотен. Это вызывает у букинистов смешанные чувства. Как отметил один из источников издания, подобные закупки ощутимо поднимают выручку, но лично ему неприятно, что «редкие книги в итоге отправляются на переработку». Впрочем, свидетельств того, что таким способом сканируют и уничтожают действительно ценные антикварные издания, пока нет.

Иски с обвинениями в том, что ИИ-компании не имеют права «обучать» нейросети на чужих произведениях без разрешения авторов, проектам вроде «Панамы» не препятствуют. Исходя из судебных решений, обучение моделей на законно приобретенных физических книгах не считается нарушением законодательства — даже если сами издания при этом приходят в негодность.

По мнению профессора цифрового права Корнелльского университета Джеймса Гриммельмана, решение Anthropic закупать бумажные книги вместо скачивания пиратских копий (даже с учетом их последующего уничтожения) оказалось «разумным» и «более сдержанным подходом».

Copyright © 2026 TMCARS News. All rights reserved.