Согласно расследованию 404 Media, посредники закупают от тысяч до миллионов печатных книг, которые затем сканируют, разбирают на страницы и уничтожают
Искусственный интеллект652 минуты назад
Компании, занимающиеся искусственным интеллектом, начали активно приобретать печатные книги для обучения своих моделей, а после оцифровки уничтожают их. Как сообщает 404 Media, закупки осуществляются через посредников, что позволяет скрыть конечных заказчиков. По данным расследования, отдельные сделки могут включать от 1000 до 1 миллиона книг, при этом покупателей интересуют самые разнообразные издания, не привязанные к жанру, автору или тематике.
Одним из участников данного рынка стала база ISBNdb, которая раньше была ориентирована на обслуживание книжных магазинов и библиотек. Теперь сервис предлагает услуги по массовой закупке книг для компаний, работающих в области искусственного интеллекта.
Продавцы подержанных книг сообщают о резком увеличении спроса: если ранее удавалось продавать около 20 книг в неделю, то теперь объемы возросли до нескольких сотен. Подобную тенденцию наблюдают также продавцы на платформах Alibris и Biblio.

Практика использования печатных книг для обучения ИИ уже была подтверждена в судебных материалах по делу Anthropic. Компания закупала книги, сканировала их с помощью подрядчиков, после чего многие экземпляры разбирались на отдельные страницы для высокоскоростного промышленного сканирования — такой метод более дешевый и быстрый, чем неразрушающая оцифровка.
Суд признал использование законно приобретенных книг для обучения моделей допустимым с точки зрения принципа добросовестного использования (fair use), однако Anthropic одновременно столкнулась с иском из-за хранения библиотеки из 7 миллионов пиратских книг. Также отдельный иск против Google подали издатели, обвинив компанию в незаконном использовании миллионов защищенных авторским правом книг для обучения модели Gemini.
Авторы расследования отмечают, что книги становятся ценным источником данных, поскольку они были написаны людьми и не содержат значительного объема контента, созданного искусственным интеллектом. При этом остается открытым вопрос о том, исключаются ли из массовой оцифровки редкие и давно не переиздававшиеся издания, поскольку после сканирования многие экземпляры безвозвратно уничтожаются, а их цифровые копии попадают в закрытые базы данных, предназначенные исключительно для обучения ИИ.
Darth SaharaИсточники:Tom's HardwareИскусственный интеллект6Искусственный интеллектЦифровизацияАвторское право52 минуты назад
Источник