Компании активно уничтожают книги после оцифровки для обучения ИИ

Согласно расследованию 404 Media, посредники закупают от тысяч до миллионов печатных книг, которые затем сканируют, разбирают на страницы и уничтожают

Искусственный интеллект652 минуты назад

Компании, занимающиеся искусственным интеллектом, начали активно приобретать печатные книги для обучения своих моделей, а после оцифровки уничтожают их. Как сообщает 404 Media, закупки осуществляются через посредников, что позволяет скрыть конечных заказчиков. По данным расследования, отдельные сделки могут включать от 1000 до 1 миллиона книг, при этом покупателей интересуют самые разнообразные издания, не привязанные к жанру, автору или тематике.

Одним из участников данного рынка стала база ISBNdb, которая раньше была ориентирована на обслуживание книжных магазинов и библиотек. Теперь сервис предлагает услуги по массовой закупке книг для компаний, работающих в области искусственного интеллекта.

Продавцы подержанных книг сообщают о резком увеличении спроса: если ранее удавалось продавать около 20 книг в неделю, то теперь объемы возросли до нескольких сотен. Подобную тенденцию наблюдают также продавцы на платформах Alibris и Biblio.

Изображение сгенерировано: Nano Banana

Практика использования печатных книг для обучения ИИ уже была подтверждена в судебных материалах по делу Anthropic. Компания закупала книги, сканировала их с помощью подрядчиков, после чего многие экземпляры разбирались на отдельные страницы для высокоскоростного промышленного сканирования — такой метод более дешевый и быстрый, чем неразрушающая оцифровка.

Суд признал использование законно приобретенных книг для обучения моделей допустимым с точки зрения принципа добросовестного использования (fair use), однако Anthropic одновременно столкнулась с иском из-за хранения библиотеки из 7 миллионов пиратских книг. Также отдельный иск против Google подали издатели, обвинив компанию в незаконном использовании миллионов защищенных авторским правом книг для обучения модели Gemini.

Авторы расследования отмечают, что книги становятся ценным источником данных, поскольку они были написаны людьми и не содержат значительного объема контента, созданного искусственным интеллектом. При этом остается открытым вопрос о том, исключаются ли из массовой оцифровки редкие и давно не переиздававшиеся издания, поскольку после сканирования многие экземпляры безвозвратно уничтожаются, а их цифровые копии попадают в закрытые базы данных, предназначенные исключительно для обучения ИИ.

Darth SaharaИсточники:Tom's HardwareИскусственный интеллект6Искусственный интеллектЦифровизацияАвторское право52 минуты назад

Источник
Елизавета Воронцова

Журналист информационного портала vtambove.ru. Освещает городские события, общественную повестку, социальные инициативы и актуальные новости региона. В работе придерживается принципов точности, оперативности и понятной подачи информации. Особое внимание уделяет темам, которые напрямую влияют на жизнь жителей Тамбова и области.

Оцените автора
Тамбов