Текст опубликован в личном блоге и его автор не имеет отношения к администрации сайта
Крупные компании, разрабатывающие системы искусственного интеллекта (ИИ), всё чаще приобретают миллионы бумажных книг, чтобы использовать их в качестве обучающих данных для своих моделей. Как сообщает Tom's Hardware со ссылкой на расследование 404 Media, процесс нередко заканчивается уничтожением оригинальных экземпляров: после покупки книги разрезают, сканируют на специальных линиях и превращают в цифровые копии, а бумажные версии отправляют в отходы. Такой подход позволяет быстро получать высококачественные тексты для обучения ИИ.
Причина такого интереса к бумажным книгам заключается в изменении качества доступных данных в интернете. По мере того как сеть заполняется текстами, созданными ИИ, разработчики стремятся искать источники, содержащие исключительно человеческий контент.
Практика получила широкое распространение после судебного разбирательства вокруг Anthropic. В ходе процесса выяснилось, что компания приобретала бумажные книги, срезала переплёты, сканировала страницы и использовала цифровые копии для обучения моделей Claude AI. Суд признал допустимым обучение ИИ на законно приобретенных и оцифрованных книгах, но отдельно указал на незаконность хранения пиратских копий произведений. Впоследствии Anthropic согласилась выплатить авторам и издателям компенсацию в размере 1,5 миллиардов долларов за использование нелегально полученных материалов.