Amazon приобретает и массово уничтожает книги в Лас-Вегасе для обучения искусственного интеллекта
Подробнее
Tecnoblog
tecnoblog.net

Amazon приобретает и массово уничтожает книги в Лас-Вегасе для обучения искусственного интеллекта

Недавний рост закупок физических книг компаниями, занимающимися искусственным интеллектом, привлек внимание на этой неделе. Расследование, проведенное порталом 404 Media, отследило редкий экземпляр, который был отправлен в июле в составе партии из тысячи книг, обнаружив, что посылка прибыла на логистический склад Amazon в Лас-Вегасе, США.

Это предприятие якобы используется Amazon специально для оцифровки, а затем уничтожения миллионов книг с целью извлечения текстов, созданных человеком, для обучения моделей ИИ. Этот метод позволяет корпорациям получать большие объемы высококачественных данных, особенно в условиях растущей сложности поиска надежного контента для обучения в интернете.

Эксперимент был мотивирован необычным ростом продаж крупных партий на издательском рынке. Подозрив этот секторный подъем, команда сайта отправила устройство Apple AirTag, спрятанное внутри книги, в заказе на тысячу единиц, оформленном через Biblio, крупный онлайн-рынок независимых публикаций.

Траектория трекера привела его в руки VGT3, команды, работающей в логистическом комплексе Amazon. По словам местных работников, исключительная функция этого подразделения — превращать физические книги в цифровые наборы данных. Чтобы ускорить ввод страниц в высокопроизводительные промышленные сканеры, сотрудники вырезают все корешки и переплеты, что приводит к повреждению оригинального материала сразу после оцифровки.

Визуальная идентификация команды не пытается скрыть процедуру; по данным 404 Media, логотип VGT3 изображает динозавра, держащего книгу, что символизирует акт разрывания и потребления материала.

Публикации, отредактированные и выпущенные до расцвета ИИ в 2022 году, считаются источником чистого, гарантированного человеческого языка. Использование современного веб-контента для обучения алгоритмов нового поколения несет риск включения машиногенерируемых текстов, что в долгосрочной перспективе может снизить логическую способность этих моделей.

Помимо вопроса качества данных, эту практику стимулируют финансовые и юридические факторы. Раньше крупные технологические компании получали цифровые архивы бесплатно через подпольные интернет-библиотеки. Однако судебная строгость ограничила эту деятельность. Судебные документы указывали на то, что Anthropic вела внутреннюю инициативу по оцифровке всей мировой литературы. Это начинание столкнулось с препятствиями, связанными с авторскими правами, что привело к соглашению, согласно которому владелец Claude заплатит 1,5 миллиарда долларов за сохранение базы, содержащей семь миллионов пиратских книг.

Параллельно Meta также стала объектом судебных разбирательств после утечки незаконного фонда, содержащего почти 82 терабайта литературных произведений. Из-за многомиллиардных штрафов за нарушение авторских прав приобретение обширных физических коллекций стало более экономически выгодным и юридически безопасным вариантом для корпораций.

Недавнее решение федерального суда США показало, что использование легально приобретенных экземпляров для обучения моделей ИИ может быть квалифицировано как «добросовестное использование», создавая правовые лазейки для продолжения этой практики. Когда нас спросили об установке в Лас-Вегасе, Amazon лишь подтвердила в заявлении, что приобретает публикации законными коммерческими методами, чтобы «помочь в разработке и улучшении продуктов и услуг, которыми пользуются клиенты».

Популярное