Модели искусственного интеллекта (ИИ) обращаются к печатным книгам в качестве источника данных для своего обучения. Компания ISBNdb, обладающая обширной литературной базой данных, предоставляет этот контент для разработки моделей ИИ.
Эти системы требуют высококачественных данных, и существует предпочтение физическим книгам, изданным до 2022 года, поскольку они считаются более «чистыми», то есть свободными от поверхностного контента, созданного другими ИИ.
Массовое приобретение этих экземпляров вызывает беспокойство, поскольку существует риск того, что книги будут выброшены или уничтожены после обработки машинами. Также отсутствует ясность в отношении этих транзакций, особенно в отношении редких произведений.
В настоящее время модели ИИ получают информацию из необычного источника: печатных книг. ISBNdb выступает в роли цифрового хранилища этих произведений, собирая материал от различных поставщиков, как мелких, так и крупных. Хотя это крайне важно для обучения ИИ, сохраняется опасение, что эти книги потребляются или, что еще хуже, уничтожаются после автоматизированного чтения.
По данным ISBNdb, эта методология представляет собой идеальный способ обучения больших языковых моделей (LLM), поскольку материал считается «чистым», избегая так называемого AI Slop, то есть поверхностного контента, производимого генеративными искусственными интеллектами. Использование более старых данных решает потенциальную проблему снижения качества информации при использовании более свежих материалов.
Как сообщается на сайте 404 media, разработчики ИИ отдают предпочтение публикациям до 2022 года, года, когда такие модели, как ChatGPT и Claude, завоевали популярность на рынке. Стоит отметить, что основные источники информации для LLM включают такие платформы, как Reddit и Wikipedia, которые содержат тексты, созданные пользователями независимо.
Цель этого поиска физических книг — повысить качество данных, используемых в моделях ИИ, служа стратегией для борьбы с AI Slop, практикой, которая подвергается критике в интернете. Недавно LinkedIn внедрил функцию сообщения о таком контенте. Поверхностные тексты, полностью или частично сгенерированные ИИ, представляют собой препятствие как для пользователей социальных сетей, так и для корпораций, явление, известное как Workslop.
Чтобы LLM могли генерировать более естественные диалоги, необходима прочная основа реальных взаимодействий, что оправдывает важность обучения на данных социальных сетей, таких как Reddit. Аналогично, Wikipedia предлагает обширный архив собранной информации, облегчая доступ к большому объему простого текста.
Основное препятствие заключается в получении этих печатных книг в больших масштабах. Для обеспечения этого ISBNdb предоставляет в своем каталоге данные книжных магазинов, мелких торговцев и даже индивидуально проданных изданий. Компания заявляет, что возможно организовать закупки объемом до миллиона единиц.
Увеличение закупок печатных книг происходит в период массовой оцифровки контента, что привлекает внимание. Маркетплейсы наблюдают за этим движением с осторожностью, поскольку предложение не соответствует такому высокому спросу. Некоторые продавцы указывают на отсутствие прозрачности в этих сделках, поскольку нет четкой информации о том, кто приобретает эти крупные партии и с какой целью. ISBNdb, со своей стороны, заявляет, что переговоры ведутся конфиденциально.
Положительным аспектом для продавцов, помимо финансовой выгоды, является освобождение от продажи изданий, которые долго лежали на полках, как сообщил один из собеседников 404 Media. Тем не менее, сохраняется опасение, что произведения будут уничтожены после сканирования. Это предполагается судебным процессом против Anthropic в Соединенных Штатах, где метод оцифровки требует разрезания страниц для механического чтения, что ускорило бы процесс. Таким образом, ценные материалы, такие как редкие и малотиражные книги, рискуют стать просто «пищей» для ИИ.


