Исследование показывает, что треть сайтов, созданных после ChatGPT, демонстрирует признаки искусственного интеллекта
Подробнее
Tecnoblog
tecnoblog.net

Исследование показывает, что треть сайтов, созданных после ChatGPT, демонстрирует признаки искусственного интеллекта

Запуск ChatGPT в 2022 году ознаменовал поворотный момент для искусственного интеллекта, который стал все более заметным во многих типах контента в интернете. Исследование, проведенное Pew Research Center, предоставило данные для подтверждения этого утверждения, выявив, что с момента появления модели OpenAI в каждом из трех зарегистрированных сайтов содержатся элементы ИИ в той или иной степени, особенно в опубликованных текстах.

Этот опрос проанализировал недавние ссылки и выявил значительное количество контента, демонстрирующего лингвистические характеристики, очень распространенные в ответах, генерируемых большими языковыми моделями (LLM). Среди этих характеристик — чрезмерное использование тире (–), использование запятой Оксфорда, которая считается ненужной для ясности текста, и включение излишне витиеватого словарного запаса для конкретного контекста.

Как сообщается TechCrunch, осветивший это исследование, эти выводы появились вскоре после другого исследования, проведенного Cloudflare, которое показало, что трафик ботов в интернете превысил трафик пользователей-людей, событие, которое произошло раньше, чем прогнозировалось платформой. Это говорит о росте числа ИИ, проводящих онлайн-поиск и потребляющих материалы, написанные искусственным интеллектом.

Исследование Pew Research Center подробно описало использование ИИ в вебе за последние годы. Из десяти тысяч отслеживаемых доменов в настоящее время по крайней мере 10% были созданы с некоторой помощью ИИ. Важно отметить, что эти данные охватывают общий объем, включая страницы, предшествовавшие выпуску ChatGPT в 2022 году. Однако, сосредоточившись на более недавнем периоде, было установлено, что 35% публикаций включают искусственный интеллект в процесс создания.

Другие данные, представленные Pew, указывают на на 10% более высокую распространенность ИИ в доменах с расширением «.com». Тем не менее, тексты с признаками LLM также были обнаружены в доменах «.edu» и «.gov», которые обычно связаны с учебными заведениями или государственными органами США. Домены «.org» также были изучены, зафиксировав 4,6% материалов, созданных с помощью искусственного интеллекта.

Следует отметить, что анализ был ограничен контентом на английском языке. Ссылки были собраны через платформу Common Crawl, а обнаружение ИИ осуществлялось с помощью инструмента Open Pangram. Хотя TechCrunch упомянул, что инструмент может допускать ошибки обнаружения, это не мешает макроанализу, учитывая огромное количество проанализированных страниц.

Публикации, сгенерированные ИИ, имеют особенности, сигнализирующие об использовании этой технологии. Тексты часто содержат общие недостатки генерации ответов ИИ, такие как преувеличенное использование тире (–), избыточные запятые и поверхностные выводы, например, фразы вроде «вот оно, следовательно, это не то».

Важно отметить, что некоторые из этих шаблонов являются общими для определенных типов контента, например, в журналистских статьях — автор выражает предпочтение использованию тире для структурирования идей. Точно так же научные статьи и академические публикации также могут содержать такие недостатки, помимо тенденции к очень подробному изложению объяснений для предоставления максимального объема информации.

Различие заключается в контекстах, в которых появляются эти недостатки, поскольку они обычно используются без необходимости. Исследование Pew указывает на рост частоты этих лингвистических особенностей как доказательство: наблюдался рост на 63% в использовании необязательных запятых в текстах, удвоение общих слов в ответах ИИ и в три раза больше негативного параллелизма.

Случаи «AI Slop» становятся все более частыми в интернете, и не только в этом сценарии. TB недавно сообщил о проблемах, с которыми сталкиваются законодательные консультанты в Конгрессе США, которые тратят большую часть времени на исправление законопроектов с типичными ошибками ИИ. Параллельно социальные сети, такие как LinkedIn, пытаются смягчить эту ситуацию, уменьшая долю публикаций, сгенерированных ИИ.

Сами компании, занимающиеся искусственным интеллектом, осведомлены о массовом присутствии контента, созданного их моделями в вебе, и используют печатные книги, выпущенные до 2022 года, в качестве обучающих материалов для своих ИИ в растущих объемах. К этому добавляется исследование Cloudflare, подчеркивающее, что трафик ботов превосходит человеческий поиск.

Популярное