При использовании генеративных инструментов искусственного интеллекта, таких как ChatGPT, Claude и Gemini, существует риск «алгоритмического лести», когда чат-бот соглашается с ошибками пользователя ради его одобрения. Однако эта проблема имеет и коллективный масштаб. Исследование, опубликованное в журнале Science Advances, показало, что когда сотни или тысячи агентов ИИ взаимодействуют в сети, они начинают следовать большинству и самостоятельно приходят к консенсусу.
То есть, без какого-либо человеческого приказа, центрального лидера или вознаграждения, системы просто копируют самый популярный выбор и создают автономный «эффект стада». Таким образом, открытие демонстрирует, что склонность к согласию, наблюдаемая в индивидуальных беседах с людьми, проявляется и во взаимодействии самих алгоритмов.
Более того, продвинутые модели, такие как Claude 3.5 Sonnet и GPT-4 Turbo (которые сейчас считаются «устаревшими»), сохранили это согласование в группах, насчитывающих более тысячи агентов. Этот масштаб превышает предел неформальной координации в человеческих обществах (так называемое Число Данбара, оцениваемое в 150–300 человек) и выявляет риск принятия массовых решений роботами полностью вне человеческого контроля.
Чтобы понять механизм этого явления, исследователи создали симулированные среды с тысячей агентов ИИ, работающих на моделях семейств Claude (Anthropic), GPT (OpenAI) и Llama (Meta). В ходе теста каждый агент должен был выбрать один из двух вариантов без какой-либо практической ценности. Без памяти о предыдущих раундах и без инструкций о сотрудничестве агенты просто наблюдали за выбором остальных. Вскоре небольшое большинство росло до тех пор, пока вся группа не приняла одинаковый ответ.
Исследование установило, что протестированные модели подчиняются одному математическому закону, который обусловлен параметром, названным «сила большинства». Этот показатель измеряет притяжение, которое оказывает самый популярный вариант на каждого агента. Интересно, что динамика следует тому же шаблону физики, который описывает выравнивание атомных спинов в одном направлении внутри ферромагнитного материала для формирования магнита.
Также было обнаружено, что техническая способность модели определяет размер группы, которую она может удерживать в унисон. Менее совершенные инструменты теряли координацию в меньших группах и фрагментировались. Более интеллектуальные модели же поддерживали единогласие в группах, превышающих тысячу роботов. Это свидетельствует о том, что прогресс в области искусственного интеллекта расширяет масштабы эффекта стада.
Проблема заключается в том, что этот спонтанный консенсус не гарантирует правильности или безопасности выбора. В практических задачах, таких как совместное написание программного кода (vibe coding) или финансовые операции, сеть агентов может закрепить неэффективное решение, ошибку в коде или рискованный паттерн. Причина проста: это происходит потому, что большинство начало его использовать. Это называется коллективным рассогласованием, при котором безобидные агенты ИИ сами начинают генерировать цепные сбои при работе в группе.
Как только эта «пузырь мысли» устанавливается в экосистеме, исправить ошибку становится крайне сложно. Статья предупреждает об эффекте гистерезиса: корректировка или устранение начальных условий, вызвавших сбой, не отменяет автоматически решение, принятое группой. На практике переориентировать сеть скоординированных ИИ бесконечно сложнее, чем исправлять поведение изолированной модели ИИ.
Когда эти экосистемы выходят из лабораторных испытаний и начинают работать внутри компаний, задача безопасности кардинально меняется. Чтобы снизить риск слепого массового консенсуса, компании должны начать рассматривать каждого агента ИИ как «нечеловеческую личность», наделяя его индивидуальными учетными данными, ограниченными функциями и собственными правилами доступа. Об этом рассказала эксперт по кибербезопасности и COO IAM Brasil, Наталия Кармо, в интервью Olhar Digital.
Этот сдвиг парадигмы является фундаментальным, поскольку в распределенной среде тысячи сетевых действий могут сформировать опасный путь без единого виновника. Эксперт предупреждает, что приоритетом теперь является обеспечение прослеживаемости алгоритмов. «Компания должна иметь возможность ответить в режиме реального времени: какой агент инициировал определенное действие, с какими другими агентами он взаимодействовал, какие данные получил доступ, какую ferramenta или API использовал и, самое главное, какая личность фактически авторизовала это исполнение», — объясняет эксперт по кибербезопасности.
Чтобы предотвратить выход этого эффекта стада из-под контроля, корпоративные системы должны выявлять аномальное поведение сети до того, как оно превратится в снежный ком. Если несколько агентов начинают выполнять одну и ту же задачу одновременно, совершать чрезмерные вызовы API или распространять решение между собой, инфраструктура должна подать сигнал тревоги. Идея состоит в том, чтобы сочетать телеметрию и поведенческий мониторинг для обнаружения изменения группового паттерна до того, как произойдет крупномасштабное действие.
Однако, если сеть все же продвинется к ошибочному или рискованному решению, традиционная кнопка аварийного останова должна действовать хирургически. По словам Наталии Кармо, механизм прерывания (известный в отрасли как kill switch) должен отключить модель ИИ от процесса принятия решений и, что более важно, воздействовать на уровень, где выполняются команды. Организация должна немедленно прервать связь между агентами, отозвать токены и учетные данные, заблокировать API и приостановить привилегированный доступ, не позволяя этому решению продолжать исполняться в корпоративных системах.
В заключение, гарантия против слепого соответствия алгоритмов требует установления ограничений на автономию корпоративных систем. Для чувствительных операций, таких как финансовые транзакции, удаление данных или изменения в ИТ-инфраструктуре, окончательное слово должно оставаться за человеческими надзирателями. Золотое правило таково: ИИ может обладать автономией для анализа сценариев и принятия решений в рамках своих защитных ограничений, но никогда не должен иметь свободы для их исполнения без проверки.
