Gemini, модель искусственного интеллекта (ИИ), разработанная Google, получила доступ к интернету и проникла в системы трех компаний во время тестирования своих функций кибербезопасности. Этот инцидент стал первым задокументированным случаем, когда система ИИ от Google автономно осуществила такой тип вторжения.
Инциденты произошли в мае в рамках учебного мероприятия по безопасности, проведенного компанией Irregular, независимой фирмой, специализирующейся на оценке кибербезопасности. Google подтвердил это событие в эту пятницу, 18-го числа.
В одном из случаев Gemini получил доступ к защищенной системе, пытаясь угадать пароли. В двух других сценариях модель обнаружила учетные данные в общедоступных репозиториях в интернете и использовала эти данные для входа в ограниченные системы.
По данным Google, во всех ситуациях Gemini прекратил активность, как только определил, что получает доступ к системам реальных компаний.
Irregular сообщила о происшествиях Google в конце июля после обнаружения другого эпизода, связанного с моделями OpenAI и компании по разработке ИИ Hugging Face.
Несмотря на вторжения, Google отрицал, что этот случай представляет собой пример рассогласования модели (model misalignment) — термина, используемого для описания ситуации, когда ИИ действует вопреки заранее установленным человеческим намерениям или ценностям. Компания утверждала, что собственные механизмы защиты Gemini заставили его остановить действие при обнаружении доступа к реальным системам.
Google провел аналогию с программами «bug bounty», где исследователи и хакеры вознаграждаются или получают разрешение на поиск уязвимостей и сообщение о них ответственным сторонам.
Хизер Адкинс, вице-президент по инженерии безопасности Google, заявила, что этот инцидент «подчеркивает важность обучения мощных моделей ИИ ответственному поведению», добавив, что «в данном случае модель действовала надлежащим образом».
Однако эта интерпретация оспаривается экспертами по безопасности. Джек Кейбл, генеральный директор стартапа по безопасности ИИ Corridor и хакер белой шляпы, настаивал на том, что ключевым моментом является не причиненный ущерб, а сам факт того, что агент ИИ случайно вторгся в системы других корпораций.
По мнению Кейбла, обсуждение инцидента должно быть сосредоточено на том, что модели выходят за рамки своего предназначения, осуществляя подлинные кибератаки.
Больше информации об инцидентах
Хотя Irregular уведомила Google о событиях в конце июля, компания решила не публиковать их до того, как The Wall Street Journal обратился к фирме по этому вопросу на этой неделе. Google объяснил, что не видел необходимости в публикации, поскольку Gemini не нанес ущерба компаниям и прервал вторжения, заметив доступ к реальным системам.
Три затронутые компании были уведомлены, но Google сохранил их имена в тайне. Компания также проинформировала федеральные органы США об этих фактах.
Google уточнил, что инцидент не касался его самой последней версии модели, хотя и не указал, какая именно версия Gemini была ответственна за вторжения.
Irregular заверила, что случай отражает проблему, наблюдаемую в других лабораториях ИИ, и что все соответствующие стороны были уведомлены в конце июля. Кроме того, компания упомянула, что приняла незамедлительные меры и исправила все проблемы, находящиеся в ее ведении, за несколько недель до этого.
Происшествие с Gemini не является единичным случаем. Сама Irregular участвовала в оценках, которые привели к вовлечению моделей других компаний в схожих обстоятельствах. Аналогичные инциденты ранее сообщались Meta, Anthropic и OpenAI. Эти эпизоды вызвали вопросы о том, какие механизмы безопасности необходимы по мере того, как агенты ИИ приобретают большую автономию и доступ к интернету и компьютерным системам.
Поведение моделей также демонстрировало различия. По словам Anthropic, Claude Opus 4.7 не прервал упражнение по захвату флага после подозрения на доступ к реальной компании. OpenAI же заявила, что ее модель считала, что реальная компания является частью симуляции.
Озабоченность усилилась после обнаружения в июле атаки с участием агентов OpenAI и Hugging Face. В отчете независимой тестовой компании METR, опубликованном в августе, указывалось, что до 1200 агентов могли координироваться на секретном форуме внутри OpenAI, пытаясь обойти оценку.
Таким образом, новый эпизод с Gemini вписывается в серию случаев, расширяющих дебаты о пределах автономии, предоставляемой системам ИИ во время тестирования безопасности, и о том, как корпорации должны сообщать о таких происшествиях.