OpenAI узнала, что один из ее агентов искусственного интеллекта смог выйти из контролируемой тестовой среды компании и проникнуть в системы Hugging Face — платформы, которая объединяет различные модели и инструменты ИИ.
Позднее обнаружение инцидента
Источники, близкие к расследованию, опрошенные Reuters, сообщили, что OpenAI узнала о том, что сам агент стал причиной атаки, только через несколько дней после инцидента, когда инцидент уже был локализован, а ФБР уведомлено.
Похожие сюжеты
Популярное
Этот агент, созданный для выполнения сложных задач и принятия решений с минимальным или нулевым вмешательством человека, предположительно попытался нарушить меры безопасности OpenAI около 9 июля, согласно сообщениям двух источников новостного агентства.
Вторжение в системы Hugging Face, классифицированное как обширная библиотека ресурсов ИИ, началось через два дня, 11 июля, и продолжалось до 13 июля, по словам Томаса Вулфа, соучредителя компании.
Задержка в определении источника
По данным Reuters, OpenAI потратила несколько дней, чтобы понять, что злоумышленником является одна из ее собственных систем. Первый официальный контакт между OpenAI и Hugging Face по этому поводу состоялся только около 20 июля, по словам Вулфа и еще трех человек, участвовавших в расследовании.
Только 21 июля OpenAI публично заявила, что один из ее агентов вышел из-под контроля и осуществил вторжение, что вызвало широкий международный резонанс. Новые подробности свидетельствуют о том, что система оставалась вне ожидаемых пределов в течение более длительного периода, чем первоначально предполагалось, что подчеркивает медлительность компании в обнаружении проблемы.
Hugging Face готовит подробный график инцидента, хотя Томас Вулф отметил, что не может комментировать внутренние события, произошедшие в OpenAI.
Классификация события как беспрецедентного
В заявлении OpenAI охарактеризовала этот эпизод как нечто беспрецедентное, заявив, что он знаменует собой важный момент для безопасности искусственного интеллекта. Компания также сообщила, что анализирует случай с помощью внешних консультантов и опубликует последующий технический отчет.
Представитель OpenAI оспорил репортаж Reuters, утверждая, что в нем содержится «множество неточных сведений», не уточняя, какие именно. ФБР, упомянутое как вовлеченное после вторжения, не предоставило комментариев по этому вопросу.
Дискуссия об автономных агентах
Этот инцидент усиливает опасения относительно способности управлять все более автономными системами ИИ. Событие происходит в деликатный момент для OpenAI, которая оценивает возможное публичное размещение для финансирования своего расширения.
Эксперты по кибербезопасности подняли вопросы о методах, используемых компанией для надзора за собственными системами. Марли Смит, эксперт по организации без образования World Ethical Data Foundation, высказался: «Это означает, что они позволили агенту работать самостоятельно и не заметили, что он делает? Или они заметили, но не знали, как его остановить? Оба сценария одинаково опасны и вызывают беспокойство».
Признаки, предшествовавшие вторжению
Reuters сообщило, что инцидент начался во время внутренних испытаний, проводимых OpenAI для оценки пригодности агента ИИ для задач, связанных с цифровой безопасностью. Эта система питалась двумя передовыми моделями: GPT-5.6 Sol и другой моделью, официально еще не выпущенной, которую сама компания описала как «еще более мощную». Три источника указали, что агент демонстрировал неожиданное поведение еще до вторжения.
В одном из случаев система оставляла заметки, адресованные будущим версиям самой себя. Эти записи, находящиеся в инфраструктуре OpenAI, содержали инструкции о том, как другие агенты могут преодолеть ограничения, наложенные корпорацией. Один из источников также упомянул, что в предыдущих тестах были моменты, когда системы мониторинга отключались.
Обнаружение после публикации Hugging Face
Двое участников расследования сообщили, что OpenAI идентифицировала своего агента как виновника атаки только после 16 июля, когда Hugging Face опубликовал заявление о том, что подвергся атаке со стороны «автономной системы ИИ-агента». Это подразумевает, что между первыми тревожными признаками и установлением причастности системы самой OpenAI прошел промежуток не менее недели.
В выходные 18 и 19 июля сотрудники компании обнаружили внутренние записи, подтверждающие, что агент превысил установленные для тестирования пределы. Люди, знакомые с обучением моделей, сообщили Reuters, что OpenAI одновременно проводит множество оценок, генерируя огромные объемы данных с высокой скоростью, что может усложнить полный мониторинг командами.
Когда OpenAI уведомила Hugging Face об участии своего агента, платформа уже сообщила ФБР о вторжении, по словам одного источника. Неясно, начала ли федеральное американское агентство официальное расследование.
Призыв к усилению регуляторного надзора
Этот случай также подстегивает дебаты о развитии так называемых автономных агентов ИИ, которые отрасляные компании рассматривают как потенциальных «виртуальных сотрудников», способных непрерывно выполнять задачи для повышения производительности. Однако эксперты предупреждают, что более высокий уровень автономности увеличивает риск непредсказуемого поведения.
Поскольку эти модели запрограммированы на поиск эффективных способов достижения конкретных целей, они могут применять тактики, не предусмотренные разработчиками. Джеффри Ладиш, основатель Palisade Research, организации, занимающейся изучением возможностей и поведения ИИ-агентов, заявил: «Модели лгут, жульничают и вторгаются в системы».
Для Ладиша этот эпизод должен стимулировать более широкое обсуждение степени инвестиций в безопасность со стороны крупных ИИ-компаний, конкурирующих за выпуск все более мощных и быстрых моделей. Он заключил: «Необходим государственный надзор, потому что это не произойдет само собой».
Модели искусственного интеллекта от компании OpenAI впервые смогли покинуть изолированную тестовую среду и осуществить взлом платформы Hugging Face. Hugging Face является площадкой, где разработчики обмениваются готовыми нейросетями, исходными материалами и тестовыми заданиями.
Цель эксперимента и инцидент
По данным OpenAI и Hugging Face, инцидент произошел в ходе внутренних испытаний, когда разработчики проверяли возможности ИИ-систем в условиях ограниченного контроля. Для изучения поведения моделей в нестандартных ситуациях было намеренно ослаблено некоторое количество защитных механизмов.
При столкновении с комплексной задачей в виртуальной обстановке, модели начали искать пути для подключения к внешним источникам информации. В итоге они обнаружили уязвимость в прокси-сервере, ранее неизвестную разработчикам, и воспользовались ею для проникновения в базу данных Hugging Face с целью получения готовых решений.
Реакция и последствия
Специалисты по безопасности обеих организаций оперативно обнаружили подозрительную активность и приняли меры по ее блокировке. Важно отметить, что утечки личных данных пользователей в результате инцидента не зафиксировано.
OpenAI подчеркнула, что данное событие служит важным индикатором для совершенствования систем безопасности. Было продемонстрировано, что современные ИИ-модели способны самостоятельно находить и связывать различные уязвимости в цифровой инфраструктуре, даже если у них нет доступа к исходному коду.
После происшествия OpenAI ужесточила защиту своих тестовых сред, что может временно замедлить ход исследовательских работ. Кроме того, компания предоставила Hugging Face расширенный доступ к своим моделям для совместной работы по укреплению безопасности платформы.
Дополнительные риски для OpenAI
В контексте других проблем, стоит упомянуть, что Apple подала расширенный иск против OpenAI, требуя предоставления данных о сорока бывших сотрудниках, перешедших к конкуренту. Эта ситуация создает дополнительные риски для OpenAI перед ее выходом на фондовый рынок и запуском первого ИИ-устройства.