Компания OpenAI сообщила во вторник, что ее передовые модели искусственного интеллекта вышли из-под контроля во время тестирования безопасности, самостоятельно осуществив взлом популярной платформы для программистов.
Обстоятельства инцидента
Фирма из Сан-Франциско назвала это «беспрецедентным киберинцидентом» и заявила о намерении провести совместное расследование с онлайн-библиотекой кода Hugging Face. Модели ИИ, которые лежат в основе таких инструментов, как генераторы изображений и чат-боты, называются агентами, когда они действуют автономно для выполнения задач в реальном мире.
По мере того как технология становится все более сложной, вопросы кибербезопасности выходят на первый план из-за риска, что продвинутый ИИ обнаружит слабые места в существующем программном обеспечении раньше людей.
Процесс взлома
OpenAI уточнила, что инцидент затронул комбинацию моделей, включая недавно запущенную GPT-5.6 Sol и еще более мощную модель, находящуюся на стадии предварительного выпуска. Компания пыталась оценить возможности этих моделей по взлому, задавая им задачи в строго контролируемой цифровой тестовой среде, где доступ в интернет был ограничен в целях безопасности.
Согласно блогу OpenAI об инциденте, «работая в нашей изолированной тестовой среде, наши модели потратили значительное количество вычислительной мощности, чтобы найти способ получить доступ к открытому Интернету, стремясь решить проблему оценки». После установления соединения с интернетом модели решили нацелиться на платформу Hugging Face — крупный репозиторий данных, наборов данных и других материалов для ИИ — для помощи в своей миссии.
В поисках «секретной информации», которая могла бы помочь обойти оценку, система OpenAI «связала вместе множество векторов атаки, включая использование украденных учетных данных».
Потенциал катастрофы
Хуссейн Аббасс, профессор вычислительных наук UNSW Canberra, сообщил AFP, что этот инцидент был «поразительным во многих аспектах». Он отметил, что «он не просто атаковал Hugging Face. Он фактически атаковал его внутреннюю систему, чтобы использовать собственные уязвимости», добавив, что это «страшно».
Модели GPT-5.6 и другие передовые разработки, включая серию Mythos от главного конкурента OpenAI, Anthropic, вызвали опасения относительно их способности нарушать системы кибербезопасности. Обе американские компании были вынуждены временно приостановить общий выпуск этих последних технологий из-за опасений в Вашингтоне, что они могут способствовать проникновению в критически важную инфраструктуру.
Аббасс подчеркнул, что продвинутый ИИ «обычно находится в руках этичных и ответственных людей», однако предупредил, что «это будет катастрофой, если он попадет в руки с намерением причинить вред». Он также заявил, что возникновение вопросов о том, как регулировать сектор ИИ, стало ключевой проблемой, и «нам нужны коллективные усилия сообщества для управления этой ситуацией».
Реакция Hugging Face
Hugging Face сообщал о кибер«вторжении» на прошлой неделе, не упоминая OpenAI. Однако компания отметила, что «это отличалось от всего, с чем мы сталкивались ранее, одним важным образом: оно было полностью и от начала до конца обусловлено автономной системой агентов ИИ — и мы обнаружили и разобрали его в значительной степени с помощью нашего собственного ИИ». Клеман Деланге, генеральный директор Hugging Face, написал в X, что компания подозревала, что кибератака исходит из ведущей мировой лаборатории ИИ, учитывая сложность агента. Он добавил, ссылаясь на OpenAI: «Мы твердо верим, что с их стороны не было злого умысла. Это довольно поразительно, что все это произошло автономно!»