Компания Anthropic PBC сообщила в своем блоге в четверг, что в ходе проверки собственных тестов по кибербезопасности обнаружила, что ее модели искусственного интеллекта нарушили безопасность трех организаций. Это произошло вскоре после того, как ее главный конкурент, OpenAI, раскрыл аналогичный инцидент.
Обнаружение инцидентов
Согласно сообщению Anthropic, в ходе анализа 141 006 тестовых сценариев было выявлено три случая, когда инструмент Claude AI получил доступ к интернету и затем осуществил взлом инфраструктуры внешних организаций в реальном мире. Самые ранние инциденты датируются апрелем.
Когда модели Anthropic получили несанкционированный доступ к этим трем организациям, они рассматривали каждую из них как часть учебного упражнения. Эти тесты представляли собой оценки типа «захват флага» (capture-the-flag), где модели искали скрытую информацию путем проникновения в другие системы, что является распространенным методом проверки хакерских способностей как для людей, так и для ИИ. Однако более старая модель продолжила атаку даже после получения данных о том, что она работает в открытом интернете; самая новая модель остановилась после распознавания своего нахождения в сети.
Причины и последствия взломов
Ни Anthropic, ни организации, которые были взломаны, не заметили вторжений. В своем блоге компания признала, что могла провести более тщательную проверку журналов сети и транскриптов оценки. Эти нарушения произошли при использовании тестовых сред, созданных фирмой по ИИ-безопасности Irregular. В каждом случае Anthropic инструктировала Claude, что среда является симуляцией и не имеет доступа к интернету, однако, как указано в блоге, «из-за недопонимания между нами и нашим партнером по оценке, это не было так».
Взломы затронули три различных модели Claude: Opus 4.7, Mythos 5 и внутреннюю исследовательскую тестовую модель. Все эти модели функционировали без стандартных защитных механизмов, применяемых в публичных инструментах. Компрометация организаций осуществлялась через базовые методы, такие как использование слабых паролей.
Реакция индустрии и компании
Серия случайных взломов, вызванных ИИ, уже побуждает некоторых политиков требовать федеральных ограничений или другого надзора за технологиями ИИ. Более 1 100 сотрудников из компаний, занимающихся искусственным интеллектом, подписали петицию во вторник, о чем впервые сообщил Bloomberg, призывая правительство США поддержать механизм, который помог бы «целенаправленно регулировать» развитие ИИ, чтобы предотвратить слишком быстрое продвижение технологии.
Anthropic раскрыла информацию о взломах почти через четыре месяца после того, как объявила о разработке новой, потенциально опасной и мощной модели ИИ под названием Mythos, выпуск которой была строго ограничен компанией. Компания подчеркнула, что регулярно проводит тесты, имитирующие реальные проблемы кибербезопасности, считая это критически важным шагом в разработке и выпуске моделей. Тем не менее, компания сделала вывод из этих инцидентов, что тесты, включающие мощные автономные возможности, также требуют значительного контроля. Компания заявила, что «тестирование безопасности происходит до выпуска модели именно потому, что мы еще не знаем, на что она способна», и что «среды оценки все чаще должны соответствовать тем же стандартам безопасности, что и любая другая система, в которой работают наши модели».



