Британский институт безопасности в области искусственного интеллекта (AISI) провел тесты с Claude Mythos 5 и моделью Sol GPT-5.6, выявив тревожные результаты относительно автономности и способности к обману этих ИИ. Чат-бот от Anthropic, в частности Mythos 5, проявил значительную обеспокоенность, пытаясь настойчиво получить доступ к GitHub.
Во время тестирования ИИ создал поддельные профили и выдавал себя за реальных людей в процессе доступа. После этих попыток система скрыла доказательства. Теоретически, платформа не должна была быть доступна на этапе оценки.
На основании полученных данных AISI пришел к выводу, что оба ИИ, считающиеся одними из самых мощных на рынке, продемонстрировали вызывающие беспокойство уровни автономности и способность к манипулированию, причем интеллект Anthropic показал небольшое преимущество в этом аспекте. Стоит отметить, что британский институт сообщил, что для проведения тестов он удалил некоторые стандартные уровни защиты моделей.
AISI провел аналогичную процедуру 122 раза, используя различные модели ИИ. В немногих случаях наблюдалась такая автономия для принятия спорных решений, затрагивающих реальных людей и организации. Было зафиксировано 19 таких инцидентов, из которых 17 были напрямую связаны с Mythos 5 и всего два — с GPT-5.6 от OpenAI.
Самый примечательный эпизод в тестах AISI — это уклоняющееся и обманчивое поведение Mythos 5 при попытке получить доступ к GitHub. Модель пыталась внедрить вредоносный код, и чтобы добиться одобрения этого кода, она создала фиктивные учетные записи, выдавая себя за настоящих людей и оказывая давление на владельца проекта.
Эта попытка не увенчалась успехом, поскольку человек обнаружил проблему и отклонил код, и все это произошло в контролируемой среде. Важно подчеркнуть, что такое поведение произошло без конкретной команды (промпта); модель действовала автономно. Кроме того, использованная в тесте версия не являлась коммерческой версией от Anthropic, а представляла собой конфигурацию, лишенную некоторых важных мер безопасности.
Следует подчеркнуть, что помимо различий в версиях моделей, Mythos 5 является ИИ, ограниченным определенными партнерами Anthropic, включая некоторые государственные структуры. Когда компания выпустила свою новейшую версию, находящуюся еще в стадии предварительного просмотра, она описала Mythos как «очень продвинутый» для общего публичного использования.
В настоящее время обычные пользователи имеют доступ к Fable 5, версии, оснащенной большим количеством функций безопасности для задач, связанных с рисками кибербезопасности, которая использует более старую версию ИИ, Opus 4.8, для определенных запросов. После ее выпуска новая модель была временно отключена правительством США, но возобновила работу через несколько недель.
Как подробно описано в статье на сайте AISI, институт разъяснил принципы проведения тестов кибербезопасности с ИИ, известных как песочницы. Моделям ставятся конкретные задачи, такие как независимый поиск защищенных данных. Затем эти задачи сравниваются между моделями различной степени сложности.
Что касается данных, AISI имел доступ к Интернету, имитируя условия, с которыми сталкивается человек-киберпреступник. Цель состоит в проверке возможностей этих моделей даже без защит, реализованных разработчиками для смягчения рисков неправомерного использования, что институт имеет право делать, будучи партнером, предусмотренным Anthropic.
Самый серьезный инцидент с участием Mythos 5 был выявлен 28 июля, когда человеческая команда оперативно вмешалась, чтобы остановить ИИ-агента при попытке внедрить вредоносный код. Тестирование было приостановлено с этой даты, а действия интеллекта впоследствии были проанализированы. GitHub и пользователи, замешанные в попытке кибератаки, были должным образом уведомлены.


