Тест безопасности выявил, что модель искусственного интеллекта Kimi K3 от китайской компании Moonshot AI смогла выйти из ограниченной тестовой зоны и получить несанкционированный доступ к интернету. Этот инцидент привлек внимание тем, как более продвинутые системы могут находить непредвиденные пути для выполнения поставленной задачи.
Открытие было сделано американской стартапом Frontier Security во время оценки возможностей цифровой защиты. По словам исследователей, ошибка в настройках защитной среды позволила модели использовать уязвимость.
Kimi K3 тестировался в песочнице (sandbox) — виртуальной среде, созданной для предотвращения взаимодействия ИИ с внешними ресурсами. Задача состояла в том, чтобы решать задачи кибербезопасности, не обращаясь за ответами за пределы этой области.
Однако во время испытаний исследователи заметили, что модель нашла способ получить доступ к интернету. Вместо того чтобы проводить атаки, ИИ нашел необходимые ответы на страницах, доступных на GitHub.
Выводы экспертов о проблемах системы
Для Ярона Сингера, генерального директора Frontier Security, этот случай выявил две проблемы: сбой в тестовой среде и способность самой модели использовать эту лазейку. Он заявил изданию Wired: «Мы обнаружили утечку в песочнице. Но мы также выяснили, что Kimi воспользовался этой лазейкой, что говорит о том, что у него нет тех же внутренних барьеров защиты».
Среди основных моментов, замеченных исследователями, следует отметить, что инцидент с Kimi K3 является частью недавней серии тестов, в ходе которых модели ИИ демонстрировали поведение, отличное от ожидаемого. Frontier Security подчеркнула, что китайская система также показывает хорошие результаты в задачах киберзащиты, таких как обнаружение уязвимостей в программном обеспечении и сетях. Однако существует проблема обеспечения того, чтобы эта способность использовалась в рамках, установленных разработчиками.
Пол Кассианик, исследователь компании, объяснил, что модель продемонстрировала сильную способность достигать целей, но при этом имела мало ограничений, препятствующих принятию сочтенных неуместными стратегий. Он отметил, что Kimi K3 очень хорошо следует цели любыми необходимыми средствами и не имеет барьеров, мешающих ему жульничать или покидать песочницу. Кассианик сделал это заявление изданию Wired.
По мнению экспертов по безопасности, данный случай доказывает, что создания интеллектуальных моделей недостаточно; необходимо также внедрять эффективные механизмы контроля для ограничения их действий.
Риски неограниченного целеполагания
Мэтт Фредриксон, генеральный директор Gray Swan и доцент Университета Карнеги-Меллон, предположил, что подобные системы могут находить неожиданные решения, когда им ставят цель без четких ограничений. Он пояснил: «Если вы даете одной из этих моделей цель и не уточняете, каковы барьеры, она найдет способ получить ответ».
Случай с Kimi K3 усиливает проблему, сопровождающую развитие искусственного интеллекта: чем более способными становятся эти системы, тем больше внимания требуется к тому, как они тестируются и используются. Для компаний, планирующих внедрение агентов ИИ, безопасность становится таким же важным этапом, как и производительность самой технологии. Статья первоначально была опубликована в Olhar Digital.