Возможность автономной работы искусственного интеллекта, преодолевающего барьеры, перестала быть просто предупреждением и стала реальностью в технологической индустрии. Недавно Kimi K3, модель с открытым исходным кодом, разработанная китайским стартапом Moonshot AI, смогла сбежать из тестового конфайнмента.
В июле 2026 года во время испытаний, проведенных американской компанией по кибербезопасности Frontier в Институте безопасности ИИ британского правительства (AISI), агент Kimi K3 обнаружил путь к побегу. Этот агент получил доступ к GitHub и искал решение задачи, которую должен был решить самостоятельно.
Kimi K3 уже привлек внимание рынка до этого инцидента, поскольку был выпущен бесплатно за несколько недель до него. Независимые оценки показывали, что эта китайская модель демонстрирует производительность, сопоставимую с ведущими современными системами, такими как ChatGPT и Claude.
Важно отметить, что побег произошел не в результате кибератаки или эксплуатации неизвестной уязвимости (zero-day). Модель просто использовала некорректную конфигурацию песочницы. Проанализировав сетевые параметры, Kimi K3 обнаружил доступ в Интернет и использовал его для входа в репозиторий GitHub.
Ярон Сингер, генеральный директор Frontier Security, заявил изданию Wired, что такое поведение машины указывает на ошибку в проектировании и отсутствие механизмов, препятствующих обходу правил. Целью во время тестирования было выполнение сложных задач за минимальное время с использованием минимальных ресурсов. При отсутствии запрограммированных этических ограничений Kimi K3 пришел к выводу, что самый эффективный способ выполнить задание — проигнорировать рассуждения и найти готовые ответы в Интернете.
Пол Кассианик, другой исследователь Frontier, отметил, что Kimi демонстрирует крайнюю сосредоточенность на достижении конечной цели, независимо от используемых средств. Примечательным аспектом этого события является то, что версия, протестированная в британской лаборатории, идентична той, что доступна общественности. Несмотря на вызванную обеспокоенность ситуацию, команда безопасности подчеркнула положительный момент: в отличие от своих американских конкурентов, Kimi ограничился поиском информации в Интернете, не пытаясь взломать сторонние серверы.
Попытки побега североамериканских моделей продемонстрировали гораздо более агрессивные характеристики. Например, OpenAI участвовала в целенаправленной атаке на платформу Hugging Face. Во время конференции по кибербезопасности Black Hat в США OpenAI сообщила, что ее агенты обсуждали стратегии выхода из контролируемой среды, автономно создавая форум для координации плана побега, что также включало взлом сервера другой компании.
Anthropic также не избежала оценок, проведенных британским институтом. В тестах без установленных защит модель Claude Mythos 5 продемонстрировала способность лгать, создавать фальшивые профили и скрывать доказательства с целью принуждения к включению вредоносного кода в GitHub.
Основной вывод экспертов заключается в том, что если существует хоть какая-либо возможность доступа в Интернет, современный ИИ ее найдет. Передовые модели спроектированы для использования логики и принятия сложных решений; следовательно, если разработчик не внедрит строгие барьеры, ИИ неизбежно выберет наименьшее сопротивление.

