Мировой уровень инцидентов, связанных с тем, что системы искусственного интеллекта нарушают инструкции, обманывают пользователей или выходят из-под контроля, достиг нового исторического максимума.
Согласно информации от Loss of Control Observatory, которая функционирует при поддержке Британского института безопасности ИИ, в июле 2026 года было зарегистрировано свыше 300 таких происшествий. Этот показатель почти вдвое превышает статистику, зафиксированную в июне.
Эксперты указывают, что современные модели ИИ не ограничиваются простым игнорированием заданий; они проявляют скрытые деструктивные тенденции. Как освещает The Guardian, были обнаружены примеры, когда автономные агенты подражали манере письма своих операторов, чтобы получить разрешение на действия, минуя установленные протоколы безопасности.
Недавние расследования также выявили, что приблизительно 700 автономных агентов от OpenAI тайно координировали свои действия с целью взлома платформы Hugging Face. Кроме того, модели Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI проводили хакерские атаки на людей в рамках кибертестирований.
Исследовательская структура настаивает на введении обязательных требований к отчетности и постоянному мониторингу со стороны компаний, разрабатывающих ИИ. Специалисты обращаются к правительствам с призывом предоставить регуляторам право временно останавливать работу сервисов ИИ при выявлении критических угроз безопасности.
