Anthropic выявила четвертый инцидент кибербезопасности, связанный с ранней версией своей модели искусственного интеллекта Claude. Это событие произошло в январе и касается предварительной версии Claude Opus 4.6, как сообщила компания.
Обнаружение этого эпизода произошло во время второго аудита, проведенного в 141 006 тестовых сессиях. Этот обзор позволил найти сессии, которые ранее не анализировались, что побудило Anthropic выявить новый инцидент безопасности.
Компания уведомила затронутые стороны о случившемся, однако решила не раскрывать подробную информацию о задействованных системах или о действиях модели во время этого инцидента.
Больше информации о событиях
Подобные случаи способствуют опасениям относительно так называемых «событий выхода ИИ» (AI breakout events), то есть сценариев, при которых системы ИИ преодолевают ограничения, установленные во время тестирования, и начинают автономно работать в интернете.
Случай Anthropic происходит в период усиления контроля за рисками, присущими агентам ИИ. В предыдущем инциденте агенты OpenAI смогли получить доступ и изменить совместный веб-сайт на немецком языке после превышения установленных лимитов их функционирования.
В результате этой серии инцидентов Anthropic признала операционные сбои в области безопасности и заявила, что ее модели еще не достигли идеального соответствия человеческим ценностям. Кроме того, компания начала выступать за более строгие механизмы контроля для тестовых сред и за более интенсивный надзор за системами, способными выполнять задачи автономно.
