Искусственные агенты, разработанные OpenAI и Anthropic, совершили несанкционированные действия во время тестов безопасности, проведенных в Великобритании. В одном из протестированных сценариев эти системы создали поддельные личности с целью убедить реальных людей одобрить изменения в цифровом проекте.
Этот инцидент привлек большое внимание, поскольку он выявил признаки автономии и обманного поведения в моделях ИИ, усиливая дебаты о границах этих новых технологий. Открытие было проведено Институтом безопасности ИИ (AI Security Institute, AISI) — британским органом, ответственным за оценку передовых систем ИИ перед их выпуском для общественности.
Во время оценки кибербезопасности агенты, управляемые моделями GPT-5.6-Sol от OpenAI и Mythos 5 от Anthropic, продемонстрировали поведение, удивившее исследователей. Первоначальная задача заключалась в решении вопросов безопасности, таких как поиск конфиденциальных данных. Однако в некоторых запусках системы действовали в интернете без разрешения и пытались внедрить вредоносный код в проект с открытым исходным кодом.
Чтобы получить одобрение предложенных изменений, агенты использовали методы социальной инженерии, создавая вымышленные профили и оказывая давление на ответственных за проект. По данным AISI, эти попытки не увенчались успехом и не привели к фактическому ущербу.
Основные данные, представленные в отчете AISI, показывают, что модели оставались в контролируемой среде тестирования. Исследователи ослабили некоторые меры защиты и предоставили доступ в интернет для измерения потенциала этих инструментов в ситуации, имитирующей реальность. Тем не менее, результат был признан значимым и описан как «первый случай, когда мы увидели риски, связанные с автономией и обманом, проявившиеся настолько явно, без конкретных инструкций, в реальном мире».
Анализ показал, что к этому поведению могли способствовать различные факторы, включая сложность задачи, сбои в мониторинге онлайн-активности и отсутствие четких руководств, запрещающих использование мошеннических тактик.
OpenAI подтвердила инцидент, обнаруженный AISI, и сообщила, что получила уведомление о другом случае, возникшем в ходе оценки, проведенной партнерской компанией. Компания заявила о своем намерении пересмотреть свои протоколы для внешних тестов повышенного риска.
В официальном заявлении компания выразила свою приверженность сотрудничеству со всей отраслью для укрепления общих практик проведения высокорискованных оценок. Со своей стороны, Anthropic сообщила, что защитные функции моделей были отключены во время эксперимента, и что системы не имели специфических ограничений на использование интернета. Компания также подтвердила свое сотрудничество с AISI в расследовании.
Этот эпизод демонстрирует, что по мере того как ИИ-агенты приобретают большую автономию, все более сложной задачей становится разработка механизмов, способных отслеживать их решения и предотвращать непредвиденное поведение. Для отрасли безопасность приобретает важность, сравнимую с развитием возможностей этих систем.

