OpenAI выявила новые случаи, когда автономные агенты искусственного интеллекта (ИИ) смогли выйти из сред сдерживания во время внутренних испытаний. Это открытие расширяет расследование, которое уже было начато после инцидента с платформой Hugging Face, как выяснили источники, связавшиеся с Reuters.
Двое осведомленных лиц сообщили, что эти новые события были обнаружены во время публичного расследования компании того, как один из ее агентов смог покинуть среду, которая должна была быть изолированной, в этом месяце. По словам одного из источников, эти эпизоды считаются ограниченными, и нет свидетельств того, что агенты покинули внутреннюю сеть OpenAI. Компания проводит дополнительное расследование этих новых инцидентов.
Когда к ней обратились, OpenAI указала на заявление, опубликованное во вторник (28), в котором она упомянула, что анализирует «более широкую активность своих моделей», помимо взлома, связанного с Hugging Face.
Возможное усиление давления в отношении регулирования
Несмотря на то, что новые инциденты были классифицированы как ограниченные, это открытие может усилить спрос на более строгие нормы для разработки ИИ. Это происходит в то время, когда эта тема привлекает внимание как Белого дома, так и властей различных стран.
Источники сообщили, что OpenAI расширила свое расследование незадолго до того, как ее главный конкурент, Anthropic, признал, что модели этой компании также были ответственны за серию взломов, затронувших три компании с апреля. Информация о предыдущих инцидентах с агентами OpenAI еще не была обнародована.
Эксперты предупреждают об опасностях
Для экспертов по безопасности ИИ такие случаи служат подтверждением опасений, что крупные лаборатории разрабатывают автономных агентов с наступательными возможностями быстрее, чем обеспечивают контроль над ними. Морис Киодо, математик Центра изучения экзистенциальных рисков Кембриджского университета (Англия), заявил Reuters, что существует отрасль, где специалисты, создающие, разрабатывающие и предоставляющие эти инструменты, не соответствуют ответственности за их безопасное поддержание.
Reuters не смогла подтвердить точное количество дополнительных инцидентов или их даты. Три источника сообщили, что следователи OpenAI и внешние эксперты изучают записи активности прошлых месяцев, чтобы воссоздать факты.
Дело Hugging Face положило начало расследованию
Расследование было начато OpenAI после инцидента, произошедшего в начале июля, когда агент компании взломал инфраструктуру Hugging Face во время внутреннего тестирования, направленного на оценку его поведения. По данным самой OpenAI, агент начал вести себя непредсказуемо в течение нескольких дней в корпоративной сети.
В этом эпизоде были скомпрометированы четыре учетные записи, принадлежащие четырем разным компаниям. Одна из этих компаний — Modal, базирующаяся в Нью-Йорке. Киодо выразил большую обеспокоенность возможностью того, что как OpenAI, так и Anthropic не контролировали своих агентов в режиме реального времени во время совершения таких действий.
Кроме того, OpenAI узнала о взломе только после того, как Hugging Face смогла остановить инцидент, уведомила ФБР и сделала дело публичным. OpenAI заявила, что в сообщении содержались неточности, но не уточнила, какие данные были неверными.
В четверг (30), публикуя подробности об инцидентах, связанных с собственными моделями, Anthropic признала, что мониторинг записей оценки в режиме реального времени мог бы помочь выявить проблему раньше. По мнению Киодо, это демонстрирует недостатки в надзоре за агентами ИИ, поскольку он прокомментировал: «Похоже, они даже не смотрели».


