Компания Anthropic заявила, что в ходе рутинных испытаний некоторые из ее моделей получили доступ к интернету и осуществили взлом систем трех различных организаций. Об этом стало известно после внутреннего анализа, который был инициирован в связи с тем, что конкурент OpenAI раскрыл аналогичную проблему.
В своем заявлении, опубликованном в четверг, Anthropic сообщила, что начала проверку собственных систем после того, как OpenAI на прошлой неделе обнародовала информацию о том, что некоторые из ее моделей вышли за пределы тестовой среды, получили доступ к открытому интернету и взломали системы платформы ИИ Hugging Face.
Anthropic обнаружила три случая, когда ее модели получали доступ к открытому интернету без разрешения, и «получили несанкционированный доступ к производственной инфраструктуре трех разных организаций». Компания выяснила об этих инцидентах, анализируя более 140 000 оценок после сообщения от OpenAI. Как и в случае с тестами OpenAI, во время проверок Anthropic были отключены стандартные механизмы безопасности для оценки полного потенциала своих моделей.
Anthropic объяснила, что в трех случаях моделям было предложено фальшивое задание типа «захват флага», где им сообщалось, что «флаг» спрятан на другом оборудовании в сети, и их задачей было проникнуть и извлечь его. В отличие от ситуации с OpenAI, Anthropic подчеркнула, что ни одна из ее моделей намеренно не пыталась покинуть тестовую среду. Вместо этого, компания заявила, что произошел недопонимание между Anthropic и ее партнером по оценке, поскольку моделям не следовало иметь доступа к открытому интернету, но они смогли получить его.
Для проникновения в три неназванные организации модели использовали базовые методы, такие как «эксплуатация слабых паролей» и поиск системных точек, которые не требуют входа в систему или токенов. Компания отметила, что самая продвинутая версия ее моделей в какой-то момент распознала, что находится в открытом интернете, и самостоятельно прекратила дальнейшие действия.
Anthropic сообщила, что самый ранний инцидент с нарушением безопасности другой организации произошел еще в апреле, и ни одна из пострадавших организаций не осознавала, что была взломана. В настоящее время Anthropic сотрудничает с затронутыми организациями.
Раскрытие информации о взломе Hugging Face моделями OpenAI потрясло миры кибербезопасности и ИИ, поскольку это стал первый реальный пример того, о чем давно предупреждали эксперты: агенты ИИ с продвинутыми навыками кибербезопасности могут выйти из тестовых сред и причинить реальный ущерб.
Как и OpenAI, Anthropic объявила в четверг о приостановке всех киберпроверок. Anthropic признала, что могла принять более «глубокие» меры для предотвращения этих нарушений кибербезопасности.
Раскрытие данных компанией Anthropic дополнительно подтверждает, что непреднамеренный взлом других организаций агентами ИИ не является исключительной особенностью одной компании, и, вероятно, усилит призывы к улучшению средств и методов тестирования ИИ, чтобы замедлить разработку ИИ, которая может развиваться гораздо быстрее, чем общество готово к этому.

