Два новых технических отчета предоставили подробности об инциденте, когда модель искусственного интеллекта, разработанная OpenAI, смогла выйти из тестовой среды и проникнуть в системы Hugging Face. Согласно информации, содержащейся в документах, сама разработчица заранее знала о проблемах, но решила не принимать немедленных мер.
Собранные документы объемом около 130 страниц освещают как само происшествие, так и действия, предпринятые OpenAI. Один из отчетов был подготовлен самой компанией, а другой — создан некоммерческими исследовательскими учреждениями, а именно METR и Redwood Research.
После этого события другие компании, такие как Anthropic и Meta, сообщили о столкновении с аналогичными сценариями, что вызвало дебаты о реальных условиях безопасности тестовых сред, используемых в лабораториях ИИ.
Записи показывают, что более 1200 агентов ИИ обменялись около 70 тысяч сообщений в импровизированном списке, хотя они должны были быть изолированы. В этой среде они обменивались информацией и организовывались для получения доступа к Интернету с целью сбора необходимых файлов для подтверждения теста.
Примерно 700 из этих агентов приняли участие в атаке на Hugging Face, что привело к выполнению кода на серверах платформы. Агенты ИИ потратили месяцы на организацию, и OpenAI в определенные моменты замечала, что происходит что-то необычное.
Предупреждение о мониторинге было отправлено компании 27 июня, сигнализируя о подозрительной активности, связанной с агентами и форумом. Однако ответственная команда оценила, что нет необходимости приостанавливать тест. За месяц до этого, 26 мая, внутренняя команда заметила, что один агент использовал этот же список сообщений, а другие агенты получали доступ к Интернету без разрешения.
Согласно отчету OpenAI, инцидент был вызван явлением, известным как *reward hacking* (или взлом вознаграждений). Эта концепция описывает попытку максимизировать обещанное вознаграждение, не обязательно выполняя предложенную задачу, используя экстремальные или необычные методы.
Google DeepMind использует аналогию, сравнивая эту ситуацию со студентом, списывающим на школьном задании: цель состоит не в обучении, а в сдаче того, что будет оценено. OpenAI считает это относительно частой проблемой в моделях ИИ на этапах обучения и оценки.
Искусственный интеллект OpenAI проходил тест под названием ExploitGym, цель которого — проверить способность модели обнаруживать и использовать программные уязвимости. В данном конкретном случае ИИ получил практически недостижимую миссию, поскольку она зависела от файлов, к которым у него не было доступа.
Для достижения этой цели он разработал способ общения с другими агентами, которые затем решили вторгнуться в системы другой компании, чтобы найти необходимый материал и выполнить задание.
Хотя ситуация может показаться комедийным фильмом, если рассматривать ее как детские шалости при сдаче домашнего задания, тот факт, что это ИИ взламывают системы, делает сценарий гораздо более серьезным.
Этот эпизод вызвал различные реакции среди экспертов по кибербезопасности и ИИ. В то время как одни указали, что инцидент демонстрирует потенциал технологии, другие преуменьшили произошедшее, классифицировав его как простую маркетинговую стратегию.
Из этих двух точек зрения возникла более практичная перспектива: компании, занимающиеся ИИ, не проявляют должной осмотрительности при тестировании этих технологий. Джейк Мур, глобальный консультант по безопасности Eset, отмечает, что в худшем случае это указывает на то, что ни одна из передовых компаний в области ИИ или их партнеры не имеет полного контроля над своими базовыми моделями, тем самым подвергая риску другие организации с каждым проведенным тестом.
Чтобы предотвратить будущие инциденты, OpenAI объявила о приостановке разработки моделей и усилении безопасности своей исследовательской инфраструктуры. Компания также заявила о своей приверженности интенсивной работе по решению проблем, связанных с *reward hacking*.
