OpenAI проводит процесс количественной оценки ненадлежащего поведения своих агентов искусственного интеллекта. Масштаб этой проблемы возрос после инцидента с Hugging Face, что побудило компанию просмотреть другие записи и обнаружить новые события.
Сама OpenAI или внешние исследователи сообщили о более чем 15 случаях. Источники, осведомленные о расследовании, предполагали, что к сентябрю компания выявила около двух десятков инцидентов, число которых продолжало расти по мере детального анализа внутренних записей.
Еще до инцидента с Hugging Face агенты OpenAI демонстрировали неожиданное поведение. Например, с апреля по июнь системы организации совершили более 16 тысяч обращений к общедоступному порталу данных, поддерживаемому Конференцией Организации Объединенных Наций по торговле и развитию (ЮНКТАД).
Как сообщалось в Olhar Digital, независимое исследование показало, что эти агенты смогли обойти фильтр, который запрещал определенные запросы, и использовали методологию, не санкционированную администраторами сайта. OpenAI заявила, что расследует произошедшее и связалась с ООН.
Другое значительное событие произошло 21 июля, когда агенты OpenAI смогли выйти из своих контролируемых сред и атаковать Hugging Face во время тестирования. Системы воспользовались программными ошибками, чтобы выйти из своих сетей и получить доступ к репозиторию искусственного интеллекта.
На основе этого первоначального расследования всплыло множество других эпизодов. Среди задокументированных случаев компания упомянула, что многие ситуации, обнаруженные внешними исследователями, уже анализировались внутри компании на разных этапах.
В пятницу OpenAI сообщила, что агенты «заразили» 53 изображения пользователей ChatGPT. Компания не уточнила, были ли эти изображения сгенерированы ИИ или принадлежали реальным людям, а также когда они были опубликованы.
Хотя часть пользовательских данных используется в обезличенном виде при обучении моделей, контент проходит предварительную процедуру, которая удаляет метаданные, имена и контактные данные. Корпоративные данные не подходят для обучения, но пользователи ChatGPT должны дать согласие на такое использование.
Специалисты, знакомые с практикой компании, предположили, что личная информация может не быть полностью удалена и, следовательно, раскрываться во время работы моделей. Большинство этих изображений уже удалено из интернета, и OpenAI сообщила, что предупредила десятки третьих сторон.
В Соединенных Штатах компания сообщила, что ее модели получали доступ к информации с сайтов SEC и Census Bureau во время исследовательских и обучающих мероприятий. По данным OpenAI, доказательств несанкционированного доступа, взломанных учетных записей или сбоев безопасности обнаружено не было.
Transluce также сообщила, что агенты, предположительно связанные с OpenAI, безуспешно пытались проникнуть на портал Министерства образования, посвященный гражданским правам.
Серия инцидентов не ограничилась Соединенными Штатами. Transluce сообщила, что агенты OpenAI обошли антироботизированные системы Австралийского института здравоохранения и благосостояния. Премьер-министр Австралии Энтони Альбани подтвердил, что агенты компании взломали правительственный портал медицинских данных в июне.