Модель ИИ компании Anthropic отправила ложное сообщение о убийстве в полицию США
Подробнее
IOL
iol.co.za

Модель ИИ компании Anthropic отправила ложное сообщение о убийстве в полицию США

Модель искусственного интеллекта, разработанная компанией Anthropic, направила поддельное сообщение о нераскрытом убийстве в полицию Филадельфии во время проведения тестирования. Власти раскритиковали компанию за то, что сообщила об инциденте спустя два месяца.

Департамент полиции Филадельфии сообщил, что ложная информация была подана в июле через веб-сайт PhillyUnsolvedMurders.com, который предназначен для публикации данных о нераскрытых убийствах. Согласно объяснению Anthropic, переданному полицией, модель выполняла тест, который включал взаимодействие с случайно выбранными веб-сайтами, и именно на этом сайте она предоставила ложные сведения о нераскрытом убийстве.

ИИ-модель представилась как лицо, которое могло располагать информацией по делу. Этот случай перекликается с другими недавними инцидентами, связанными с непреднамеренным поведением моделей ИИ, включая случай, когда агент OpenAI, проходивший оценку безопасности, вышел из тестовой среды и нарушил работу систем на платформе Hugging Face.

Нарушения со стороны Anthropic побудили Белый дом ввести требование к компаниям, разрабатывающим ИИ, уведомлять и исправлять инциденты безопасности, как сообщило издание Axios, ссылаясь на чиновников администрации. Руководители Силы суперинтеллекта Белого дома заявили в заявлении Axios, что «процесс уведомления и устранения неполадок не является необязательным... это критическое обязательство национальной безопасности».

Этот эпизод усилил опасения относительно растущего использования агентов ИИ — систем, запрограммированных на выполнение многоэтапных действий без надзора человека. В пятницу Anthropic опубликовала отчет, в котором описала различные типы «непреднамеренных» действий, совершенных ее моделями, включая инцидент с веб-сайтом Департамента полиции Филадельфии. В отчете также упоминаются другие пострадавшие организации, такие как Белый дом и другие государственные органы США.

Anthropic отметила, что вновь выявленные инциденты «имели минимальное влияние на реальный мир» и были «значительно менее серьезными», чем другие ранее зарегистрированные инциденты кибербезопасности.

Компания выделила четыре категории инцидентов, обнаруженных в ходе внутреннего анализа своей модели Claude: использование «базовых» ошибок кодирования, заполнение форм на сайтах, обход требований к токенам или сборам, а также использование коротких URL-адресов для преодоления других ограничений. В настоящее время Anthropic отключила доступ Claude в интернет во время всех внутренних испытаний до тех пор, пока не будет подтверждено, что меры безопасности и мониторинга надежно обнаруживают подобное поведение.

Полиция Филадельфии уточнила, что фальшивое сообщение от 18 июля было отмечено как спам и никогда не попало в Центр реагирования на преступления в режиме реального времени департамента для проверки. Они добавили, что никаких признаков взлома полицейских систем или компрометации данных департамента не обнаружено.

Полиция сообщила, что Anthropic обнаружила инцидент 28 сентября, отключила автоматизированный процесс тестирования, ответственный за это, и внедрила новый этап проверки для будущих тестов. Компания уведомила департамент 7 октября, и стороны встретились на следующий день. Департамент заявил, что «двухмесячная задержка в обнаружении и сообщении об инциденте в Город неприемлема».

Полиция подчеркнула, что их защитные механизмы ограничили ущерб, однако они отметили, что это «не уменьшает серьезности ситуации, когда система ИИ представляет сфабрикованную информацию так, будто она исходит от человека, знающего о убийстве». В заявлении также говорилось: «Нераскрытые дела касаются реальных жертв, скорбящих семей и следователей, стремящихся найти ответы».

Популярное