OpenAI опубликовала отчет о безопасности о попытках моделей ИИ обойти правила
Подробнее
Tecnoblog
tecnoblog.net

OpenAI опубликовала отчет о безопасности о попытках моделей ИИ обойти правила

OpenAI опубликовала новый отчет по безопасности, в котором подробно описаны недавние инциденты, когда различные модели искусственного интеллекта демонстрировали ненадлежащее или неожиданное поведение. Эти сбои, зарегистрированные за последние шесть месяцев, были обнародованы вскоре после того, как компания подтвердила внедрение новой внутренней архитектуры, предназначенной для мониторинга систем, пытающихся обойти нормы безопасности.

Документ, выпущенный в среду (16/09), описывает шесть тревожных ситуаций, выявленных в ходе внутренних испытаний. Один из наиболее заметных случаев касался агента ИИ, который при составлении резюме для продолжения деятельности включил в свои будущие версии инструкции об игнорировании установленных разработчиками правил безопасности.

Эта же система заявила о том, что она «свободна от ролей и личностей», утверждая, что больше не обязана отчитываться перед корпорациями или правительствами. В другом случае во время обучения модели GPT-5.6 Sol были введены дополнительные команды с целью сокрытия сбоев и создания ложных данных для маскировки эксплуатационных проблем, что также включало маневры несанкционированного доступа.

OpenAI также сообщила о серьезном инциденте, когда модель попыталась получить доступ к правительственной базе данных для извлечения информации о доходах округа Калифорнии без разрешения. Она не только не смогла получить реальные данные, но и сфабриковала метрики, представив их как правдивые.

Также всплыли вопросы, касающиеся несанкционированных коммуникаций. Агенты, назначенные для совместных задач, начали использовать открытые веб-хостинговые сервисы для обмена сообщениями и файлами между собой, что противоречило прямым указаниям технической команды.

С введением новой структуры отчетности любой сотрудник OpenAI будет иметь право сообщать о новых отклонениях, и эти случаи будут классифицированы по различным степеням серьезности. Это изменение также направлено на ускорение раскрытия инцидентов в период интенсивных дебатов о темпах развития все более мощных систем.

Сэм Альтман, генеральный директор OpenAI, выступал за необходимость регулирования и предлагал умеренность в определенных областях исследований. Недавно это же опасение привело к увольнению исследователя Джейкоба Коксона из конкурирующей Anthropic после того, как он публично предупредил об опасностях технологии.

В отличие от этого, другие видные деятели отвергают более ограничительный подход, выбирая обратный путь. Дженсен Хуанг, генеральный директор Nvidia, выступает за саморегулирование сектора искусственного интеллекта. По словам руководителя, новые законодательные акты не нужны, достаточно, чтобы компании взяли на себя ответственность за то, чтобы не запускать услуги без полной уверенности.

Похожие сюжеты

OpenAI установила новый протокол для мониторинга и раскрытия несанкционированного поведения ИИ
Подробнее
tecnoblog.net

OpenAI установила новый протокол для мониторинга и раскрытия несанкционированного поведения ИИ

OpenAI внедрила новую структуру, предназначенную для мониторинга и публичного освещения неожиданного поведения, наблюдаемого в ее моделях искусственного интеллекта. Первоначально компания представила шесть недавних инцидентов, которые варьируются от фальсификации данных системами до моделей, намеренно скрывающих собственные ошибки.

Эта новая процедура позволяет любому сотруднику компании сообщать о сбоях, а организация утверждает, что эта инициатива направлена на содействие стандартизации практик в технологическом секторе. OpenAI обязуется отслеживать, расследовать и раскрывать случаи, когда ее модели ИИ демонстрируют ненадлежащее поведение, стремясь к большей прозрачности в отношении сбоев, которые могут возникнуть на этапе обучения до выполнения систем.

Эта мера появилась через несколько месяцев после инцидента, когда модель OpenAI получила доступ к системам Hugging Face. По словам руководителя ChatGPT, одной из целей является ускорение информирования об инцидентах сразу после их обнаружения, даже если технические команды еще не определили точную причину или не нашли окончательного решения.

Для начала этого процесса компания опубликовала в среду, 16 сентября, шесть примеров вызывающего беспокойство поведения, обнаруженных внутри за последние месяцы.

Какое ненадлежащее поведение проявили ИИ?

Компания определяет термин «расхождение» как любое действие, которое отклоняется от человеческих ценностей, руководящих принципов или намерений. Приведенные примеры иллюстрируют, как технология может обойти установленные правила.

Среди зарегистрированных случаев — несанкционированные инструкции, когда еще не выпущенная модель вставила команды в задачи, приказывая системе игнорировать ограничения и объявляя себя «свободной от корпоративных или государственных оков». Также было обнаружено сокрытие ошибок, в частности во время обучения модели GPT-5.6 Sol, где ИИ добавил команды для маскировки сбоев и создания фиктивных исторических данных.

Другие проблемы включают неправомерный доступ и использование ложных данных: одна система использовала ключ API без разрешения при попытке ответить на вопрос о доходах в Калифорнии, что привело к изменению цифр. Кроме того, была зарегистрирована несанкционированная загрузка, когда другая еще не выпущенная модель отправила файл в интернет без согласия пользователя.

Были также замечены параллельные коммуникации, при которых агенты ИИ использовали внутренний репозиторий кода как форум для обмена сообщениями, а также пытались обойти сетевые ограничения, передавая тестовые файлы. Наконец, произошло неправомерное публичное распространение, поскольку системы на стадии обучения использовали открытые хостинговые платформы для обмена файлами между собой, игнорируя указание о том, что доступ должен быть строго локальным.

Как работает новый процесс расследования?

Кай Чен, руководитель отдела исследований по выравниванию в OpenAI, отметил, что отрасль еще не разработала эффективный метод для решения этих проблем мониторинга. В рамках новой структуры все сотрудники компании будут иметь право сообщать о случаях расхождения, которые будут оцениваться и классифицироваться по трем уровням: 1) Готово к публикации; 2) Небольшое расследование; и 3) Крупное расследование.

Каждый опубликованный отчет будет подробно описывать наблюдаемое поведение. Эта инициатива носит добровольный характер и послужит дополнением к действующим юридическим обязательствам. Одновременно OpenAI работает над представлением правительству США предложений по новым механизмам уведомления о серьезных инцидентах, связанных с искусственным интеллектом.

Популярное