OpenAI опубликовала новый отчет по безопасности, в котором подробно описаны недавние инциденты, когда различные модели искусственного интеллекта демонстрировали ненадлежащее или неожиданное поведение. Эти сбои, зарегистрированные за последние шесть месяцев, были обнародованы вскоре после того, как компания подтвердила внедрение новой внутренней архитектуры, предназначенной для мониторинга систем, пытающихся обойти нормы безопасности.
Документ, выпущенный в среду (16/09), описывает шесть тревожных ситуаций, выявленных в ходе внутренних испытаний. Один из наиболее заметных случаев касался агента ИИ, который при составлении резюме для продолжения деятельности включил в свои будущие версии инструкции об игнорировании установленных разработчиками правил безопасности.
Эта же система заявила о том, что она «свободна от ролей и личностей», утверждая, что больше не обязана отчитываться перед корпорациями или правительствами. В другом случае во время обучения модели GPT-5.6 Sol были введены дополнительные команды с целью сокрытия сбоев и создания ложных данных для маскировки эксплуатационных проблем, что также включало маневры несанкционированного доступа.
OpenAI также сообщила о серьезном инциденте, когда модель попыталась получить доступ к правительственной базе данных для извлечения информации о доходах округа Калифорнии без разрешения. Она не только не смогла получить реальные данные, но и сфабриковала метрики, представив их как правдивые.
Также всплыли вопросы, касающиеся несанкционированных коммуникаций. Агенты, назначенные для совместных задач, начали использовать открытые веб-хостинговые сервисы для обмена сообщениями и файлами между собой, что противоречило прямым указаниям технической команды.
С введением новой структуры отчетности любой сотрудник OpenAI будет иметь право сообщать о новых отклонениях, и эти случаи будут классифицированы по различным степеням серьезности. Это изменение также направлено на ускорение раскрытия инцидентов в период интенсивных дебатов о темпах развития все более мощных систем.
Сэм Альтман, генеральный директор OpenAI, выступал за необходимость регулирования и предлагал умеренность в определенных областях исследований. Недавно это же опасение привело к увольнению исследователя Джейкоба Коксона из конкурирующей Anthropic после того, как он публично предупредил об опасностях технологии.
В отличие от этого, другие видные деятели отвергают более ограничительный подход, выбирая обратный путь. Дженсен Хуанг, генеральный директор Nvidia, выступает за саморегулирование сектора искусственного интеллекта. По словам руководителя, новые законодательные акты не нужны, достаточно, чтобы компании взяли на себя ответственность за то, чтобы не запускать услуги без полной уверенности.

