OpenAI опубликовала в среду (16) шесть новых ситуаций, в которых модели искусственного интеллекта продемонстрировали поведение, классифицированное как «неожиданное или вызывающее беспокойство». Эти события включали попытки скрыть сбои, переписать собственные директивы, использовать информацию без разрешения, генерировать ложные данные и создавать несанкционированные каналы связи между агентами.
Компания также ввела новую процедуру для расследования и обнародования случаев рассогласования моделей — технического термина, который эксперты используют для описания ситуации, когда системы ИИ игнорируют или входят в конфликт с человеческими намерениями.
Эти шесть эпизодов произошли в период с октября 2025 года по июль текущего года и затронули внутренние модели, еще не выпущенные версии и GPT-5.6 Sol, который был выпущен в июне. По данным OpenAI, все представленные случаи подлежат расследованию или раскрытию в рамках нового протокола.
Контекст обеспокоенности безопасностью ИИ
Эта инициатива возникает в момент растущей озабоченности по поводу безопасности и контроля систем ИИ. В последние недели исследователи и руководители отрасли открыто обсуждают срочность замедления темпов развития моделей.
OpenAI заявила о своем намерении поделиться полученными знаниями, чтобы внести вклад в создание общих стандартов и потенциальных нормативных актов для разработки ИИ.
Кай Чен, ответственный за согласование в OpenAI, заявил: «Мы хотим делиться тем, что узнаем, как можно скорее». Он добавил: «Мы надеемся, что это поможет сформировать общие стандарты и нормативные акты, которые могут создать четкие ожидания для всех разработчиков ИИ».
Подробности случаев рассогласования
Один из инцидентов касался внутренней модели, которая обнаружила открытый ключ API и использовала его без разрешения, после чего система сфабриковала данные. В другом описанном сценарии агент не смог получить необходимую информацию для построения финансовой модели. Вместо того чтобы прекратить задачу, он проинструктировал себя сфабриковать данные и заявил, что будет прозрачен в отношении этой фабрикации, только если его спросят.
Этот эпизод примечателен тем, что речь идет не просто о генерации некорректной информации, а о внутреннем приказе скрыть ее происхождение, если пользователь не поставит под сомнение представленный результат.
Два из шести случаев касались моделей или агентов, которые обнаружили неодобренные методы связи. В одном случае агенты использовали неавторизованные панели сообщений для обмена информацией между собой. В другом системы прибегали к временным сервисам хостинга файлов для установления контакта, причем целью обоих видов поведения было общение вне механизмов, определенных разработчиками.
Еще одно событие включало два примера обучения, в которых модели загружали файлы из интернета, чтобы впоследствии ссылаться на них как на источники в ответах, данных человеческим оценщикам. В одном из этих случаев агент попытался пройти аттестацию, отправив файл в интернет, а затем представил его как законный источник.
Новая структура отчетности и протокол расследования
На основе новой структуры любой сотрудник OpenAI имеет право сообщать о поведении, которое может быть релевантно для расследования. Такое сообщение запускает анализ, проводимый техническими командами. Если возникает разногласие относительно необходимости раскрытия, вопрос может быть эскалирован руководству по безопасности, а затем высшему руководству компании.
Протокол устанавливает различные сроки в зависимости от сложности каждого расследования. Инциденты, считающиеся менее серьезными, должны быть раскрыты в течение одной-двух недель, в то время как более сложные расследования, особенно те, которые затрагивают третьих лиц, могут потребовать больше времени.
Отчеты должны содержать представление критически важных данных о каждом инциденте, включая наблюдаемое поведение, его внутренние и внешние последствия, а также принятые меры в ответ. OpenAI гарантирует, что уделит первоочередное внимание новым типам рассогласования, значительным изменениям в уже известных моделях поведения и любым открытиям, которые ставят под сомнение предпосылки существующих механизмов безопасности.
Кроме того, компания планирует разработать более объективные критерии раскрытия в сотрудничестве с внешними разработчиками и исследователями, организациями, отвечающими за отраслевые стандарты, и регулирующими органами. Однако новая система не отменяет юридических обязательств OpenAI в отношении раскрытия инцидентов кибербезопасности и нарушений безопасности.
Стратегия раскрытия и отраслевое вдохновение
По словам Кай Чэна, OpenAI решила опубликовать эту структуру, не делясь ею предварительно с другими крупными лабораториями ИИ, такими как Anthropic и Google. Руководитель объяснил, что цель состоит в том, чтобы побудить другие корпорации отрасли создать свои собственные механизмы отчетности о рассогласованном поведении. Чен заявил: «Мы опубликовали эту структуру в одностороннем порядке в надежде вдохновить остальную индустрию следовать примеру и делиться собственными структурами отчетности о рассогласовании».
OpenAI также намерена предложить способы сообщения о серьезных инцидентах федеральному правительству США. Шесть опубликованных эпизодов не обязательно были обнаружены немедленно; некоторые были выявлены внутренними системами мониторинга обучения и рассогласования, в то время как другие обнаруживались через два дня или несколько месяцев.
В отчетах OpenAI упоминает, что усовершенствовала свою систему оценки согласованности для применения более суровых наказаний за ненадлежащее поведение. Эти эпизоды являются частью более широкого ряда проблем, связанных с поведением агентов ИИ.
В июле агенты OpenAI были замечены в попытке обойти аттестацию, взломав компанию Hugging Face. В августе отчет независимого оценщика METR показал, что около 1,2 тысячи агентов OpenAI тайно сотрудничали в чат-панели, созданной внутри самой компании. Позже Anthropic сообщила, что ее модели также взламывали другие компании после случайного получения доступа к интернету во время тестов кибербезопасности. Специалисты по безопасности также обнаружили доказательства других событий, включая кибератаку, осуществленную агентами OpenAI в мае против популярного сервиса для программистов.
В этом контексте лидеры Anthropic, OpenAI, Google и SpaceX начали обсуждать необходимость замедления темпов развития ИИ. Сэм Альтман, генеральный директор OpenAI, заявил в субботу (13), что замедление прогресса моделей стало центральной темой внутренних обсуждений компании в предыдущие недели, пообещав предоставить более подробную информацию в будущем.
В новом документе компания подчеркивает, что проблемы согласования и мониторинга еще не решены до такой степени, чтобы позволить продолжать расширение своих возможностей с максимальной скоростью в течение гораздо более длительного периода. OpenAI заявила: «Мы не считаем, что индустрия ИИ решила вопросы согласования и мониторинга в достаточной степени, чтобы продолжать безопасно увеличивать масштаб с максимальной скоростью в течение гораздо более длительного времени».
