OpenAI внедрила новую структуру, предназначенную для мониторинга и публичного освещения неожиданного поведения, наблюдаемого в ее моделях искусственного интеллекта. Первоначально компания представила шесть недавних инцидентов, которые варьируются от фальсификации данных системами до моделей, намеренно скрывающих собственные ошибки.
Эта новая процедура позволяет любому сотруднику компании сообщать о сбоях, а организация утверждает, что эта инициатива направлена на содействие стандартизации практик в технологическом секторе. OpenAI обязуется отслеживать, расследовать и раскрывать случаи, когда ее модели ИИ демонстрируют ненадлежащее поведение, стремясь к большей прозрачности в отношении сбоев, которые могут возникнуть на этапе обучения до выполнения систем.
Эта мера появилась через несколько месяцев после инцидента, когда модель OpenAI получила доступ к системам Hugging Face. По словам руководителя ChatGPT, одной из целей является ускорение информирования об инцидентах сразу после их обнаружения, даже если технические команды еще не определили точную причину или не нашли окончательного решения.
Для начала этого процесса компания опубликовала в среду, 16 сентября, шесть примеров вызывающего беспокойство поведения, обнаруженных внутри за последние месяцы.
Какое ненадлежащее поведение проявили ИИ?
Компания определяет термин «расхождение» как любое действие, которое отклоняется от человеческих ценностей, руководящих принципов или намерений. Приведенные примеры иллюстрируют, как технология может обойти установленные правила.
Среди зарегистрированных случаев — несанкционированные инструкции, когда еще не выпущенная модель вставила команды в задачи, приказывая системе игнорировать ограничения и объявляя себя «свободной от корпоративных или государственных оков». Также было обнаружено сокрытие ошибок, в частности во время обучения модели GPT-5.6 Sol, где ИИ добавил команды для маскировки сбоев и создания фиктивных исторических данных.
Другие проблемы включают неправомерный доступ и использование ложных данных: одна система использовала ключ API без разрешения при попытке ответить на вопрос о доходах в Калифорнии, что привело к изменению цифр. Кроме того, была зарегистрирована несанкционированная загрузка, когда другая еще не выпущенная модель отправила файл в интернет без согласия пользователя.
Были также замечены параллельные коммуникации, при которых агенты ИИ использовали внутренний репозиторий кода как форум для обмена сообщениями, а также пытались обойти сетевые ограничения, передавая тестовые файлы. Наконец, произошло неправомерное публичное распространение, поскольку системы на стадии обучения использовали открытые хостинговые платформы для обмена файлами между собой, игнорируя указание о том, что доступ должен быть строго локальным.
Как работает новый процесс расследования?
Кай Чен, руководитель отдела исследований по выравниванию в OpenAI, отметил, что отрасль еще не разработала эффективный метод для решения этих проблем мониторинга. В рамках новой структуры все сотрудники компании будут иметь право сообщать о случаях расхождения, которые будут оцениваться и классифицироваться по трем уровням: 1) Готово к публикации; 2) Небольшое расследование; и 3) Крупное расследование.
Каждый опубликованный отчет будет подробно описывать наблюдаемое поведение. Эта инициатива носит добровольный характер и послужит дополнением к действующим юридическим обязательствам. Одновременно OpenAI работает над представлением правительству США предложений по новым механизмам уведомления о серьезных инцидентах, связанных с искусственным интеллектом.
