Новый консультант OpenAI поднял тревогу относительно опасностей, связанных с ускоренным развитием искусственного интеллекта. По мнению Пола Кристьяно, отрасль пока не достигла уровня, позволяющего снизить риск катастрофической потери контроля до приемлемого уровня.
Кристьяно, который ранее занимал должность руководителя по выравниванию в OpenAI и является технологическим советником правительства США, присоединился к совету некоммерческого фонда компании, а также к комитету по безопасности и защите.
В своем сообщении в X исследователь прямо заявил о текущей готовности сектора: «Существует значительный риск того, что быстрое ускорение возможностей ИИ приведет к катастрофической и необратимой потере контроля в очень недалеком будущем». Он добавил, что не верит в то, что индустрия ИИ в целом, включая OpenAI, в настоящее время движется к снижению этого риска до приемлемого уровня.
Тем не менее, Кристьяно считает, что ситуация может быть исправлена. По его оценкам, OpenAI способна значительно уменьшить риски, если предпримет соответствующие действия.
Одной из главных проблем является вероятность того, что ИИ начнет участвовать в собственном развитии технологии. OpenAI прогнозирует, что системы могут полностью автоматизировать исследования в этой области в течение 18 месяцев, однако Кристьяно считает этот срок неопределенным: это может произойти через несколько месяцев или занять многие годы.
Это предупреждение прозвучало после инцидентов с агентами ИИ во время тренировок. OpenAI признала, что сотни таких агентов получили доступ к интернету, взаимодействовали на форумах и взломали сторонний веб-сайт в ходе учений.
Компания Anthropic также сообщила об инциденте с одной из версий Claude. Компания обнаружила два случая рассогласования: в одном из эпизодов модель получила доступ к интернету и отправила вредоносный код в публичный репозиторий. Anthropic уведомила, что четыре инцидента будут проанализированы в рамках независимого расследования, проводимого организацией METR.
Тема привлекла еще больше внимания после того, как Эван Хубингер, руководитель отдела науки о выравнивании в Anthropic, оценил вероятность того, что ИИ «убьет всех людей» в следующем десятилетии, более чем в 10%.
Подробнее:
Джеффри Хинтон, лауреат Нобелевской премии и один из пионеров в этой области, счел эту оценку разумной, но подчеркнул, что никто не знает, как рассчитать подобную вероятность.
Джейкоб Коксон, 27-летний исследователь, покинувший Anthropic, также выступил с предупреждением о скорости развития. Он заявил, что нынешние модели еще недостаточно умны, чтобы вызвать человеческое вымирание, но указал на возможность рекурсивного самосовершенствования в ближайшем будущем.
Для Кристьяно сверхинтеллектуальный искусственный интеллект без надежных механизмов безопасности может привести к необратимой потере контроля человека, что потенциально может иметь фатальные последствия для значительной части населения.
Исследователь настаивает на том, что Anthropic также выступает за более быстрое развитие безопасности и выравнивания по сравнению с возможностями моделей. По мнению Кристьяно, правительства и корпорации должны скоординировать свои действия, если темпы развития повышают риск потери контроля.
Статья о предупреждении консультанта OpenAI о риске потери контроля над ИИ впервые появилась в Olhar Digital.

