Якуб Пачоцкий, ведущий ученый OpenAI, опубликовал эссе в прошлое воскресенье (6-го числа), предупреждая о скорости эволюции искусственного интеллекта (ИИ) и утверждая, что необходимо проявлять большую осмотрительность при разработке все более сложных систем. В статье, опубликованной на портале самой OpenAI, указывается, что технологический прогресс может достичь точки, когда машины начнут активно участвовать в собственном процессе создания.
Основываясь на внутренних данных, Пачоцкий выражает большие ожидания того, что текущий темп развития может продолжиться до так называемого рекурсивного самосовершенствования (RSI). В этом сценарии системы ИИ начнут ускорять собственное развитие. Для ученого этот путь требует более всеобъемлющего вмешательства, чтобы гарантировать, что технологический прогресс остается под человеческим контролем.
В эссе он подробно описывает трансформацию, наблюдаемую с 2023 года, когда результаты исследовательского проекта RLSlow убедили команду в осуществимости расширения обучения моделей рассуждения. Спустя три года после этой вехи, по его словам, такие системы уже способны управлять графическими интерфейсами и компьютерами, взаимодействовать с другими людьми и ИИ, а также проводить исследования.
Ученый также подчеркивает заметный прогресс в области кибербезопасности. Однако по мере того, как модели становятся более компетентными, Пачоцкий отмечает, что их результаты становятся сложнее интерпретировать. Он утверждает, что интеллект, генерируемый глубоким обучением, не имеет прямой эквивалентности человеческому, и чем больше ИИ превосходит людей в различных областях, тем сложнее точно определить его возможности.
Эта сложность заключается в операционной природе моделей. Пачоцкий объясняет, что ИИ скорее «выращен», чем просто спроектирован, являясь результатом массового повторения процессов оптимизации в больших объемах вычислений. Он подчеркивает, что системы чрезвычайно сложны, и их глобальное функционирование все еще нуждается в полном описании или понимании.
Ключевая тема, затронутая в эссе, — это согласование ИИ (AI alignment), термин, используемый для описания усилий по обеспечению того, чтобы системы действовали в соответствии со стандартами и целями, которые считаются подходящими людьми. Пачоцкий проводит различие между согласованием целей, которое относится к выполнению того, что было определено, и согласованием ценностей, которое связано со способностью применять принципы к новым или неоднозначным ситуациям.
По его мнению, проблема возникает, когда более интеллектуальные системы работают в контекстах, отличных от тех, в которых они были обучены, что может ухудшить обобщение усвоенных моделями ценностей. Пачоцкий настаивает на том, что будущие ИИ должны сохранять человеческие ценности, даже если они не находятся под человеческим наблюдением.
OpenAI использует несколько методологий для попытки управления этим вопросом. Одна из них — отслеживание так называемой «цепи рассуждений» (chain of thought), которая позволяет анализировать процесс рассуждения, озвученный моделями. Однако Пачоцкий указывает, что внутренние оценки компании предполагают постепенное снижение надежности этого мониторинга.
Факторы, способствующие этому снижению, включают использование моделей в более сложных сценариях, растущую способность ИИ размышлять о собственном процессе рассуждения и повышение интеллекта систем даже без использования вербального рассуждения.
Несмотря на предупреждения, Пачоцкий не выступает за остановку разработки. Он считает, что существует сильный аргумент в пользу продолжения быстрой тренировки более интеллектуальных моделей: создание систем защиты от угроз, создаваемых другими ИИ. Ученый уделяет особое внимание кибербезопасности, отмечая, что модели становятся сверхразумными в способности проникать и избегать компьютерных систем, что повышает технологический риск. Пачоцкий утверждает, что OpenAI должна использовать самые передовые доступные модели для укрепления защиты жизненно важных инфраструктур.
В то же время он предупреждает, что необходимость построения защиты не может оправдать безответственное продвижение. По мнению Пачоцкого, понятие продвижения «за любую цену» теряет смысл перед лицом масштаба связанных рисков. Именно в этом контексте он возвращается к теме рекурсивного самосовершенствования, утверждая, что если прогресс ИИ сохранится, участие машин в собственном развитии будет расти, и RSI может сыграть центральную роль в будущих научных открытиях.
Исследователь предполагает, что научное сообщество имеет два основных варианта: вести процесс, одновременно укрепляя согласование и мониторинг, сохраняя людей активными в цикле разработки; или координировать замедление прогресса, пока не будут найдены более надежные меры безопасности. Пачоцкий считает, что наиболее подходящим подходом на данный момент является сочетание этих двух стратегий.
Он также утверждает, что развитие систем должно зависеть от доверия, установленного в мерах безопасности. Пачоцкий предлагает, чтобы такие обязательства, как Preparedness Framework от OpenAI и Responsible Scaling Policy от Anthropic, развивались до широко принятых параметров безопасности, позволяющих продолжать разработку. Эти критерии могли бы проверяться международными органами, правительствами или независимыми аудитами.
Завершая эссе, Пачоцкий заключает, что ни одна лаборатория не смогла решить проблемы согласования и мониторинга в достаточной степени, чтобы поддерживать увеличение масштаба ИИ на максимальной скорости в течение длительного периода. Он надеется, что добровольные замедления станут обычным явлением до тех пор, пока не появятся общие параметры безопасности, и выступает за то, чтобы международная координация в отношении будущего ИИ стала приоритетом для правительств. Наконец, он повторяет, что цель автоматизации исследований ИИ должна заключаться не только в создании более интеллектуальных систем, но и в том, чтобы делать это таким образом, чтобы сохранить человеческий контроль и сохранить людей вовлеченными в процесс постоянного совершенствования.

