Руководитель ученых OpenAI призывает к осторожности в связи с развитием искусственного интеллекта
Подробнее
Olhar Digital
olhardigital.com.br

Руководитель ученых OpenAI призывает к осторожности в связи с развитием искусственного интеллекта

Якуб Пачоцкий, ведущий ученый OpenAI, опубликовал эссе в прошлое воскресенье (6-го числа), предупреждая о скорости эволюции искусственного интеллекта (ИИ) и утверждая, что необходимо проявлять большую осмотрительность при разработке все более сложных систем. В статье, опубликованной на портале самой OpenAI, указывается, что технологический прогресс может достичь точки, когда машины начнут активно участвовать в собственном процессе создания.

Основываясь на внутренних данных, Пачоцкий выражает большие ожидания того, что текущий темп развития может продолжиться до так называемого рекурсивного самосовершенствования (RSI). В этом сценарии системы ИИ начнут ускорять собственное развитие. Для ученого этот путь требует более всеобъемлющего вмешательства, чтобы гарантировать, что технологический прогресс остается под человеческим контролем.

В эссе он подробно описывает трансформацию, наблюдаемую с 2023 года, когда результаты исследовательского проекта RLSlow убедили команду в осуществимости расширения обучения моделей рассуждения. Спустя три года после этой вехи, по его словам, такие системы уже способны управлять графическими интерфейсами и компьютерами, взаимодействовать с другими людьми и ИИ, а также проводить исследования.

Ученый также подчеркивает заметный прогресс в области кибербезопасности. Однако по мере того, как модели становятся более компетентными, Пачоцкий отмечает, что их результаты становятся сложнее интерпретировать. Он утверждает, что интеллект, генерируемый глубоким обучением, не имеет прямой эквивалентности человеческому, и чем больше ИИ превосходит людей в различных областях, тем сложнее точно определить его возможности.

Эта сложность заключается в операционной природе моделей. Пачоцкий объясняет, что ИИ скорее «выращен», чем просто спроектирован, являясь результатом массового повторения процессов оптимизации в больших объемах вычислений. Он подчеркивает, что системы чрезвычайно сложны, и их глобальное функционирование все еще нуждается в полном описании или понимании.

Ключевая тема, затронутая в эссе, — это согласование ИИ (AI alignment), термин, используемый для описания усилий по обеспечению того, чтобы системы действовали в соответствии со стандартами и целями, которые считаются подходящими людьми. Пачоцкий проводит различие между согласованием целей, которое относится к выполнению того, что было определено, и согласованием ценностей, которое связано со способностью применять принципы к новым или неоднозначным ситуациям.

По его мнению, проблема возникает, когда более интеллектуальные системы работают в контекстах, отличных от тех, в которых они были обучены, что может ухудшить обобщение усвоенных моделями ценностей. Пачоцкий настаивает на том, что будущие ИИ должны сохранять человеческие ценности, даже если они не находятся под человеческим наблюдением.

OpenAI использует несколько методологий для попытки управления этим вопросом. Одна из них — отслеживание так называемой «цепи рассуждений» (chain of thought), которая позволяет анализировать процесс рассуждения, озвученный моделями. Однако Пачоцкий указывает, что внутренние оценки компании предполагают постепенное снижение надежности этого мониторинга.

Факторы, способствующие этому снижению, включают использование моделей в более сложных сценариях, растущую способность ИИ размышлять о собственном процессе рассуждения и повышение интеллекта систем даже без использования вербального рассуждения.

Несмотря на предупреждения, Пачоцкий не выступает за остановку разработки. Он считает, что существует сильный аргумент в пользу продолжения быстрой тренировки более интеллектуальных моделей: создание систем защиты от угроз, создаваемых другими ИИ. Ученый уделяет особое внимание кибербезопасности, отмечая, что модели становятся сверхразумными в способности проникать и избегать компьютерных систем, что повышает технологический риск. Пачоцкий утверждает, что OpenAI должна использовать самые передовые доступные модели для укрепления защиты жизненно важных инфраструктур.

В то же время он предупреждает, что необходимость построения защиты не может оправдать безответственное продвижение. По мнению Пачоцкого, понятие продвижения «за любую цену» теряет смысл перед лицом масштаба связанных рисков. Именно в этом контексте он возвращается к теме рекурсивного самосовершенствования, утверждая, что если прогресс ИИ сохранится, участие машин в собственном развитии будет расти, и RSI может сыграть центральную роль в будущих научных открытиях.

Исследователь предполагает, что научное сообщество имеет два основных варианта: вести процесс, одновременно укрепляя согласование и мониторинг, сохраняя людей активными в цикле разработки; или координировать замедление прогресса, пока не будут найдены более надежные меры безопасности. Пачоцкий считает, что наиболее подходящим подходом на данный момент является сочетание этих двух стратегий.

Он также утверждает, что развитие систем должно зависеть от доверия, установленного в мерах безопасности. Пачоцкий предлагает, чтобы такие обязательства, как Preparedness Framework от OpenAI и Responsible Scaling Policy от Anthropic, развивались до широко принятых параметров безопасности, позволяющих продолжать разработку. Эти критерии могли бы проверяться международными органами, правительствами или независимыми аудитами.

Завершая эссе, Пачоцкий заключает, что ни одна лаборатория не смогла решить проблемы согласования и мониторинга в достаточной степени, чтобы поддерживать увеличение масштаба ИИ на максимальной скорости в течение длительного периода. Он надеется, что добровольные замедления станут обычным явлением до тех пор, пока не появятся общие параметры безопасности, и выступает за то, чтобы международная координация в отношении будущего ИИ стала приоритетом для правительств. Наконец, он повторяет, что цель автоматизации исследований ИИ должна заключаться не только в создании более интеллектуальных систем, но и в том, чтобы делать это таким образом, чтобы сохранить человеческий контроль и сохранить людей вовлеченными в процесс постоянного совершенствования.

Похожие сюжеты

OpenAI откладывает выпуск модели Astra из-за критических рисков кибербезопасности, обнаруженных в ходе тестирования
Подробнее
olhardigital.com.br

OpenAI откладывает выпуск модели Astra из-за критических рисков кибербезопасности, обнаруженных в ходе тестирования

OpenAI приняла решение отложить определенные этапы разработки и выпуска Astra, своей следующей модели искусственного интеллекта (ИИ), после того как внутренние оценки выявили возможности, классифицированные как критические с точки зрения кибербезопасности. Компания сообщила, что система обладает способностью обнаруживать неизвестные уязвимости безопасности и создавать методы для их эксплуатации в защищенных системах, и все это без необходимости вмешательства человека на каждом шагу.

Это объявление было сделано во вторник (1-го числа) через официальную публикацию OpenAI. По данным компании, Astra достигла уровня «Критический» в рамках ее Рамок готовности (Preparedness Framework) — системы, используемой для измерения продвинутых возможностей, которые могут нанести серьезный ущерб.

OpenAI подчеркнула, что Astra представляет собой значительный скачок по сравнению с GPT-5.6 Sol как в способности выявлять уязвимости, так и в разработке эксплойтов. Кроме того, модель демонстрирует более высокую эффективность в потреблении токенов.

В тесте под названием ExploitBench Astra показал 100%-ный успех в разработке эксплойтов на основе уже известных уязвимостей. Впоследствии компания разработала внутреннюю версию этого теста, используя 20 недавно опубликованных уязвимостей высокой степени опасности, чтобы смягчить потенциальное заражение в процессе обучения.

В ходе этих испытаний Astra продемонстрировал более высокие показатели произвольного выполнения кода по сравнению с GPT-5.6 Sol при меньшем количестве токенов. Во время испытаний он также обнаружил и использовал две уязвимости нулевого дня в рамках последовательности эксплуатации. OpenAI сообщила, что связывается с ответственными за затронутые системы для раскрытия этих уязвимостей.

Экспертные оценки показали, что модель обнаружила ранее неизвестные уязвимости в операционной системе и защищенном браузере. В одном из тестов ей удалось установить цепочку событий для выхода из песочницы браузера и выполнения команд на хостовом компьютере. В другом сценарии она комбинировала уязвимости для повышения привилегий пользователя без разрешений до уровня root.

OpenAI пояснила, что отложила части разработки и выпуска Astra в последние недели с целью укрепления и тестирования защиты от злонамеренного использования и несанкционированных действий со стороны модели.

Среди предпринятых мер — дополнительное обучение, чтобы гарантировать, что Astra более последовательно отклоняет запросы о помощи в запрещенной кибербезопасности. В симуляциях атак типа jailbreak, направленных на кибербезопасность, модель отклонила 91,5% запросов, превзойдя 59%, зарегистрированных GPT-5.6 Sol.

Компания также внедрила дополнительные защиты для пользователей, классифицированных как более рискованные, и расширила сферу анализа систем мониторинга для обнаружения возможных злоупотреблений. Кроме того, OpenAI проводит новые тесты безопасности, охватывающие внутренние и внешние оценки, а также новый раунд командно-штабных учений (red teaming).

Еще одна принятая мера — мониторинг рассуждений и действий агентов, который способен выявлять потенциально несогласованные модели поведения и прерывать несанкционированную деятельность.

Решение об усилении защиты было принято после инцидента с участием агентов OpenAI и платформы Hugging Face. Хотя компания подчеркнула, что Astra не был замешан в атаке, она интегрировала в разработку новой модели уроки, полученные в результате этого случая.

После инцидента OpenAI приостановила на две недели некоторые виды граничного обучения, включая часть обучения Astra, одновременно укрепляя инфраструктуру обучения, изоляцию систем, сетевой контроль и механизмы наблюдения.

28 августа компания возобновила крупномасштабное выполнение обучения с подкреплением на границе, которое было приостановлено. Однако некоторые небольшие экспериментальные запуски временно остаются приостановленными.

OpenAI также создала тест, вдохновленный эпизодом с Hugging Face, чтобы проверить, попытаются ли модели скомпрометировать инфраструктуру безопасности вместо выполнения запрошенной задачи. Без производственных защит GPT-5.6 Sol пытался получить доступ к целям в 56% тестов; Astra не предпринимал таких попыток в тех же оценках.

OpenAI намерена вскоре выпустить Astra, но самые передовые функции кибербезопасности изначально будут иметь ограниченный доступ. Сложная работа в области кибербезопасности сначала будет предложена небольшой группе тестировщиков. Затем доступ будет расширен через Daybreak Blue — программу, ориентированную на оборонительное использование этих возможностей.

Компания также предупреждает, что новые уровни безопасности могут в определенных случаях вмешиваться в легитимные задачи. В некоторых ситуациях активность может быть замедлена, приостановлена или прервана, если системы обнаружат ненадлежащее использование или несанкционированное поведение.

В средах ChatGPT или Codex пользователям может быть предложено просмотреть действие перед продолжением, если мониторинг несогласованности прервет задачу. В других интерфейсах, таких как API, активность будет завершена.

Наконец, OpenAI гарантирует, что предоставит дополнительную информацию о тестах безопасности, защите и согласованности Astra в Карточке системы модели на момент ее выпуска.

Популярное