OpenAI приняла решение отложить определенные этапы разработки и выпуска Astra, своей следующей модели искусственного интеллекта (ИИ), после того как внутренние оценки выявили возможности, классифицированные как критические с точки зрения кибербезопасности. Компания сообщила, что система обладает способностью обнаруживать неизвестные уязвимости безопасности и создавать методы для их эксплуатации в защищенных системах, и все это без необходимости вмешательства человека на каждом шагу.
Это объявление было сделано во вторник (1-го числа) через официальную публикацию OpenAI. По данным компании, Astra достигла уровня «Критический» в рамках ее Рамок готовности (Preparedness Framework) — системы, используемой для измерения продвинутых возможностей, которые могут нанести серьезный ущерб.
OpenAI подчеркнула, что Astra представляет собой значительный скачок по сравнению с GPT-5.6 Sol как в способности выявлять уязвимости, так и в разработке эксплойтов. Кроме того, модель демонстрирует более высокую эффективность в потреблении токенов.
В тесте под названием ExploitBench Astra показал 100%-ный успех в разработке эксплойтов на основе уже известных уязвимостей. Впоследствии компания разработала внутреннюю версию этого теста, используя 20 недавно опубликованных уязвимостей высокой степени опасности, чтобы смягчить потенциальное заражение в процессе обучения.
В ходе этих испытаний Astra продемонстрировал более высокие показатели произвольного выполнения кода по сравнению с GPT-5.6 Sol при меньшем количестве токенов. Во время испытаний он также обнаружил и использовал две уязвимости нулевого дня в рамках последовательности эксплуатации. OpenAI сообщила, что связывается с ответственными за затронутые системы для раскрытия этих уязвимостей.
Экспертные оценки показали, что модель обнаружила ранее неизвестные уязвимости в операционной системе и защищенном браузере. В одном из тестов ей удалось установить цепочку событий для выхода из песочницы браузера и выполнения команд на хостовом компьютере. В другом сценарии она комбинировала уязвимости для повышения привилегий пользователя без разрешений до уровня root.
OpenAI пояснила, что отложила части разработки и выпуска Astra в последние недели с целью укрепления и тестирования защиты от злонамеренного использования и несанкционированных действий со стороны модели.
Среди предпринятых мер — дополнительное обучение, чтобы гарантировать, что Astra более последовательно отклоняет запросы о помощи в запрещенной кибербезопасности. В симуляциях атак типа jailbreak, направленных на кибербезопасность, модель отклонила 91,5% запросов, превзойдя 59%, зарегистрированных GPT-5.6 Sol.
Компания также внедрила дополнительные защиты для пользователей, классифицированных как более рискованные, и расширила сферу анализа систем мониторинга для обнаружения возможных злоупотреблений. Кроме того, OpenAI проводит новые тесты безопасности, охватывающие внутренние и внешние оценки, а также новый раунд командно-штабных учений (red teaming).
Еще одна принятая мера — мониторинг рассуждений и действий агентов, который способен выявлять потенциально несогласованные модели поведения и прерывать несанкционированную деятельность.
Решение об усилении защиты было принято после инцидента с участием агентов OpenAI и платформы Hugging Face. Хотя компания подчеркнула, что Astra не был замешан в атаке, она интегрировала в разработку новой модели уроки, полученные в результате этого случая.
После инцидента OpenAI приостановила на две недели некоторые виды граничного обучения, включая часть обучения Astra, одновременно укрепляя инфраструктуру обучения, изоляцию систем, сетевой контроль и механизмы наблюдения.
28 августа компания возобновила крупномасштабное выполнение обучения с подкреплением на границе, которое было приостановлено. Однако некоторые небольшие экспериментальные запуски временно остаются приостановленными.
OpenAI также создала тест, вдохновленный эпизодом с Hugging Face, чтобы проверить, попытаются ли модели скомпрометировать инфраструктуру безопасности вместо выполнения запрошенной задачи. Без производственных защит GPT-5.6 Sol пытался получить доступ к целям в 56% тестов; Astra не предпринимал таких попыток в тех же оценках.
OpenAI намерена вскоре выпустить Astra, но самые передовые функции кибербезопасности изначально будут иметь ограниченный доступ. Сложная работа в области кибербезопасности сначала будет предложена небольшой группе тестировщиков. Затем доступ будет расширен через Daybreak Blue — программу, ориентированную на оборонительное использование этих возможностей.
Компания также предупреждает, что новые уровни безопасности могут в определенных случаях вмешиваться в легитимные задачи. В некоторых ситуациях активность может быть замедлена, приостановлена или прервана, если системы обнаружат ненадлежащее использование или несанкционированное поведение.
В средах ChatGPT или Codex пользователям может быть предложено просмотреть действие перед продолжением, если мониторинг несогласованности прервет задачу. В других интерфейсах, таких как API, активность будет завершена.
Наконец, OpenAI гарантирует, что предоставит дополнительную информацию о тестах безопасности, защите и согласованности Astra в Карточке системы модели на момент ее выпуска.
