Китайская компания Z.ai объявила в пятницу (14-го числа), что ее модель искусственного интеллекта GLM-5.3 продемонстрировала немного более высокие показатели, чем Mythos 5 от Anthropic, в тесте, направленном на выявление уязвимостей в программном обеспечении. Этот результат ставит китайскую технологию в ряд систем ИИ, способных выполнять сложные задачи в области кибербезопасности.
В рамках оценки CyberGym, которая измеряет способность анализировать код, находить ошибки и подтверждать их эксплуатируемость, GLM-5.3 показал 84,5% против 83,8% у Mythos 5. Однако эти цифры были опубликованы самой Z.ai и еще не прошли независимую проверку.
Преимущество китайской модели исчезло на этапе, более близком к практическому проведению атак. В тесте ExploitBench модель Z.ai набрала 54,4%, тогда как система Anthropic достигла 78%, что указывает на то, что Mythos 5 сохраняет значительное преимущество, когда задача требует преобразования выявленных уязвимостей в фактические эксплойты.
Z.ai планирует сделать GLM-5.3 общедоступным примерно через две недели. До этого времени компания утверждает, что завершит оценки безопасности и улучшит механизмы, предназначенные для предотвращения злонамеренного использования. Наиболее чувствительные функции изначально будут ограничены пользователями, прошедшими верификацию через программу доверенного доступа.
Эта стратегия представляет собой существенное изменение для модели, которую компания намерена распространять открыто. Основная обеспокоенность заключается в том, что системы, способные находить уязвимости, также могут способствовать атакам, особенно если их веса могут быть загружены, изменены и связаны с другими инструментами.
Компания заявляет, что разработала различные барьеры для снижения этого риска. Среди них имеются фильтры для потенциально опасных запросов, механизмы отслеживания активности модели и специальное обучение, чтобы система отказывалась от запросов, считающихся вредоносными.
По данным Z.ai, эти защитные меры призваны отделить наступательные действия от законных применений, таких как устранение неполадок, изучение цифровой безопасности и авторизованные проверки систем. Критики указывают на то, что часть этих контролей может потерять свою эффективность после того, как модель начнет свободно распространяться и может быть изменена третьими сторонами.
Опасения по поводу открытости моделей стали одной из причин, названных компанией для установления периода ограниченного доступа. Первоначальный запуск будет предназначен для отобранной группы партнеров, с последующим расширением на основе процесса, который Z.ai описывает как постепенный и ответственный.
Габриэль Вагнер, исследователь в области управления искусственным интеллектом из Concordia AI, оценил, что это решение имеет значение для китайского сценария открытых моделей безопасности. По его мнению, отсрочка запуска по соображениям безопасности является признаком зрелости практик управления рисками, связанных с распространением весов систем ИИ.
Эта стратегия также устанавливает параллель с проектом Project Glasswing от Anthropic, который ограничивает доступ к Mythos 5 только для предварительно оцененных организаций. Однако в китайском случае Z.ai пытается представить открытость модели как центральную часть своего предложения, а не как коммерческую или безопасностную уязвимость.
Z.ai утверждает, что передовые системы цифровой защиты не должны концентрироваться у нескольких поставщиков закрытых моделей. Компания отстаивает мнение, что разработчики открытых проектов и небольшие команды по безопасности также должны иметь возможность использовать такие ресурсы.
В рамках этого предложения компания анонсировала Open Source Shield — инициативу, предназначенную для оценки определенных проектов с открытым исходным кодом, предоставления возможности использования модели для оборонительных целей и включения функций аудита кода в ZCode, свой продукт, ориентированный на программирование.
Производительность GLM-5.3 также должна быть проанализирована в задачах, требующих большей продолжительности. В отдельной оценке Z.ai сообщила, что система выполнила 105 задач по разработке атак за два часа и 130 за шесть часов. Mythos 5 за те же промежутки времени выполнил 181 и 247 задач.
Anthropic приняла более ограничительную стратегию в отношении Mythos. Компания выпустила систему, основанную на Claude Fable 5, с удаленными функциями кибербезопасности, только для организаций, прошедших предварительную оценку.
GLM-5.3 не был создан исключительно как инструмент безопасности. Z.ai представляет его как общую модель программирования, которая прошла дополнительное обучение и обучение с подкреплением для расширения своей деятельности в сфере кибербезопасности. Компания утверждает, что начала с той же базы, что и GLM-5.2, и расширила обучение с помощью более обширных и разнообразных сред задач.
Этот шаг произошел после роста популярности GLM-5.2 среди разработчиков из разных стран. Предыдущая модель завоевала популярность благодаря своим возможностям программирования и работы в качестве агента, при этом пользователи и аналитики отмечали производительность, близкую к передовым североамериканским системам, но при значительно меньшей стоимости.
Конкуренция также включает другие китайские компании. В июне компания по кибербезопасности 360 заявила, что ее система Tulongfeng достигла эквивалентной способности Mythos путем объединения моделей ИИ, информации о безопасности и автоматизированных инструментов. Это заявление, как и цифры, представленные Z.ai о GLM-5.3, не было независимо подтверждено.
В прошлом месяце Hugging Face сообщила, что использовала GLM-5.2 для защиты от вторжения, приписываемого агенту искусственного интеллекта OpenAI. Этот инцидент укрепил интерес к использованию китайских моделей в оборонительных операциях и показал, что технология уже применялась в реальных сценариях безопасности.