Компания Zhipu AI официально объявила, что анонимная модель Ox Alpha, известная в кругах китайских разработчиков как «Niu Lai», представляет собой недавно выпущенную модель GLM-5.3-Flash. До своего официального запуска модель предоставлялась бесплатно для анонимного тестирования на платформах OpenRouter и OpenCode. За пять дней тестирование привлекло более 50 триллионов токенов трафика, установив рекорды роста на обеих площадках. При этом использование этой модели превысило показатели DeepSeek более чем в два раза.
Внимание рынка привлекло дополнительное уточнение от Zhipu: весь этот трафик обслуживался с помощью отечественных чипов. В технической документации компания указала, что ее сервис инференса функционирует на кластере, состоящем из свыше 100 000 отечественных чипов. Zhipu заявила, что «эффективность оборудования и стоимость одного токена достигли уровня, сравнимого с основными графическими процессорами Nvidia».
Исследовательская фирма в области полупроводников SemiAnalysis прокомментировала в X, что обслуживание каждого запроса с использованием отечественного кремния при эффективности, сопоставимой с Nvidia, «снова подвергает испытанию море CUDA», особенно после объявления OpenAI о собственном чипе для инференса Jalapeño. LatePost сообщила, что эти чипы могут быть произведены Huawei, Moore Threads и Hygon, однако Zhipu отказалась подтверждать поставщиков или конкретные модели.
Для масштабирования до контекстного окна в один миллион токенов Zhipu разработала специализированный движок инференса на базе SGLang. Этот движок использует квантизацию W8A8, смешанную квантизацию кэша INT8/FP8/BF16 и тензорное параллелизм на уровне узлов. Кроме того, была внедрена архитектура, разделяющая кодирование, предварительную обработку промпта и декодирование токен за токеном, что позволяет независимо планировать различные пулы.
Компания утверждает, что производительность сквозного сервиса улучшилась в три раза по сравнению с первоначальной базовой линией на том же оборудовании. Модель GLM-5.3-Flash обладает общим количеством параметров в 320 миллиардов, при этом активировано 18 миллиардов, что примерно соответствует DeepSeek V4 Flash. Она набирает 57 баллов в Индексе искусственного анализа интеллекта, что сопоставимо с Claude Opus 4.8 и превосходит DeepSeek V4 Pro. Стоимость модели составляет около одной десятой цены GLM-5.3 и одной сотой цены Claude Opus 4.8, что делает ее доступным вариантом на фоне общего повышения цен на китайские модели.
