Флагманская линейка больших языковых моделей (LLM) в Китае претерпела значительные изменения практически в одночасье. Zhipu AI выпустила и открыла исходный код модели GLM-5.3-Flash, которая была анонимным участником 'Ox Alpha', занимавшим первое место на OpenRouter с августа. Параллельно с этим Alibaba представила Qwen3.8-Flash, разместив веса на Hugging Face и в сообществе ModelScope.
Обе модели относятся к серии 'Flash' и имеют агрессивное ценообразование, что опровергает устоявшееся представление о том, что более высокая производительность всегда означает более высокую стоимость. Модель GLM-5.3-Flash поддерживает контекстное окно в один миллион токенов и является первой нативно мультимодальной моделью в семействе GLM-5, способной обрабатывать изображения, видео, файлы и даже использование компьютера.
Во время ограниченной скидки стоимость ввода для GLM-5.3-Flash составляет 0,4 юаня за миллион токенов, а вывод — 1,4 юаня, что примерно в двадцати раз дешевле, чем GLM-5.3. Qwen3.8-Flash, представленная как ранний просмотр архитектуры Qwen4, также сохраняет миллионное окно контекста. При цене 1 юань за миллион входных токенов и 3 юаня за вывод, она обходится примерно в двенадцать раз дешевле Qwen3.8-Max, при этом снижая потребление токенов на 75% в сценариях офисной работы.
Эти быстрые и сравнительные релизы оказывают давление на DeepSeek, который долгое время служил эталоном соотношения цены и производительности в Китае. Текущая цена DeepSeek V4 Flash составляет 1,5 юаня за ввод и 4,5 юаня за вывод за миллион токенов, включая множители пиковой и внепиковой нагрузки. В тестовых сравнениях GLM-5.3-Flash показала результаты, близкие к моделям класса Opus — уровню, который 'Flash' обещает достичь. Анонимный запуск этой модели завершил 56-дневное доминирование DeepSeek на OpenCode. Zhipu сообщила, что трафик обслуживался более чем 100 000 отечественных AI-чипов, эффективность которых, по их утверждению, сопоставима с основными GPU от NVIDIA.
Более глубокий сигнал заключается в стратегическом сдвиге: термин 'Flash' перестает означать просто урезанный вариант. Теперь разработчики позиционируют эти модели как настоящие флагманы благодаря большому контексту, мультимодальному вводу, конкурентному рассуждению и цене, которая делает их стандартным выбором для повседневных производственных задач в кодовых агентах и офисных пакетах.
В результате формируется рынок, где привязка к цене быстро фрагментируется. Вендоры моделей больше не конкурируют исключительно по максимальной производительности, а сосредоточены на предоставлении практических рабочих нагрузок по достаточно низкой цене, чтобы большинство разработчиков никогда не обращались к 'Pro'-уровню. На рынке LLM Китая доступность и щедрость тихо стали новым стандартом флагманского уровня.
