Команда Alibaba Qwen опубликовала открытые веса для модели Qwen3.8-2.4T-A95B, представив ее как первую модель класса Qwen-Max, доступную для скачивания, а не только через API. Эта разреженная модель с экспертами (sparse mixture-of-experts checkpoint) содержит около 2,4 триллиона общих параметров и активирует примерно 95 миллиардов параметров на каждый токен среди 512 экспертов, причем на каждом шаге используются 10 маршрутизированных экспертов плюс один общий эксперт.
Выпуск этой модели отличается от предыдущих открытых релизов Qwen, таких как Qwen-Drive и меньшие снимки кода Qwen3.8. Он позиционирует крупномасштабную текстовую MoE для использования в собственных средах для агентских задач и рассуждений, а не как узкоспециализированную модель для восприятия или кодирования.
Архитектура модели основана на гибридной системе внимания, которая чередует линейные слои с гейтированием и полное внимание в течение 92 слоев. Большинство слоев используют ограниченное рекуррентное состояние вместо растущего кэша ключа-значения, в то время как небольшая часть сохраняет полное парное внимание для высокоточных взаимодействий. Такой подход призван сохранить вычислительные затраты и потребление памяти управляемыми по мере масштабирования контекстного окна от нативного размера около 262 тысяч токенов до приблизительно одного миллиона с расширением. Максимальная длина выходного текста составляет до 128 тысяч токенов.
Встроенные механизмы контроля рассуждений позволяют разработчикам регулировать объем усилий на каждый запрос, обменивая задержку на более глубокие многоэтапные трассировки в задачах кодирования, исследований, анализа длинных документов и рабочих процессов с использованием инструментов, которые накапливают системные подсказки, результаты работы инструментов и промежуточные планы.
Сервисы для развертывания были быстро выпущены вместе с весами. Amazon Web Services опубликовала руководство по SageMaker HyperPod, демонстрирующее развертывание модели с использованием vLLM на экземплярах ml.p6-b300. В этом руководстве освещаются настройка кластера, квантование NVFP4, позволяющее разместить веса на восьми-GPU узле, вызов инструментов и спекулятивное декодирование с многотоковым прогнозированием, работающее за конечной точкой, совместимой с OpenAI.
NVIDIA также предоставила рецепты для SGLang, vLLM и Dynamo на оборудовании GB300 NVL72, сообщив о скорости более 4000 токенов в секунду на GPU и свыше 350 токенов в секунду на пользователя при использовании формата FP8 в собственных тестах. Доступны пути NeMo AutoModel для последующего обучения с учителем или LoRA на контрольных точках Hugging Face. Кроме того, некоторые провайдеры инференса предлагают варианты хостинга.
Открытый контрольный файл доступен только в текстовом формате под лицензией Qwen3.8-Max с коммерческими условиями для операторов сервисов больших моделей. При этом продукт Qwen3.8-Max, предоставляемый в облаке, может отличаться в части визуальных и модальных настроек. Согласно бенчмаркам, представленным вендором, модель демонстрирует сильные стороны в исследованиях и следовании инструкциям, при этом отмечается потенциал для улучшения в более сложных задачах репозитория.
Для команд, которым требуется мощность класса Max внутри собственной инфраструктуры, практическая новость заключается в сочетании скачиваемых весов и готовых рецептов для облачного и открытого хостинга, доступных в тот же период. Таким образом, 2,4T MoE теперь можно запустить там, где операторы уже используют стандартизированные решения вроде vLLM и управляемые GPU-кластеры.



