Alibaba Qwen jamoasi Qwen3.8-2.4T-A95B modeli uchun ochiq vaznlarni eʼlon qildi va uni faqat API orqali emas, balki yuklab olish mumkin boʻlgan birinchi Qwen-Max sinfidagi model sifatida taqdim etdi. Ekspertlar bilan bogʻliq bu kamroq zich model (sparse mixture-of-experts checkpoint) taxminan 2,4 trillion umumiy parametrga ega va 512 ta ekspert orasida har bir token uchun taxminan 95 milliard parametrni faollashtiradi, bunda har bir bosqichda 10 ta yoʻnaltirilgan ekspert va bitta umumiy ekspert ishlatiladi.
Bu modelni chiqarish Qwen-Drive va Qwen3.8 ning kichikroq kod nusxalari kabi avvalgi ochiq nashrlardan farq qiladi. U katta miqyosdagi matnli MoE ni agentlik vazifalari va fikrlash uchun oʻz muhitlarida ishlatish maqsadida joylashtiradi, nafaqat idrok yoki kodlash uchun maxsus model sifatida.
Model arxitekturasi gibrid diqqat tizimiga asoslangan boʻlib, u 92 qatorda chiziqli qatlamlarni va gate bilan toʻliq diqqatni navbatma-navbat almashtiradi. Koʻpgina qatlamlar oʻsayotgan kalit-qiymat kesh oʻrniga cheklangan rekursiv holatdan foydalanadi, shu bilan birga kichik bir qism yuqori aniqlikdagi oʻzaro taʼsirlar uchun toʻliq juft diqqatni saqlab qoladi. Bu yondashuv kontekst oynasi oʻz tabiiy hajmi atrofida 262 ming token dan taxminan bir milliongacha kengayishi bilan hisoblash xarajatlari va xotira sarfini boshqariladigan darajada ushlab turishga qaratilgan. Chiqish matnining maksimal uzunligi 128 ming tokengacha yetadi.
Ichki fikrlash nazorat mexanizmlari ishlab chiquvchilarga har bir soʻrov uchun sarflanadigan harakatlar miqdorini sozlash imkonini beradi, bu kodlash, tadqiqot, uzun hujjatlarni tahlil qilish va vositalardan foydalanish orqali tizimli koʻrsatmalar, vosita natijalari va oʻrtacha rejalar toʻplanadigan jarayonlarda kechikishni chuqurroq koʻp bosqichli izlash bilan almashtirish imkonini beradi.
Joylashtirish xizmatlari vaznlar bilan tezkor ravishda chiqarildi. Amazon Web Services SageMaker HyperPod qoʻllanmasini eʼlon qildi, bu yerda model vLLM yordamida ml.p6-b300 instansiyalarida joylashtirilishi namoyish etiladi. Ushbu qoʻllanmada klasterni sozlash, sakkizta GPU tugunida vaznlarni joylashtirish imkonini beruvchi NVFP4 kvantlash, vositalarni chaqirish va OpenAI bilan mos keladigan yakuniy nuqtada ishlaydigan koʻp tokentli bashorat bilan spekulyativ dekodlash yoritilgan.
NVIDIA ham GB300 NVL72 uskunasida SGLang, vLLM va Dynamo uchun retseptlarni taqdim etdi, oʻz testlarida FP8 formatidan foydalanganda GPU da sekundiga 4000 dan ortiq, foydalanuvchiga sekundiga 350 dan ortiq token tezligini bildirdi. Keyinchalik oʻqitish uchun NeMo AutoModel yoʻllari yoki Hugging Face checkpointlarida LoRA mavjud. Bundan tashqari, baʼzi inferens provayderlari hosting variantlarini taklif qiladi.
Ochiq checkpoint fayli faqat Qwen3.8-Max litsenziyasi ostida matnli formatda mavjud boʻlib, bu katta model xizmatlari operatorlari uchun tijoriy shartlarga ega. Shu bilan birga, bulutda taqdim etiladigan Qwen3.8-Max mahsuloti vizual va modal sozlamalar jihatidan farq qilishi mumkin. Yetkazib beruvchi tomonidan taqdim etilgan benchmarklarga koʻra, model tadqiqot va koʻrsatmalarga amal qilishda kuchli tomonlarni namoyish etadi, ammo repozitoriyning murakkabroq vazifalarida yaxshilanish potentsiali qayd etiladi.
Oʻz infratuzilmasi ichida Max sinfining quvvatiga muhtoj boʻlgan jamoalar uchun amaliy yangilik - yuklab olish mumkin boʻlgan vaznlar va bulut hamda ochiq hosting uchun tayyor retseptlarning shu davrda mavjudligi. Shunday qilib, 2,4T MoE endi operatorlar vLLM va boshqariladigan GPU-klasterlari kabi standartlashtirilgan yechimlardan foydalanayotgan joylarda ishga tushirilishi mumkin.


