अलीबाबा ने पहली Qwen-Max MoE क्लास मॉडल के रूप में Qwen3.8-2.4T-A95B के खुले वज़न जारी किए
और पढ़ें
Pandaily
pandaily.com

अलीबाबा ने पहली Qwen-Max MoE क्लास मॉडल के रूप में Qwen3.8-2.4T-A95B के खुले वज़न जारी किए

अलीबाबा Qwen टीम ने Qwen3.8-2.4T-A95B मॉडल के लिए खुले वज़न प्रकाशित किए हैं, इसे डाउनलोड के लिए उपलब्ध पहली Qwen-Max क्लास मॉडल के रूप में प्रस्तुत किया है, न कि केवल एपीआई के माध्यम से। यह स्पार्स एक्सपर्ट्स वाला मॉडल (स्पार्स मिक्सचर-ऑफ-एक्सपर्ट्स चेकपॉइंट) लगभग 2.4 ट्रिलियन साझा पैरामीटर रखता है और 512 विशेषज्ञों में से प्रत्येक टोकन पर लगभग 95 बिलियन पैरामीटर सक्रिय करता है, जिसमें प्रत्येक चरण में एक सामान्य विशेषज्ञ के साथ 10 रूट किए गए विशेषज्ञ उपयोग किए जाते हैं।

इस मॉडल का जारी होना Qwen के पिछले खुले रिलीज़, जैसे Qwen-Drive और छोटे Qwen3.8 कोड स्नैपशॉट से अलग है। यह बड़े पैमाने पर टेक्स्ट MoE को एजेंटिक कार्यों और तर्क के लिए अपने स्वयं के वातावरण में उपयोग करने के लिए स्थापित करता है, न कि धारणा या एन्कोडिंग के लिए एक विशिष्ट मॉडल के रूप में।

मॉडल की वास्तुकला एक हाइब्रिड अटेंशन सिस्टम पर आधारित है, जो 92 परतों में लीनियर लेयर्स और गेटिंग और फुल अटेंशन को बारी-बारी से उपयोग करता है। अधिकांश परतें बढ़ते कुंजी-मूल्य कैश के बजाय सीमित पुनरावर्ती स्थिति का उपयोग करती हैं, जबकि एक छोटा हिस्सा उच्च-सटीकता इंटरैक्शन के लिए पूर्ण पेयर-वाइज अटेंशन बनाए रखता है। इस दृष्टिकोण का उद्देश्य संदर्भ विंडो के देशी आकार के लगभग 262 हजार टोकन से लेकर विस्तार के साथ लगभग दस लाख तक स्केल होने पर कम्प्यूटेशनल लागत और मेमोरी उपयोग को प्रबंधनीय रखना है। अधिकतम आउटपुट टेक्स्ट लंबाई 128 हजार टोकन तक है।

अंतर्निहित रीजनिंग कंट्रोल मैकेनिज्म डेवलपर्स को प्रति अनुरोध प्रयास की मात्रा को समायोजित करने की अनुमति देते हैं, जो कोडिंग, अनुसंधान, लंबे दस्तावेज़ विश्लेषण और टूल का उपयोग करके वर्कफ़्लो में अधिक गहन मल्टी-स्टेज ट्रेसिंग के बदले विलंबता का आदान-प्रदान करते हैं, जो सिस्टम प्रॉम्प्ट, टूल आउटपुट और मध्यवर्ती योजनाओं को संचित करते हैं।

डिप्लॉयमेंट सेवाएं वज़न के साथ जल्दी से जारी की गईं। अमेज़ॅन वेब सर्विसेज ने SageMaker HyperPod पर एक गाइड प्रकाशित किया, जो ml.p6-b300 इंस्टेंस पर vLLM का उपयोग करके मॉडल को तैनात करने का प्रदर्शन करता है। इस गाइड में क्लस्टर सेटअप, NVFP4 क्वांटाइजेशन शामिल है, जो आठ-जीपीयू नोड पर वज़न को रखने की अनुमति देता है, टूल कॉलिंग और मल्टी-थ्रेडिंग पूर्वानुमान के साथ स्यूडोडेकोडिंग, जो ओपनएआई-संगत एंडपॉइंट पर काम करता है।

एनवीडिया ने भी GB300 NVL72 हार्डवेयर पर SGLang, vLLM और Dynamo के लिए रेसिपी प्रदान की, जिसमें अपने स्वयं के परीक्षणों में FP8 प्रारूप का उपयोग करते हुए जीपीयू पर 4000 टोकन प्रति सेकंड से अधिक और उपयोगकर्ता प्रति 350 टोकन प्रति सेकंड से अधिक की गति बताई गई। Hugging Face चेकपॉइंट्स पर फाइन-ट्यूनिंग या LoRA के लिए NeMo AutoModel पथ उपलब्ध हैं। इसके अलावा, कुछ इन्फेरेंस प्रदाता होस्टिंग विकल्प प्रदान करते हैं।

खुला चेकपॉइंट केवल Qwen3.8-Max लाइसेंस के तहत पाठ प्रारूप में उपलब्ध है, जिसमें बड़े मॉडल सेवा ऑपरेटरों के लिए वाणिज्यिक शर्तें हैं। हालांकि, क्लाउड में प्रदान किया गया Qwen3.8-Max उत्पाद दृश्य और मोडल सेटिंग्स के मामले में भिन्न हो सकता है। विक्रेता द्वारा प्रस्तुत बेंचमार्क के अनुसार, मॉडल अनुसंधान और निर्देश पालन में मजबूत पक्ष दिखाता है, जबकि रिपॉजिटरी में अधिक जटिल कार्यों में सुधार की क्षमता पर प्रकाश डाला गया है।

उन टीमों के लिए जिन्हें अपनी आंतरिक बुनियादी ढांचे के भीतर मैक्स क्लास की शक्ति की आवश्यकता है, व्यावहारिक खबर डाउनलोड करने योग्य वज़न और क्लाउड और ओपन होस्टिंग के लिए तैयार रेसिपी का संयोजन है, जो उसी अवधि में उपलब्ध थे। इस प्रकार, 2.4T MoE अब वहां चलाया जा सकता है जहां ऑपरेटर पहले से ही vLLM जैसे मानकीकृत समाधानों और प्रबंधित जीपीयू क्लस्टर्स का उपयोग कर रहे हैं।

लोकप्रिय