DeepSeek कंपनी ने 30 सितंबर को Huawei के Ascend कंप्यूटिंग प्लेटफॉर्म के लिए बुनियादी ढांचा घटकों का एक सेट जारी किया। इन घटकों में Ascend के लिए प्रोग्रामिंग कोर TileLang का समर्थन, कंप्यूटिंग कोर लाइब्रेरी और वितरित संचार लाइब्रेरी शामिल हैं।
DeepSeek ने घोषणा की कि ये सभी घटक उन पुस्तकालयों से मेल खाते हैं जिन्हें कंपनी ने पहले NVIDIA ग्राफिक्स प्रोसेसिंग यूनिट्स के लिए जारी किया था, जिससे डेवलपर्स दोनों प्लेटफार्मों पर समान उपकरणों का उपयोग कर सकते हैं। यह रिलीज़ केवल मॉडल अनुकूलन से परे है, यह उस सॉफ़्टवेयर को प्रभावित करती है जिस पर DeepSeek की अपनी प्रशिक्षण और अनुमान प्रक्रियाएं आधारित हैं।
TileLang केंद्र में
TileLang एक प्रमुख तत्व है। DeepSeek का दावा है कि यह भाषा CUDA की तुलना में कोड लिखने को सरल बनाती है, जबकि चिप की विशेषताओं का उपयोग करने की क्षमता को बनाए रखती है। V4 श्रृंखला के प्रशिक्षण के लिए आवश्यक अधिकांश ऑपरेटर पहले ही लागू किए जा चुके हैं। Ascend के लिए संस्करण Ascend C के निम्न-स्तरीय निर्देशों को लपेटता है, और अब DeepSeek द्वारा प्रशिक्षण में उपयोग किया जाने वाला प्रत्येक TileLang ऑपरेटर के लिए Ascend पर उच्च-प्रदर्शन कार्यान्वयन उपलब्ध है। कंपनी को उम्मीद है कि यह पोर्ट विभिन्न आर्टिफिशियल इंटेलिजेंस चिप्स पर पारिस्थितिकी तंत्र सॉफ्टवेयर के लिए एक उदाहरण के रूप में काम करेगा।
मैट्रिक्स गुणन के लिए DeepGEMM-Ascend प्रस्तुत किया गया है, जो मूल DeepGEMM के साथ API संगत है और Ascend 950 उपकरणों पर BF16, FP8 और FP4 प्रारूपों का समर्थन करता है। TileKernels GPU और Huawei के NPU दोनों के लिए एक एकीकृत Python इंटरफ़ेस प्रदान करता है, जबकि FlashMLA विरल ध्यान (sparse attention) से निपटता है, और DeepSelect इंडेक्सिंग और ध्यान के नमूनाकरण के लिए टॉप-k चयन प्रदान करता है। DeepEP-Ascend Ascend 950DT NPU उपकरणों पर विशेषज्ञ मॉडल (mixture-of-experts) के लिए all-to-all प्रकार के इंटर-प्रोसेस संचार के लिए जिम्मेदार है।
Ascend 950DT NPU के लिए GitHub पेज पर FP8 शेड्यूलिंग थ्रूपुट 373 से 375 GB/s की सीमा में और EP8 पर संयुक्त थ्रूपुट 345 से 347 GB/s बताया गया है, जो DeepSeek के अनुसार हार्डवेयर सीमाओं के करीब है। ये आंकड़े परीक्षण फर्मवेयर पैकेज का उपयोग करके प्राप्त किए गए थे; DeepSeek उपयोगकर्ताओं को Huawei के लगभग 15 अक्टूबर को नियोजित वाणिज्यिक रिलीज़ की ओर निर्देशित करता है।
Huawei से समर्थन और परीक्षण परिणाम
Huawei, जिसे DeepSeek ने असीमित समर्थन के लिए धन्यवाद दिया, ने घोषणा की कि उसने संयुक्त रूप से परिभाषित सुपरनोड SuperPoD Flex और UBL128 नेटवर्क इंटरकनेक्शन स्कीम प्रदान की है। यह योजना 3.2 Tbps थ्रूपुट के साथ 128 कार्ड का स्केलेबल सिंगल-टियर नेटवर्क और 256 हजार कार्ड तक का दो-टियर स्केलिंग नेटवर्क प्रदान करती है, साथ ही उपयोगकर्ता संचार ऑपरेटरों के लिए ASC-COMM लाइब्रेरी भी प्रदान करती है। Huawei ने अपने CANN समुदाय में रेसिपी के रूप में एक संयुक्त कार्य प्रकाशित किया है, जिसमें बड़े विशेषज्ञों के साथ कम विलंबता वाले अनुमान, एक कार्ड और एक नोड पर परिनियोजन, बड़े पैमाने पर प्रशिक्षण, लंबी संदर्भ के साथ KV कैश पूलिंग और सुदृढीकरण शिक्षण शामिल हैं।
EP32 कॉन्फ़िगरेशन और 128 हजार टोकन संदर्भ के साथ ऑफ़लाइन परीक्षणों में, Huawei ने बताया कि DeepSeek-V4.1-Flash ने प्रति कार्ड 2469 आउटपुट टोकन प्रति सेकंड की गति हासिल की, जिसमें प्रति आउटपुट टोकन 5 मिलीसेकंड लगा, और फ्रेमवर्क लोड बैलेंसिंग और सेवा शेड्यूलिंग को छोड़कर 10 मिलीसेकंड पर 5102 टोकन प्रति सेकंड प्राप्त किया। घोषणा में यह उल्लेख नहीं किया गया था कि V4 ने Ascend पर बड़े पैमाने पर पूर्ण प्रशिक्षण पूरा कर लिया है या नहीं।
