चाइना मोबाइल क्लाउड ने जीपीयू और न्यूरोमॉर्फिक चिप्स पर आधारित एलएलएम इन्फेरेंस के लिए हेटेरोजेनस स्टैक प्रस्तुत किया
और पढ़ें
Pandaily
pandaily.com

चाइना मोबाइल क्लाउड ने जीपीयू और न्यूरोमॉर्फिक चिप्स पर आधारित एलएलएम इन्फेरेंस के लिए हेटेरोजेनस स्टैक प्रस्तुत किया

चाइना मोबाइल क्लाउड ने बड़े भाषा मॉडल (LLM) के मिश्रित इन्फेरेंस के लिए एक घरेलू हाइब्रिड सिस्टम प्रस्तुत की है, जो ग्राफिक्स प्रोसेसिंग यूनिट (GPU) और न्यूरोमॉर्फिक तकनीकों को जोड़ती है। इस प्रणाली का पहली बार 2026 में हेबेई प्रांत के लानफंग में कंप्यूटिंग पावर कॉन्फ्रेंस में प्रदर्शन किया गया था।

इस स्टैक के विकास में चाइना मोबाइल क्लाउड के साथ-साथ चाइना इलेक्ट्रॉनिक्स टेक्नोलॉजी नानहू रिसर्च इंस्टीट्यूट, लिनक्सी, इलुवतार कोरएक्स, किंग राजवंश विश्वविद्यालय और बीजिंग विश्वविद्यालय शामिल थे। चाइना मोबाइल क्लाउड की न्यूरोमॉर्फिक और ऑप्टिकल प्रयोगशाला के तकनीकी निदेशक, डू युजियान ने इस बात पर जोर दिया कि न्यूरोमॉर्फिक क्षमताएं मौजूदा जीपीयू पार्कों को तेज करने के लिए हैं, न कि उन्हें पूरी तरह से बदलने के लिए।

मूल अवधारणा विभिन्न प्रकार के चिप्स के बीच ट्रांसफार्मर के कार्य के स्पष्ट विभाजन पर आधारित है। अटेंशन गणना इलुवतार कोरएक्स के घरेलू जीपीयू पर रहती है, जो उनकी सामान्य बैंडविड्थ का उपयोग करती है। फॉरवर्ड पास ब्लॉक (feed-forward network blocks), जिसमें मिक्सचर-ऑफ-एक्सपर्ट्स तंत्र वाले विशेषज्ञ शामिल हैं, जो विलंबता के लिए महत्वपूर्ण हैं, उन्हें लिनक्सी न्यूरोमॉर्फिक सिलिकॉन पर स्थानांतरित कर दिया जाता है। यह सिलिकॉन मेमोरी में गणना और क्रिस्टल पर बड़ी मात्रा में SRAM के लिए अनुकूलित है, जो एक ही आर्किटेक्चर वाले जीपीयू क्लस्टरों में उच्च प्रतिस्पर्धा वाले टोकन को संभालते समय 'मेमोरी वॉल' और 'पावर वॉल' द्वारा बनाए गए दबाव को कम करने में मदद करता है।

इन दोनों संरचनाओं के सिंक्रनाइज़ेशन को सुनिश्चित करने के लिए एक स्व-विकसित मॉडल कंपाइलर, एक हाई-स्पीड इंटरकनेक्ट प्रोटोकॉल और एक यूनिफाइड इन्फेरेंस मैकेनिज्म का उपयोग किया जाता है, जो कार्यों के विघटन, संयुक्त शेड्यूलिंग और परिणामों के समेकन के लिए जिम्मेदार होते हैं।

परीक्षण लोड के रूप में डीपसीक V4 फ्लैश का चयन किया गया था। चाइना मोबाइल क्लाउड का दावा है कि अन्य घरेलू जीपीयू क्लस्टरों की तुलना में, यह हाइब्रिड स्टैक इन्फेरेंस आउटपुट और ऊर्जा दक्षता को दोगुने से अधिक बढ़ाता है, और व्यवसाय के परिचालन खर्चों को 40% से अधिक कम करता है। भागीदार इन आंकड़ों को परिपक्व घरेलू प्रक्रियाओं पर आधारित वास्तुकला के कारण वृद्धि बताते हैं, सिस्टम सॉफ्टवेयर और वर्कलोड प्लेसमेंट पर ध्यान केंद्रित करते हैं, न कि केवल प्रक्रिया और नोड की दौड़ पर। उनका मानना है कि इस मॉडल को अन्य ऑपरेटर भी दोहरा सकते हैं जो पहले से ही घरेलू जीपीयू का उपयोग कर रहे हैं।

कॉन्फ्रेंस सामग्री यह भी बताती है कि इस PD और Attention-FFN विभाजन के लिए अगले कार्यान्वयन लक्ष्य टोकन फैक्ट्रियां, एआई एन्कोडिंग, टेक्स्ट-टू-वीडियो रूपांतरण, मल्टी-एजेंट इंटरेक्शन, इंटेलिजेंट मैन्युफैक्चरिंग, और वित्तीय और संचार सुरक्षा हैं।

संघ ने हेटेरोजेनस इंजन को बेहतर बनाने और धीरे-धीरे मुख्य फ्रेमवर्क के हिस्सों को घरेलू जीपीयू निर्माताओं, न्यूरोमॉर्फिक चिप्स और कंप्यूटिंग ऑपरेटरों के लिए खोलने की योजनाओं की घोषणा की। प्रति टोकन लागत पर केंद्रित क्लाउड सेवाओं के खरीदारों के लिए, यह डेब्यू केवल एक एक्सेलेरेटर का राज्याभिषेक नहीं है, बल्कि यह जांच करना है कि क्या अटेंशन-ऑन-जीपीयू प्लस MoE FFN-ऑन-न्यूरोमॉर्फिक योजना कॉन्फ्रेंस बूथ से ट्रैफिक निकलने के बाद विलंबता, आउटपुट और उपयोगिता को बनाए रख सकती है। लॉन्च के समय, भागीदारों की DeepSeek V4 Flash सेटिंग्स से अलग कोई तृतीय-पक्ष क्लस्टर स्वतंत्र बेंचमार्क प्रकाशित नहीं किए गए थे; कंप्यूटिंग पावर कॉन्फ्रेंस में डेब्यू मुख्य रूप से एक पुनरुत्पादनीय सॉफ्टवेयर और सिलिकॉन नुस्खा प्रलेखित करता है, न कि तैयार क्षमता SKU।

लोकप्रिय