Cambricon ने ओपन इन्फेरेंस स्टैक vLLM के आधार पर Day-0 कार्यक्रम के हिस्से के रूप में DeepSeek-V4.1-Flash मॉडल के सफल अनुकूलन की घोषणा की है। इसका मतलब है कि हाल ही में जारी किए गए मॉडल को उस दिन Cambricon के एक्सेलेरेटर पर स्थिर रूप से चलाया जा सकता है जिस दिन DeepSeek ने चेकपॉइंट प्रकाशित किया था।
यह घोषणा चिप और सॉफ्टवेयर के बीच तालमेल पर प्रकाश डालती है: मॉडल और चिप की एक साथ उपलब्धता, और Cambricon के NeuWare और vLLM को संयोजित करने वाले दृष्टिकोण की परिपक्वता। यह स्वयं मॉडल की सामान्य उपलब्धता के बारे में जानकारी को दोहराना नहीं है।
DeepSeek-V4.1-Flash DeepSeek की नई आर्किटेक्चरल श्रृंखला का सबसे छोटा संस्करण है। यह 552 बिलियन पैरामीटर वाला एक मिश्रण-के-विशेषज्ञ (mixture-of-experts) प्रकार का मॉडल है जो इनपुट साइड पर लगभग 8 बिलियन और आउटपुट साइड पर 16 बिलियन पैरामीटर सक्रिय करता है, और इसमें मल्टीमॉडल विजन की अंतर्निहित समझ भी है। DeepSeek ने Causal-Encoder-Decoder संरचना और KV-कैश के आक्रामक संपीड़न का उपयोग करने पर जोर दिया है, जिससे पिछले पीढ़ी की तुलना में HBM की आवश्यकता लगभग एक चौथाई और SSD की आवश्यकता आठवें हिस्से तक कम हो जाती है, जबकि कैश का आकार पहले संस्करण की तुलना में सैकड़ों गुना छोटा होता है।
ये मेमोरी बचत एक्सेलेरेटर निर्माताओं के लिए महत्वपूर्ण हैं जो सघन सर्वरों पर इन्फेरेंस विलंबता, DRAM की मात्रा और भंडारण स्तरों को नियंत्रित करना चाहते हैं, जिन पर पहले से ही HBM बजट पर दबाव पड़ रहा है।
अपनी ओर से, Cambricon के इंजीनियरों ने Engram और Compressor जैसी संरचनाओं को तेज करने के लिए Torch-MLU-Ops लाइब्रेरी का उपयोग किया, और विरल और संपीड़ित ध्यान के हॉटस्पॉट के लिए BangC पर अनुकूलित कर्नेल लिखे। vLLM के भीतर, Cambricon पांच-आयामी मिश्रित समानांतरवाद का समर्थन करने का दावा करता है, जिसमें टेंसर, पाइपलाइन, अनुक्रमिक, बैच और विशेषज्ञ समानांतरवाद शामिल है, जिसमें संचार और गणना का ओवरलैप, कम सटीकता क्वांटाइजेशन और एंड-टू-एंड थ्रूपुट बढ़ाने के लिए प्रीफाइल और डीकोडिंग विभाजन शामिल है। यह स्टैक कंपनी के दीर्घकालिक सॉफ्टवेयर प्लेटफॉर्म, NeuWare पर काम करता है।
कुछ दिन पहले, Cambricon पायटॉर्च फाउंडेशन में प्लैटिनम सदस्य के रूप में शामिल हुआ, अन्य प्रमुख हार्डवेयर और क्लाउड सेवा डेवलपर्स के साथ प्रबंधन बोर्ड में जगह बनाई, जो ओपन लर्निंग और इन्फेरेंस इकोसिस्टम में गहरे निवेश का संकेत देता है।
अब Cambricon पाँच प्रमुख चीनी मॉडल लाइनों के लिए Day-0 इन्फेरेंस समर्थन प्रदान करता है: GLM, DeepSeek, Qwen, Kimi और MiniMax, जो क्रमशः Zhipu AI, DeepSeek, Alibaba, Moonshot AI और MiniMax का प्रतिनिधित्व करते हैं। Caixin Global ने विशेष रूप से Cambricon को उसी दिन शामिल करने की क्षमता पर टिप्पणी की, जिसे चीन में मॉडल और चिप्स के आंतरिक विकास चक्रों में कमी के संकेत के रूप में देखा गया है - महीनों के बंद पोर्ट से ऑपरेटरों द्वारा मानकीकृत सार्वजनिक फ्रेमवर्क पर लॉन्च की तैयारी तक का संक्रमण।
क्लस्टर ऑपरेटरों के लिए व्यावहारिक निष्कर्ष सहवर्ती उपलब्धता है: जब कोई उन्नत ओपन मॉडल जारी होता है, तो Cambricon के ग्राहक बंद फोर्क की प्रतीक्षा करने के बजाय vLLM नुस्खे का उपयोग कर सकते हैं। सॉफ्टवेयर पारिस्थितिकी तंत्र के लिए अगली परीक्षा यह होगी कि क्या यह Day-0 योजना बड़े DeepSeek वेरिएंट और मल्टीमॉडल सेवा मिश्रणों पर लागू होती है।


