OpenBMB ने डिवाइस पर चलने के लिए 4 बिलियन पैरामीटर से कम वजन का SOTA ओपन मॉडल MiniCPM5-2B जारी किया
और पढ़ें
Pandaily
pandaily.com

OpenBMB ने डिवाइस पर चलने के लिए 4 बिलियन पैरामीटर से कम वजन का SOTA ओपन मॉडल MiniCPM5-2B जारी किया

ओपनBMB, मॉडलबेस्ट से जुड़ा एक ओपन प्रोजेक्ट, ने सीधे डिवाइस पर चलने के लिए एक सघन भाषा मॉडल MiniCPM5-2B प्रस्तुत किया है। इस मॉडल में लगभग 2.52 बिलियन पैरामीटर हैं और यह Apache-2.0 लाइसेंस के तहत 131,072 टोकन की नेटिव कॉन्टेक्स्ट लंबाई का समर्थन करता है।

MiniCPM5-2B मिनीCPM5 श्रृंखला का दूसरा रिलीज़ है, जो MiniCPM5-1B के बाद आया है। यह LlamaForCausalLM की मानक संरचना का उपयोग करता है, जिसमें 42 परतें और ग्रुपेड-क्वेरी अटेंशन (grouped-query attention) शामिल है, जो 16 क्वेरी हेड्स और 2 की/वैल्यू हेड्स का उपयोग करता है। इसके कारण, मुख्य इंजन बिना कस्टम कर्नेल या मॉडल कोड फोर्क की आवश्यकता के मॉडल को लोड कर सकते हैं।

एम्बेडिंग के अलावा पैरामीटर लगभग 1.98 बिलियन हैं, जो मॉडल को 4 बिलियन पैरामीटर से कम वर्ग में रखने की अनुमति देता है, जो फोन, लैपटॉप और पेरिफेरल उपकरणों पर होस्टिंग के लिए उपयुक्त है।

34-बेंचमार्क डेटासेट पर तुलना करने पर, MiniCPM5-2B औसतन 53.9 स्कोर प्रदर्शित करता है, जो कई बड़े ओपन बेस मॉडलों से आगे निकल जाता है। इनमें Qwen3.5-4B ने 51.1 और granite-4.2-3B ने 42.7 स्कोर किया। वहीं, समान आकार के मॉडल जैसे LFM2.5-2.6B और Qwen3.5-2B पीछे रह जाते हैं।

मॉडल की ताकत कोडिंग एजेंटों, टूल उपयोग और लंबे संदर्भ से जानकारी निकालने के क्षेत्रों पर केंद्रित है। उदाहरण के लिए, LiveCodeBench v6 पर MiniCPM5-2B ने Qwen3.5-4B के 56.4 की तुलना में 69.1 स्कोर किया, और SWE-bench Verified पर 46.4 बनाम 33.6 स्कोर किया। उच्च परिणाम τ²-Bench Telecom (97.1), BFCL v4 (66.6) और NoLiMa (43.5 की तुलना में 68.1) पर भी प्राप्त किए गए।

गहन ज्ञान की आवश्यकता वाले कार्यों में, प्रदर्शन आकार की ऊपरी सीमा के करीब रहता है; उदाहरण के लिए, MMLU-Pro पर मॉडल ने 70.8 दिखाया, जबकि 4B आकार का बेंचमार्क मॉडल Qwen ने 78.0 हासिल किया। ओपनBMB विशेष रूप से आर्टिफिशियल एनालिसिस स्रोतों से प्राप्त पंक्तियों को चिह्नित करता है ताकि उपयोगकर्ता विक्रेता और तृतीय-पक्ष परिणामों के बीच अंतर कर सकें।

पोस्ट-ट्रेनिंग प्रक्रिया अल्ट्राडेटा स्तर के प्रबंधन का पालन करती थी: पहले लगभग 400 बिलियन टोकन का उपयोग करके गहन सोच के आधार पर सुपरवाइज्ड फाइन-ट्यूनिंग (supervised fine-tuning) की गई। फिर गणित, कोड, एजेंट और लेखन के लिए जस्टRL II एल्गोरिथम पर आधारित विशेष रीइन्फोर्समेंट-लर्निंग टीचर्स (reinforcement-learning teachers) लागू किए गए। अंतिम चरण ऑन-पॉलिसी डिस्टिलेशन (on-policy distillation) था, जिसने 16 RL विशेषज्ञों—जिनमें से पांच एजेंट थे—को एक अंतिम छात्र मॉडल में मिला दिया।

ओपनBMB तर्क और सामान्य सेटों में लगभग 10.96 अंकों की वृद्धि और एजेंट सेटों में 6.96 अंकों की वृद्धि को RL और डिस्टिलेशन चरण से जोड़ता है। प्रत्येक भाग के योगदान को सीधे मापने की क्षमता के लिए, कंपनी मध्यवर्ती नियंत्रण बिंदु जारी करती है: बेस, मिडट्रेन और SFT-केवल।

वजन के साथ, अल्ट्राडेटा कॉर्पोरेशन वेब, कोड, गणित, SFT और एजेंटों के लिए RL नमूनों को कवर करने वाले डेटासेट प्रकाशित करते हैं, जिससे परिणामों को पुन: उत्पन्न करना संभव हो जाता है। रनटाइम समर्थन में vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX, LiteRT और मल्टी-चिप FlagOS बिल्ड शामिल हैं। स्थानीय सहायकों के लिए GGUF, MLX और GPTQ पैकेज प्रदान किए जाते हैं, जिन्हें डेटा सेंटर जीपीयू का उपयोग किए बिना टूल कॉल करने और लंबे संदर्भ के साथ काम करने की आवश्यकता होती है।

डिवाइस पर काम करने पर ध्यान केंद्रित करने वाले डेवलपर्स के लिए, MiniCPM5-2B को सामान्य ज्ञान के विशालकाय के रूप में नहीं, बल्कि Apache लाइसेंस वाला एक कॉम्पैक्ट एजेंट और कोडिंग साथी के रूप में स्थापित किया गया है, जो प्रकाशित औसत स्कोर के आधार पर कुछ 4B क्लास के ओपन बेस मॉडलों से बेहतर प्रदर्शन करता है।

समान कहानियाँ

Cambricon ने vLLM स्टैक पर DeepSeek-V4.1-Flash मॉडल को अनुकूलित किया
और पढ़ें
pandaily.com

Cambricon ने vLLM स्टैक पर DeepSeek-V4.1-Flash मॉडल को अनुकूलित किया

Cambricon ने ओपन इन्फेरेंस स्टैक vLLM के आधार पर Day-0 कार्यक्रम के हिस्से के रूप में DeepSeek-V4.1-Flash मॉडल के सफल अनुकूलन की घोषणा की है। इसका मतलब है कि हाल ही में जारी किए गए मॉडल को उस दिन Cambricon के एक्सेलेरेटर पर स्थिर रूप से चलाया जा सकता है जिस दिन DeepSeek ने चेकपॉइंट प्रकाशित किया था।

यह घोषणा चिप और सॉफ्टवेयर के बीच तालमेल पर प्रकाश डालती है: मॉडल और चिप की एक साथ उपलब्धता, और Cambricon के NeuWare और vLLM को संयोजित करने वाले दृष्टिकोण की परिपक्वता। यह स्वयं मॉडल की सामान्य उपलब्धता के बारे में जानकारी को दोहराना नहीं है।

DeepSeek-V4.1-Flash DeepSeek की नई आर्किटेक्चरल श्रृंखला का सबसे छोटा संस्करण है। यह 552 बिलियन पैरामीटर वाला एक मिश्रण-के-विशेषज्ञ (mixture-of-experts) प्रकार का मॉडल है जो इनपुट साइड पर लगभग 8 बिलियन और आउटपुट साइड पर 16 बिलियन पैरामीटर सक्रिय करता है, और इसमें मल्टीमॉडल विजन की अंतर्निहित समझ भी है। DeepSeek ने Causal-Encoder-Decoder संरचना और KV-कैश के आक्रामक संपीड़न का उपयोग करने पर जोर दिया है, जिससे पिछले पीढ़ी की तुलना में HBM की आवश्यकता लगभग एक चौथाई और SSD की आवश्यकता आठवें हिस्से तक कम हो जाती है, जबकि कैश का आकार पहले संस्करण की तुलना में सैकड़ों गुना छोटा होता है।

ये मेमोरी बचत एक्सेलेरेटर निर्माताओं के लिए महत्वपूर्ण हैं जो सघन सर्वरों पर इन्फेरेंस विलंबता, DRAM की मात्रा और भंडारण स्तरों को नियंत्रित करना चाहते हैं, जिन पर पहले से ही HBM बजट पर दबाव पड़ रहा है।

अपनी ओर से, Cambricon के इंजीनियरों ने Engram और Compressor जैसी संरचनाओं को तेज करने के लिए Torch-MLU-Ops लाइब्रेरी का उपयोग किया, और विरल और संपीड़ित ध्यान के हॉटस्पॉट के लिए BangC पर अनुकूलित कर्नेल लिखे। vLLM के भीतर, Cambricon पांच-आयामी मिश्रित समानांतरवाद का समर्थन करने का दावा करता है, जिसमें टेंसर, पाइपलाइन, अनुक्रमिक, बैच और विशेषज्ञ समानांतरवाद शामिल है, जिसमें संचार और गणना का ओवरलैप, कम सटीकता क्वांटाइजेशन और एंड-टू-एंड थ्रूपुट बढ़ाने के लिए प्रीफाइल और डीकोडिंग विभाजन शामिल है। यह स्टैक कंपनी के दीर्घकालिक सॉफ्टवेयर प्लेटफॉर्म, NeuWare पर काम करता है।

कुछ दिन पहले, Cambricon पायटॉर्च फाउंडेशन में प्लैटिनम सदस्य के रूप में शामिल हुआ, अन्य प्रमुख हार्डवेयर और क्लाउड सेवा डेवलपर्स के साथ प्रबंधन बोर्ड में जगह बनाई, जो ओपन लर्निंग और इन्फेरेंस इकोसिस्टम में गहरे निवेश का संकेत देता है।

अब Cambricon पाँच प्रमुख चीनी मॉडल लाइनों के लिए Day-0 इन्फेरेंस समर्थन प्रदान करता है: GLM, DeepSeek, Qwen, Kimi और MiniMax, जो क्रमशः Zhipu AI, DeepSeek, Alibaba, Moonshot AI और MiniMax का प्रतिनिधित्व करते हैं। Caixin Global ने विशेष रूप से Cambricon को उसी दिन शामिल करने की क्षमता पर टिप्पणी की, जिसे चीन में मॉडल और चिप्स के आंतरिक विकास चक्रों में कमी के संकेत के रूप में देखा गया है - महीनों के बंद पोर्ट से ऑपरेटरों द्वारा मानकीकृत सार्वजनिक फ्रेमवर्क पर लॉन्च की तैयारी तक का संक्रमण।

क्लस्टर ऑपरेटरों के लिए व्यावहारिक निष्कर्ष सहवर्ती उपलब्धता है: जब कोई उन्नत ओपन मॉडल जारी होता है, तो Cambricon के ग्राहक बंद फोर्क की प्रतीक्षा करने के बजाय vLLM नुस्खे का उपयोग कर सकते हैं। सॉफ्टवेयर पारिस्थितिकी तंत्र के लिए अगली परीक्षा यह होगी कि क्या यह Day-0 योजना बड़े DeepSeek वेरिएंट और मल्टीमॉडल सेवा मिश्रणों पर लागू होती है।

लोकप्रिय