DeepSeek ने MoE आर्किटेक्चर, 1 मिलियन टोकन संदर्भ और KV संपीड़न के साथ DeepSeek-V4.1-Flash मॉडल जारी किया
और पढ़ें
Pandaily
pandaily.com

DeepSeek ने MoE आर्किटेक्चर, 1 मिलियन टोकन संदर्भ और KV संपीड़न के साथ DeepSeek-V4.1-Flash मॉडल जारी किया

DeepSeek कंपनी ने DeepSeek-V4.1-Flash मॉडल पेश किया है, जो 552 बिलियन पैरामीटर वाला एक मल्टीमॉडल मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) प्रकार का मॉडल है। यह मॉडल Causal Encoder–Decoder आर्किटेक्चर पर बनाया गया है और एक मिलियन टोकन आकार की संदर्भ विंडो का समर्थन करता है। कंपनी इसे नई आर्किटेक्चरल लाइनअप का सबसे छोटा सदस्य बताती है, जिसका उद्देश्य तैनाती के दौरान क्षमताओं को बढ़ाना, डिकोडिंग को गति देना और थ्रूपुट बढ़ाना है, जिसे deepseek-flash नामक एपीआई के माध्यम से एक्सेस किया जा सकता है।

Causal Encoder–Decoder स्टैक में 40 परतों वाला ट्रांसफार्मर उपयोग किया जाता है, जिसे 20-परत वाले कारण एन्कोडर और 20-परत वाले डिकोडर में विभाजित किया गया है। प्रीफिक्स सक्रियण पर प्रति टोकन लगभग 8 बिलियन पैरामीटर सक्रिय होते हैं, और डिकोडिंग के दौरान लगभग 16 बिलियन पैरामीटर सक्रिय होते हैं, जिससे इनपुट-गहन वर्कलोड को समान आकार के सममित MoE डिज़ाइनों की तुलना में कम संसाधनों की आवश्यकता होती है।

अनुकूलन के लिए Compressed Sparse Attention 2 (CSA2) विधियों का उपयोग किया जाता है, जो लेयर्स के बीच फुल, रीइंडेक्स या रियूज मोड वितरित करता है, साथ ही FP4 मुख्य KV कैश, जो कुल KV वॉल्यूम को प्रति टोकन लगभग 890 बाइट तक कम कर देता है - जो DeepSeek-V4-Flash के आयतन का लगभग एक चौथाई है। इसके अलावा, SWA Bounded Replay SSD में KV की स्थिर मांग को लगभग आठवें हिस्से तक कम करता है।

प्रशिक्षण लगभग 45 ट्रिलियन मल्टीमॉडल टोकन पर किया गया था, जिसमें 64K अनुक्रमों पर विरल ध्यान शामिल था, और 1 मिलियन तक संदर्भ विस्तार बाद में प्री-ट्रेनिंग प्रक्रिया के दौरान हुआ। इसके बाद सुपरवाइज्ड फाइन-ट्यूनिंग, रीइन्फोर्समेंट लर्निंग और पॉलिसी डिस्टिलेशन होता है, जिसके साथ एजेंट कार्यों के गहन स्वचालित संश्लेषण की जाती है।

एजेंट निर्देश बेंचमार्क में, अधिकतम तर्क प्रयास पर, DeepSeek निम्नलिखित परिणाम बताता है: टर्मिनल-बेंच 2.1 90.6 प्राप्त करता है, डीपस्वई v1.1 74.2, और ऑटोमेशनबेंच 54.8। मॉडल में शून्य से बनाए गए DeepSeek-ViT एनकोडर के कारण दृष्टि का नेटिव समर्थन भी है।

वजन और इन्फेरेंस रेसिपी Hugging Face पर MIT लाइसेंस के तहत प्रकाशित किए गए हैं, और DeepSeek बड़े पैमाने पर कार्यान्वयन के लिए ओपन-सोर्स इन्फेरेंस एडेप्टर के समर्थन की घोषणा करता है। पुराने V4 फ्लैश उपनामों को अस्थायी रूप से V4.1-Flash पर रीडायरेक्ट किया जा रहा है; DeepSeek V4 Pro रूटिंग को नए SKU Flash के पक्ष में छोड़ने की भी योजना बना रहा है। मुख्य जोर KV संपीड़न और असममित सक्रियण पर आधारित लंबी संदर्भ के साथ किफायती इन्फेरेंस आर्किटेक्चर पर है, जो एक मिलियन टोकन वाले एजेंट सत्रों के रखरखाव को सस्ता बनाता है।

समान कहानियाँ

OpenBMB ने डिवाइस पर चलने के लिए 4 बिलियन पैरामीटर से कम वजन का SOTA ओपन मॉडल MiniCPM5-2B जारी किया
और पढ़ें
pandaily.com

OpenBMB ने डिवाइस पर चलने के लिए 4 बिलियन पैरामीटर से कम वजन का SOTA ओपन मॉडल MiniCPM5-2B जारी किया

ओपनBMB, मॉडलबेस्ट से जुड़ा एक ओपन प्रोजेक्ट, ने सीधे डिवाइस पर चलने के लिए एक सघन भाषा मॉडल MiniCPM5-2B प्रस्तुत किया है। इस मॉडल में लगभग 2.52 बिलियन पैरामीटर हैं और यह Apache-2.0 लाइसेंस के तहत 131,072 टोकन की नेटिव कॉन्टेक्स्ट लंबाई का समर्थन करता है।

MiniCPM5-2B मिनीCPM5 श्रृंखला का दूसरा रिलीज़ है, जो MiniCPM5-1B के बाद आया है। यह LlamaForCausalLM की मानक संरचना का उपयोग करता है, जिसमें 42 परतें और ग्रुपेड-क्वेरी अटेंशन (grouped-query attention) शामिल है, जो 16 क्वेरी हेड्स और 2 की/वैल्यू हेड्स का उपयोग करता है। इसके कारण, मुख्य इंजन बिना कस्टम कर्नेल या मॉडल कोड फोर्क की आवश्यकता के मॉडल को लोड कर सकते हैं।

एम्बेडिंग के अलावा पैरामीटर लगभग 1.98 बिलियन हैं, जो मॉडल को 4 बिलियन पैरामीटर से कम वर्ग में रखने की अनुमति देता है, जो फोन, लैपटॉप और पेरिफेरल उपकरणों पर होस्टिंग के लिए उपयुक्त है।

34-बेंचमार्क डेटासेट पर तुलना करने पर, MiniCPM5-2B औसतन 53.9 स्कोर प्रदर्शित करता है, जो कई बड़े ओपन बेस मॉडलों से आगे निकल जाता है। इनमें Qwen3.5-4B ने 51.1 और granite-4.2-3B ने 42.7 स्कोर किया। वहीं, समान आकार के मॉडल जैसे LFM2.5-2.6B और Qwen3.5-2B पीछे रह जाते हैं।

मॉडल की ताकत कोडिंग एजेंटों, टूल उपयोग और लंबे संदर्भ से जानकारी निकालने के क्षेत्रों पर केंद्रित है। उदाहरण के लिए, LiveCodeBench v6 पर MiniCPM5-2B ने Qwen3.5-4B के 56.4 की तुलना में 69.1 स्कोर किया, और SWE-bench Verified पर 46.4 बनाम 33.6 स्कोर किया। उच्च परिणाम τ²-Bench Telecom (97.1), BFCL v4 (66.6) और NoLiMa (43.5 की तुलना में 68.1) पर भी प्राप्त किए गए।

गहन ज्ञान की आवश्यकता वाले कार्यों में, प्रदर्शन आकार की ऊपरी सीमा के करीब रहता है; उदाहरण के लिए, MMLU-Pro पर मॉडल ने 70.8 दिखाया, जबकि 4B आकार का बेंचमार्क मॉडल Qwen ने 78.0 हासिल किया। ओपनBMB विशेष रूप से आर्टिफिशियल एनालिसिस स्रोतों से प्राप्त पंक्तियों को चिह्नित करता है ताकि उपयोगकर्ता विक्रेता और तृतीय-पक्ष परिणामों के बीच अंतर कर सकें।

पोस्ट-ट्रेनिंग प्रक्रिया अल्ट्राडेटा स्तर के प्रबंधन का पालन करती थी: पहले लगभग 400 बिलियन टोकन का उपयोग करके गहन सोच के आधार पर सुपरवाइज्ड फाइन-ट्यूनिंग (supervised fine-tuning) की गई। फिर गणित, कोड, एजेंट और लेखन के लिए जस्टRL II एल्गोरिथम पर आधारित विशेष रीइन्फोर्समेंट-लर्निंग टीचर्स (reinforcement-learning teachers) लागू किए गए। अंतिम चरण ऑन-पॉलिसी डिस्टिलेशन (on-policy distillation) था, जिसने 16 RL विशेषज्ञों—जिनमें से पांच एजेंट थे—को एक अंतिम छात्र मॉडल में मिला दिया।

ओपनBMB तर्क और सामान्य सेटों में लगभग 10.96 अंकों की वृद्धि और एजेंट सेटों में 6.96 अंकों की वृद्धि को RL और डिस्टिलेशन चरण से जोड़ता है। प्रत्येक भाग के योगदान को सीधे मापने की क्षमता के लिए, कंपनी मध्यवर्ती नियंत्रण बिंदु जारी करती है: बेस, मिडट्रेन और SFT-केवल।

वजन के साथ, अल्ट्राडेटा कॉर्पोरेशन वेब, कोड, गणित, SFT और एजेंटों के लिए RL नमूनों को कवर करने वाले डेटासेट प्रकाशित करते हैं, जिससे परिणामों को पुन: उत्पन्न करना संभव हो जाता है। रनटाइम समर्थन में vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX, LiteRT और मल्टी-चिप FlagOS बिल्ड शामिल हैं। स्थानीय सहायकों के लिए GGUF, MLX और GPTQ पैकेज प्रदान किए जाते हैं, जिन्हें डेटा सेंटर जीपीयू का उपयोग किए बिना टूल कॉल करने और लंबे संदर्भ के साथ काम करने की आवश्यकता होती है।

डिवाइस पर काम करने पर ध्यान केंद्रित करने वाले डेवलपर्स के लिए, MiniCPM5-2B को सामान्य ज्ञान के विशालकाय के रूप में नहीं, बल्कि Apache लाइसेंस वाला एक कॉम्पैक्ट एजेंट और कोडिंग साथी के रूप में स्थापित किया गया है, जो प्रकाशित औसत स्कोर के आधार पर कुछ 4B क्लास के ओपन बेस मॉडलों से बेहतर प्रदर्शन करता है।

डीपसीक ने तेज़ और कम लागत वाले नए एआई मॉडल V4.1-फ्लैश लॉन्च किया
और पढ़ें
olhardigital.com.br

डीपसीक ने तेज़ और कम लागत वाले नए एआई मॉडल V4.1-फ्लैश लॉन्च किया

चीनी कंपनी डीपसीक ने अपने नवीनतम आर्टिफिशियल इंटेलिजेंस मॉडल V4.1-फ्लैश का परिचय दिया है। इस नई तकनीक को अपने मॉडल परिवार के सबसे छोटे संस्करण के रूप में प्रस्तुत किया गया है और यह अधिक फुर्तीले उत्तरों, उच्च प्रसंस्करण क्षमता और कम परिचालन लागत का वादा करती है।

यह लॉन्च तब हो रहा है जब डीपसीक शंघाई में स्थित स्टार मार्केट में आरंभिक सार्वजनिक पेशकश (IPO) के लिए तैयारी कर रही है, जैसा कि रॉयटर्स द्वारा रिपोर्ट किया गया है। इसके अलावा, कंपनी अपने पुराने मॉडलों के संस्करणों को बदलकर V4.1-फ्लैश को लागू कर रही है।

नई श्रृंखला में सबसे छोटा मॉडल होने के बावजूद, V4.1-फ्लैश में 552 बिलियन पैरामीटर हैं, जो एआई द्वारा डेटा संसाधित करने और आउटपुट उत्पन्न करने के लिए उपयोग किए जाने वाले घटक हैं। हालांकि, प्रत्येक कार्य के दौरान, यह इन संसाधनों का केवल एक अंश का उपयोग करता है, विशेष रूप से जानकारी प्राप्त करने के लिए 8 बिलियन पैरामीटर और उत्तर तैयार करने के लिए 16 बिलियन पैरामीटर का उपयोग करता है।

उपयोगकर्ता के लिए व्यावहारिक उद्देश्य यह है कि मॉडल अधिक तेज़ी से काम करे और अत्यधिक कम्प्यूटेशनल संसाधनों की मांग किए बिना अनुरोधों की बड़ी मात्रा को संभाल सके। डीपसीक यह भी सुनिश्चित करती है कि सिस्टम को भविष्य में और बड़े मॉडल विकसित करने में आसानी के लिए डिज़ाइन किया गया है।

कंपनी ने इस बात पर प्रकाश डाला कि V4.1-फ्लैश में 'नेटिव विज़ुअल अंडरस्टैंडिंग' है, जो इसे छवियों जैसे दृश्य सामग्री की व्याख्या करने की अनुमति देता है। विभिन्न संस्थाओं द्वारा किए गए परीक्षणों से पता चला है कि यह नया मॉडल प्रदर्शन, लागत, गति और कुल निष्पादन समय के मामले में V4-प्रो से बेहतर है।

एक महत्वपूर्ण बदलाव इस बात में निहित है कि मॉडल ऑपरेशन के दौरान डेटा को कैसे संग्रहीत करता है, जो ऐतिहासिक रूप से लंबी अवधि की एआई सेवाओं की लागत बढ़ा सकता था। पिछली पीढ़ी की तुलना में, डीपसीक ने कहा कि V4.1-फ्लैश को कम संसाधनों की आवश्यकता होती है, जिससे कंपनी के अनुसार, विशेष रूप से एआई एजेंटों और उन प्रणालियों में खर्च में भारी कमी आ सकती है जो न्यूनतम मानवीय हस्तक्षेप के साथ कार्य करती हैं।

V4.1-फ्लैश अब डीपसीक एपीआई के माध्यम से उपलब्ध है, जो मॉडल को अन्य अनुप्रयोगों में एकीकृत करने की अनुमति देता है। V4-फ्लैश और V4-फ्लैश-विजन-एक्सप मॉडल को बंद कर दिया गया है और उनके कॉल अस्थायी रूप से नए सिस्टम पर रीडायरेक्ट किए जा रहे हैं।

लोकप्रिय