DeepSeek कंपनी ने DeepSeek-V4.1-Flash मॉडल पेश किया है, जो 552 बिलियन पैरामीटर वाला एक मल्टीमॉडल मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) प्रकार का मॉडल है। यह मॉडल Causal Encoder–Decoder आर्किटेक्चर पर बनाया गया है और एक मिलियन टोकन आकार की संदर्भ विंडो का समर्थन करता है। कंपनी इसे नई आर्किटेक्चरल लाइनअप का सबसे छोटा सदस्य बताती है, जिसका उद्देश्य तैनाती के दौरान क्षमताओं को बढ़ाना, डिकोडिंग को गति देना और थ्रूपुट बढ़ाना है, जिसे deepseek-flash नामक एपीआई के माध्यम से एक्सेस किया जा सकता है।
Causal Encoder–Decoder स्टैक में 40 परतों वाला ट्रांसफार्मर उपयोग किया जाता है, जिसे 20-परत वाले कारण एन्कोडर और 20-परत वाले डिकोडर में विभाजित किया गया है। प्रीफिक्स सक्रियण पर प्रति टोकन लगभग 8 बिलियन पैरामीटर सक्रिय होते हैं, और डिकोडिंग के दौरान लगभग 16 बिलियन पैरामीटर सक्रिय होते हैं, जिससे इनपुट-गहन वर्कलोड को समान आकार के सममित MoE डिज़ाइनों की तुलना में कम संसाधनों की आवश्यकता होती है।
अनुकूलन के लिए Compressed Sparse Attention 2 (CSA2) विधियों का उपयोग किया जाता है, जो लेयर्स के बीच फुल, रीइंडेक्स या रियूज मोड वितरित करता है, साथ ही FP4 मुख्य KV कैश, जो कुल KV वॉल्यूम को प्रति टोकन लगभग 890 बाइट तक कम कर देता है - जो DeepSeek-V4-Flash के आयतन का लगभग एक चौथाई है। इसके अलावा, SWA Bounded Replay SSD में KV की स्थिर मांग को लगभग आठवें हिस्से तक कम करता है।
प्रशिक्षण लगभग 45 ट्रिलियन मल्टीमॉडल टोकन पर किया गया था, जिसमें 64K अनुक्रमों पर विरल ध्यान शामिल था, और 1 मिलियन तक संदर्भ विस्तार बाद में प्री-ट्रेनिंग प्रक्रिया के दौरान हुआ। इसके बाद सुपरवाइज्ड फाइन-ट्यूनिंग, रीइन्फोर्समेंट लर्निंग और पॉलिसी डिस्टिलेशन होता है, जिसके साथ एजेंट कार्यों के गहन स्वचालित संश्लेषण की जाती है।
एजेंट निर्देश बेंचमार्क में, अधिकतम तर्क प्रयास पर, DeepSeek निम्नलिखित परिणाम बताता है: टर्मिनल-बेंच 2.1 90.6 प्राप्त करता है, डीपस्वई v1.1 74.2, और ऑटोमेशनबेंच 54.8। मॉडल में शून्य से बनाए गए DeepSeek-ViT एनकोडर के कारण दृष्टि का नेटिव समर्थन भी है।
वजन और इन्फेरेंस रेसिपी Hugging Face पर MIT लाइसेंस के तहत प्रकाशित किए गए हैं, और DeepSeek बड़े पैमाने पर कार्यान्वयन के लिए ओपन-सोर्स इन्फेरेंस एडेप्टर के समर्थन की घोषणा करता है। पुराने V4 फ्लैश उपनामों को अस्थायी रूप से V4.1-Flash पर रीडायरेक्ट किया जा रहा है; DeepSeek V4 Pro रूटिंग को नए SKU Flash के पक्ष में छोड़ने की भी योजना बना रहा है। मुख्य जोर KV संपीड़न और असममित सक्रियण पर आधारित लंबी संदर्भ के साथ किफायती इन्फेरेंस आर्किटेक्चर पर है, जो एक मिलियन टोकन वाले एजेंट सत्रों के रखरखाव को सस्ता बनाता है।


