Xiaomi के शोधकर्ताओं ने टोकन प्रीप्रोसेसिंग में कम्प्यूटेशनल लागत को कम करने के लिए MiMo-V3 के लिए HySparse2 प्रस्तुत किया
और पढ़ें
Pandaily
pandaily.com

Xiaomi के शोधकर्ताओं ने टोकन प्रीप्रोसेसिंग में कम्प्यूटेशनल लागत को कम करने के लिए MiMo-V3 के लिए HySparse2 प्रस्तुत किया

Xiaomi की LLM-Core कंपनी के शोधकर्ताओं ने arXiv (2609.26368) पर एक पेपर में HySparse2 आर्किटेक्चर प्रकाशित किया है। यह तकनीक दो-स्तरीय कुंजी-मूल्य (KV) साझाकरण तंत्र के साथ एक हाइब्रिड विरल ध्यान (sparse attention) का प्रतिनिधित्व करती है और लंबी क्षितिज वाली MiMo-V3 वर्ग के एजेंट कार्यों के साथ काम करने के लिए डिज़ाइन की गई है।

इस विकास के आधिकारिक ब्रांडिंग में Xiaomi, MiMo और HySparse2 शामिल हैं। यह प्रकाशन खुले वजन वाले पिछले MiMo-V2.6 समीक्षाओं से अलग, अनुसंधान आर्किटेक्चर और घोषित प्रदर्शन मेट्रिक्स पर केंद्रित है।

HySparse2 मॉडल के मुख्य भाग को YOCO शैली के सेल्फ-डिकोडर और क्रॉस-डिकोडर में विभाजित करता है। बाहरी स्तर पर, KV ब्रिजिंग तंत्र केवल पूर्ण ध्यान परतों को जोड़ता है, जबकि क्रॉस-डिकोडर के KV कैश को सेल्फ-डिकोडर की छिपी हुई अवस्थाओं से प्रोजेक्ट किया जाता है। आंतरिक स्तर पर, उन्नत KV पुन: उपयोग प्रत्येक हाइब्रिड ब्लॉक के भीतर HySparse शैली में साझाकरण को बनाए रखता है, हालांकि यह ब्लॉक स्तर के चयन से टोकन स्तर के चयन में बदल जाता है। इसके अलावा, स्लाइडिंग विंडो की अलग शाखा के बजाय, विरल चयन में हाल की स्थानीय विंडो को अनिवार्य रूप से शामिल किया जाता है।

इन परिवर्तनों के कारण, प्रीफिल चरण सेल्फ-डिकोडर के बाद समाप्त हो सकता है, क्रॉस-डिकोडर परतों को कैश बनाने के दौरान दरकिनार करते हुए। यह मल्टी-स्टेप एजेंटों के लिए विशेष रूप से उपयोगी है जहां इनपुट टोकन काफी हद तक टूल ऑब्जर्वेशन से बने होते हैं।

समान डेटा और ग्राफ़ पर प्रशिक्षित 80B-A3B आकार के MoE मॉडल का उपयोग करते समय, लेख बताता है कि मामूली फाइन-ट्यूनिंग के बाद HySparse2 क्रमशः MRCR-v2 और RULER-v2 के प्रदर्शन को 11.30 और 19.81 प्रतिशत अंक तक बढ़ाता है, जबकि 256 हजार टोकन के संदर्भ में AgentPPL और LongPPL के निचले मानों को बनाए रखता है। 1 मिलियन टोकन के साथ काम करते समय, विश्लेषण में HySparse की तुलना में प्रीप्रोसेसिंग में FLOPs में 2.92× और Hybrid SWA की तुलना में 5.02× की कमी दिखाई देती है। यह भी नोट किया गया है कि निर्दिष्ट बेस मॉडलों के लिए FP8 KV कैश का आकार क्रमशः 6.72 GB और 12.09 GB की तुलना में लगभग 2.69 GB तक कम हो जाता है।

एब्लेशन विश्लेषण से पता चलता है कि टोकन स्तर का चयन निश्चित ध्यान बजट के साथ अधिक मजबूत खोज को बढ़ावा देता है। 290B-A8B तक स्केल करने पर, KV ब्रिजिंग तंत्र तुलनीय गुणवत्ता बनाए रखता है, साथ ही प्रीप्रोसेसिंग के दौरान प्रारंभिक निकास की अनुमति भी देता है। चीनी LLM सिस्टम के शोध का अध्ययन करने वाले विशेषज्ञों के लिए, HySparse2 MiMo-V3 के प्रदर्शन दावों के पीछे एक वास्तुशिल्प संकेत है, न कि खुले वजन वाला नया रिलीज़।

समान कहानियाँ

Xiaomi ने RL स्टैक का उपयोग करके MiMo-V2.6 Pro और MiMo-V2.6 Flash मॉडल के लिए वज़न और संसाधन जारी किए
और पढ़ें
pandaily.com

Xiaomi ने RL स्टैक का उपयोग करके MiMo-V2.6 Pro और MiMo-V2.6 Flash मॉडल के लिए वज़न और संसाधन जारी किए

Xiaomi कंपनी ने अपनी MiMo-V2.6 श्रृंखला के लिए रीइन्फोर्समेंट लर्निंग (reinforcement-learning) के लिए वज़न, तकनीकी दस्तावेज़ीकरण और प्रशिक्षण संसाधन सार्वजनिक कर दिए हैं। 22 सितंबर के Xiaomi के अंग्रेजी नोट्स के अनुसार, MiMo-V2.6-Pro और MiMo-V2.6-Flash रिपॉजिटरी को Hugging Face प्लेटफॉर्म पर RL कोड और 7000 से अधिक परीक्षण वातावरणों के साथ प्रकाशित किया गया है।

यह रिलीज़ वज़न और कोड प्रदान करने का प्रतिनिधित्व करती है, जो पिछली सीधी प्रसारण के माध्यम से RL प्रशिक्षण प्रक्रिया पर प्रकाश डालने से अलग है। ब्रांडिंग अपरिवर्तित रहती है: Xiaomi / MiMo।

Pro और Flash मॉडल को मूल मल्टीमॉडल मॉडल के रूप में स्थापित किया गया है, जिसमें एक मिलियन टोकन की घोषित संदर्भ विंडो है। मॉडल कार्ड और अतिरिक्त अंग्रेजी रिपोर्ट इंगित करते हैं कि Pro मॉडल में लगभग 1.02 ट्रिलियन कुल मापदंडों वाला एक स्पार्स मिक्सचर-ऑफ-एक्सपर्ट्स (sparse mixture-of-experts) आर्किटेक्चर है, जिसमें लगभग 42 बिलियन पैरामीटर सक्रिय रूप से उपयोग किए जाते हैं। Flash मॉडल को 309 बिलियन कुल मापदंडों और लगभग 15 बिलियन की गतिविधि के साथ मूल्यांकित किया गया है।

Xiaomi बताती है कि प्रत्येक मॉडल ने छह दिनों से भी कम समय में लगभग 750,000 ट्रेजेक्टरी के भीतर 30 RL चरण पूरे किए। इस प्रक्रिया में कोडिंग, सामान्य एजेंट कार्य, विज़ुअल कार्य और साइबर सुरक्षा सहित कार्यों का मिश्रण उपयोग किया गया था। प्रत्येक अपडेट में लगभग 1568 क्वेरी और 16 रन का उपयोग किया गया था, और प्रति चरण डेटा की मात्रा 3.5-3.7 बिलियन टोकन थी।

कंपनी के अनुसार, प्रशिक्षण कार्यों में प्रदर्शन में लगभग 25% की वृद्धि हुई, जो Flash के लिए है, और 12% की वृद्धि Pro के लिए है। इसके अलावा, DeepSWE v1.1 में सुधार दर्ज किए गए हैं: Flash के लिए 48.8 से लगभग 65.7 तक और Pro के लिए 58.4 से लगभग 72.6 तक, हालांकि ये आंकड़े विक्रेता द्वारा प्रदान किए गए हैं और तीसरे पक्ष द्वारा पुष्टि की आवश्यकता है।

उपलब्ध संपत्ति केवल चेकपॉइंट्स से कहीं अधिक है। Xiaomi ने verl और संबंधित एजेंट तंत्र पर निर्मित एक व्यापक RL फ्रेमवर्क, 7000 से अधिक वर्गीकृत वातावरण, सॉफ्टवेयर विकास, भेद्यता पुनरुत्पादन, बौद्धिक श्रम और वेब डिज़ाइन को कवर किया है, प्रदान किया है। RL में समुदाय प्रयोगों के लिए Distill-Qwen-9B शुरुआती बिंदु और मल्टीचैनल प्रशिक्षण के लिए हल्के घटक भी उपलब्ध हैं। तैनात संस्करणों Pro और Flash के लिए API लागत MiMo-V2.5 के अनुरूप बताई गई है, जबकि UltraSpeed स्तर गुणवत्ता बनाए रखते हुए मानक Pro की तुलना में 20 गुना अधिक थ्रूपुट का वादा करता है।

फिर भी, इंजीनियरों को अभी भी बड़े MoE के उच्च रखरखाव लागत का सामना करना पड़ता है, और Xiaomi के कृत्रिम विश्लेषण और एजेंट बेंचमार्क के दावे बाहरी पुनरुत्पादन की मांग करते हैं। मुख्य खबर खुले वज़न, RL कोड और वातावरण के साथ पूर्ण MiMo-V2.6 पैकेज है जिसे प्रयोगशालाएं केवल लाइव प्रसारण में ग्राफिक प्रतिनिधित्व के बजाय अध्ययन कर सकती हैं।

लोकप्रिय