Xiaomi ने RL स्टैक का उपयोग करके MiMo-V2.6 Pro और MiMo-V2.6 Flash मॉडल के लिए वज़न और संसाधन जारी किए
और पढ़ें
Pandaily
pandaily.com

Xiaomi ने RL स्टैक का उपयोग करके MiMo-V2.6 Pro और MiMo-V2.6 Flash मॉडल के लिए वज़न और संसाधन जारी किए

Xiaomi कंपनी ने अपनी MiMo-V2.6 श्रृंखला के लिए रीइन्फोर्समेंट लर्निंग (reinforcement-learning) के लिए वज़न, तकनीकी दस्तावेज़ीकरण और प्रशिक्षण संसाधन सार्वजनिक कर दिए हैं। 22 सितंबर के Xiaomi के अंग्रेजी नोट्स के अनुसार, MiMo-V2.6-Pro और MiMo-V2.6-Flash रिपॉजिटरी को Hugging Face प्लेटफॉर्म पर RL कोड और 7000 से अधिक परीक्षण वातावरणों के साथ प्रकाशित किया गया है।

यह रिलीज़ वज़न और कोड प्रदान करने का प्रतिनिधित्व करती है, जो पिछली सीधी प्रसारण के माध्यम से RL प्रशिक्षण प्रक्रिया पर प्रकाश डालने से अलग है। ब्रांडिंग अपरिवर्तित रहती है: Xiaomi / MiMo।

Pro और Flash मॉडल को मूल मल्टीमॉडल मॉडल के रूप में स्थापित किया गया है, जिसमें एक मिलियन टोकन की घोषित संदर्भ विंडो है। मॉडल कार्ड और अतिरिक्त अंग्रेजी रिपोर्ट इंगित करते हैं कि Pro मॉडल में लगभग 1.02 ट्रिलियन कुल मापदंडों वाला एक स्पार्स मिक्सचर-ऑफ-एक्सपर्ट्स (sparse mixture-of-experts) आर्किटेक्चर है, जिसमें लगभग 42 बिलियन पैरामीटर सक्रिय रूप से उपयोग किए जाते हैं। Flash मॉडल को 309 बिलियन कुल मापदंडों और लगभग 15 बिलियन की गतिविधि के साथ मूल्यांकित किया गया है।

Xiaomi बताती है कि प्रत्येक मॉडल ने छह दिनों से भी कम समय में लगभग 750,000 ट्रेजेक्टरी के भीतर 30 RL चरण पूरे किए। इस प्रक्रिया में कोडिंग, सामान्य एजेंट कार्य, विज़ुअल कार्य और साइबर सुरक्षा सहित कार्यों का मिश्रण उपयोग किया गया था। प्रत्येक अपडेट में लगभग 1568 क्वेरी और 16 रन का उपयोग किया गया था, और प्रति चरण डेटा की मात्रा 3.5-3.7 बिलियन टोकन थी।

कंपनी के अनुसार, प्रशिक्षण कार्यों में प्रदर्शन में लगभग 25% की वृद्धि हुई, जो Flash के लिए है, और 12% की वृद्धि Pro के लिए है। इसके अलावा, DeepSWE v1.1 में सुधार दर्ज किए गए हैं: Flash के लिए 48.8 से लगभग 65.7 तक और Pro के लिए 58.4 से लगभग 72.6 तक, हालांकि ये आंकड़े विक्रेता द्वारा प्रदान किए गए हैं और तीसरे पक्ष द्वारा पुष्टि की आवश्यकता है।

उपलब्ध संपत्ति केवल चेकपॉइंट्स से कहीं अधिक है। Xiaomi ने verl और संबंधित एजेंट तंत्र पर निर्मित एक व्यापक RL फ्रेमवर्क, 7000 से अधिक वर्गीकृत वातावरण, सॉफ्टवेयर विकास, भेद्यता पुनरुत्पादन, बौद्धिक श्रम और वेब डिज़ाइन को कवर किया है, प्रदान किया है। RL में समुदाय प्रयोगों के लिए Distill-Qwen-9B शुरुआती बिंदु और मल्टीचैनल प्रशिक्षण के लिए हल्के घटक भी उपलब्ध हैं। तैनात संस्करणों Pro और Flash के लिए API लागत MiMo-V2.5 के अनुरूप बताई गई है, जबकि UltraSpeed स्तर गुणवत्ता बनाए रखते हुए मानक Pro की तुलना में 20 गुना अधिक थ्रूपुट का वादा करता है।

फिर भी, इंजीनियरों को अभी भी बड़े MoE के उच्च रखरखाव लागत का सामना करना पड़ता है, और Xiaomi के कृत्रिम विश्लेषण और एजेंट बेंचमार्क के दावे बाहरी पुनरुत्पादन की मांग करते हैं। मुख्य खबर खुले वज़न, RL कोड और वातावरण के साथ पूर्ण MiMo-V2.6 पैकेज है जिसे प्रयोगशालाएं केवल लाइव प्रसारण में ग्राफिक प्रतिनिधित्व के बजाय अध्ययन कर सकती हैं।

लोकप्रिय