हुआवेई ने एस्केंड प्लेटफॉर्म के लिए ओपनपंगु-2.0 (प्रीट्रेन, एसएफटी और आरएल) के प्रशिक्षण कोड को जारी किया
और पढ़ें
Pandaily
pandaily.com

हुआवेई ने एस्केंड प्लेटफॉर्म के लिए ओपनपंगु-2.0 (प्रीट्रेन, एसएफटी और आरएल) के प्रशिक्षण कोड को जारी किया

हुआवेई कंपनी ने मॉडल ओपनपंगु-2.0 के लिए प्रीट्रेनिंग, सुपरवाइज्ड फाइन-ट्यूनिंग (SFT), और रीइन्फोर्समेंट लर्निंग (RL) प्रक्रियाओं के स्रोत कोड जारी किए हैं। टीएमटी पोस्ट से मिली जानकारी और एस्केंड के लिए अनुकूलित प्रशिक्षण स्टैक से संबंधित कवरेज के अनुसार, यह रिलीज़ 28 सितंबर 2026 को हुई।

आधिकारिक ब्रांडिंग हुआवेई/ओपनपंगु के रूप में उपयोग की जाती है। पहले ही ओपनपंगु-2.0-प्रो और ओपनपंगु-2.0-फ्लैश मॉडल वेट्स हगिंग फेस प्लेटफॉर्म पर जारी किए जा चुके हैं; हालांकि, वर्तमान रिलीज़ विशेष रूप से प्रशिक्षण कोड पथ से संबंधित है जो इन एस्केंड पर प्रशिक्षित MoE मॉडलों का आधार है, न कि नए पैरामीटर जारी करने से।

हगिंग फेस पर मॉडल कार्ड ओपनपंगु को हुआवेई द्वारा खुले आर्टिफिशियल इंटेलिजेंस मॉडल के ब्रांड के रूप में वर्णित करते हैं, जिसे एस्केंड पर प्रशिक्षण और इन्फेरेंस के लिए डिज़ाइन किया गया है। ओपनपंगु-2.0-प्रो मॉडल में लगभग 505 बिलियन कुल पैरामीटर हैं जिसमें प्रति टोकन लगभग 18 बिलियन सक्रिय पैरामीटर, 512K संदर्भ विंडो और लगभग 34 ट्रिलियन टोकन का प्रशिक्षण बजट है। ओपनपंगु-2.0-फ्लैश मॉडल में लगभग 92 बिलियन कुल पैरामीटर हैं, जिसमें लगभग 6 बिलियन सक्रिय पैरामीटर, समान 512K संदर्भ आकार और तुलनीय ~34 ट्रिलियन टोकन का बजट है।

दोनों मॉडलों के प्रशिक्षण के बाद अतिरिक्त विवरण में संयुक्त तेज़/धीमा SFT, मल्टी-स्पेशियलाइज़्ड RL, और ऑनलाइन डिस्टिलेशन (OPD) का उल्लेख है। प्रो और फ्लैश दोनों के लिए सामान्य वास्तुशिल्प विशेषताएं बहु-हेड लेटेंट अटेंशन, लेयर्ड मिक्स DSA-प्लस-SWA (लगभग 1:2), चार-शाखाओं वाला mHC रिसाव टोपोलॉजी, त्रि-हेड मल्टी-टोकन प्रेडिक्शन और म्यूऑन ऑप्टिमाइज़र का उपयोग करके प्रशिक्षण शामिल हैं।

28 सितंबर की रिलीज़ प्रीट्रेनिंग, SFT और RL घटकों को एस्केंड-विशिष्ट उपकरणों के रूप में प्रस्तुत करती है, जिससे डेवलपर्स केवल इन्फेरेंस के लिए वेट्स डाउनलोड करने के बजाय इस स्टैक को पुन: उत्पन्न और विस्तारित कर सकते हैं। खुले वेट्स, इन्फेरेंस कोड और इस प्रशिक्षण कोड सेट के बीच अंतर करना महत्वपूर्ण है: वेट्स पहले से ही सार्वजनिक रूप से उपलब्ध थे; खबर यह है कि हुआवेई एस्केंड साइड पर ओपनपंगु-2.0 के प्रशिक्षण पथ को pretrain/SFT/RL घटकों के लिए खोल रहा है।

एस्केंड पर काम करने वाली टीमों के लिए विशिष्ट परिणाम एक OSS प्रशिक्षण स्टैक है जो पुष्टि किए गए प्रो परिवार (505B / ~18B सक्रिय, 512K) और फ्लैश (92B / ~6B सक्रिय, 512K) मॉडल के अनुरूप है।

समान कहानियाँ

Xiaomi ने RL स्टैक का उपयोग करके MiMo-V2.6 Pro और MiMo-V2.6 Flash मॉडल के लिए वज़न और संसाधन जारी किए
और पढ़ें
pandaily.com

Xiaomi ने RL स्टैक का उपयोग करके MiMo-V2.6 Pro और MiMo-V2.6 Flash मॉडल के लिए वज़न और संसाधन जारी किए

Xiaomi कंपनी ने अपनी MiMo-V2.6 श्रृंखला के लिए रीइन्फोर्समेंट लर्निंग (reinforcement-learning) के लिए वज़न, तकनीकी दस्तावेज़ीकरण और प्रशिक्षण संसाधन सार्वजनिक कर दिए हैं। 22 सितंबर के Xiaomi के अंग्रेजी नोट्स के अनुसार, MiMo-V2.6-Pro और MiMo-V2.6-Flash रिपॉजिटरी को Hugging Face प्लेटफॉर्म पर RL कोड और 7000 से अधिक परीक्षण वातावरणों के साथ प्रकाशित किया गया है।

यह रिलीज़ वज़न और कोड प्रदान करने का प्रतिनिधित्व करती है, जो पिछली सीधी प्रसारण के माध्यम से RL प्रशिक्षण प्रक्रिया पर प्रकाश डालने से अलग है। ब्रांडिंग अपरिवर्तित रहती है: Xiaomi / MiMo।

Pro और Flash मॉडल को मूल मल्टीमॉडल मॉडल के रूप में स्थापित किया गया है, जिसमें एक मिलियन टोकन की घोषित संदर्भ विंडो है। मॉडल कार्ड और अतिरिक्त अंग्रेजी रिपोर्ट इंगित करते हैं कि Pro मॉडल में लगभग 1.02 ट्रिलियन कुल मापदंडों वाला एक स्पार्स मिक्सचर-ऑफ-एक्सपर्ट्स (sparse mixture-of-experts) आर्किटेक्चर है, जिसमें लगभग 42 बिलियन पैरामीटर सक्रिय रूप से उपयोग किए जाते हैं। Flash मॉडल को 309 बिलियन कुल मापदंडों और लगभग 15 बिलियन की गतिविधि के साथ मूल्यांकित किया गया है।

Xiaomi बताती है कि प्रत्येक मॉडल ने छह दिनों से भी कम समय में लगभग 750,000 ट्रेजेक्टरी के भीतर 30 RL चरण पूरे किए। इस प्रक्रिया में कोडिंग, सामान्य एजेंट कार्य, विज़ुअल कार्य और साइबर सुरक्षा सहित कार्यों का मिश्रण उपयोग किया गया था। प्रत्येक अपडेट में लगभग 1568 क्वेरी और 16 रन का उपयोग किया गया था, और प्रति चरण डेटा की मात्रा 3.5-3.7 बिलियन टोकन थी।

कंपनी के अनुसार, प्रशिक्षण कार्यों में प्रदर्शन में लगभग 25% की वृद्धि हुई, जो Flash के लिए है, और 12% की वृद्धि Pro के लिए है। इसके अलावा, DeepSWE v1.1 में सुधार दर्ज किए गए हैं: Flash के लिए 48.8 से लगभग 65.7 तक और Pro के लिए 58.4 से लगभग 72.6 तक, हालांकि ये आंकड़े विक्रेता द्वारा प्रदान किए गए हैं और तीसरे पक्ष द्वारा पुष्टि की आवश्यकता है।

उपलब्ध संपत्ति केवल चेकपॉइंट्स से कहीं अधिक है। Xiaomi ने verl और संबंधित एजेंट तंत्र पर निर्मित एक व्यापक RL फ्रेमवर्क, 7000 से अधिक वर्गीकृत वातावरण, सॉफ्टवेयर विकास, भेद्यता पुनरुत्पादन, बौद्धिक श्रम और वेब डिज़ाइन को कवर किया है, प्रदान किया है। RL में समुदाय प्रयोगों के लिए Distill-Qwen-9B शुरुआती बिंदु और मल्टीचैनल प्रशिक्षण के लिए हल्के घटक भी उपलब्ध हैं। तैनात संस्करणों Pro और Flash के लिए API लागत MiMo-V2.5 के अनुरूप बताई गई है, जबकि UltraSpeed स्तर गुणवत्ता बनाए रखते हुए मानक Pro की तुलना में 20 गुना अधिक थ्रूपुट का वादा करता है।

फिर भी, इंजीनियरों को अभी भी बड़े MoE के उच्च रखरखाव लागत का सामना करना पड़ता है, और Xiaomi के कृत्रिम विश्लेषण और एजेंट बेंचमार्क के दावे बाहरी पुनरुत्पादन की मांग करते हैं। मुख्य खबर खुले वज़न, RL कोड और वातावरण के साथ पूर्ण MiMo-V2.6 पैकेज है जिसे प्रयोगशालाएं केवल लाइव प्रसारण में ग्राफिक प्रतिनिधित्व के बजाय अध्ययन कर सकती हैं।

लोकप्रिय