चाइना टेलीकॉम ने MoE आर्किटेक्चर के साथ Ascend पर प्रशिक्षित Xing4.0-29B-A4B मॉडल जारी किया
और पढ़ें
Pandaily
pandaily.com

चाइना टेलीकॉम ने MoE आर्किटेक्चर के साथ Ascend पर प्रशिक्षित Xing4.0-29B-A4B मॉडल जारी किया

चाइना टेलीकॉम आर्टिफिशियल इंटेलिजेंस टेक्नोलॉजी कंपनी लिमिटेड ने Xing श्रृंखला (जिसे पहले TeleChat के नाम से जाना जाता था) का नवीनतम विकास, Xing4.0-29B-A4B मॉडल जारी किया है। इस मॉडल के वज़न और कॉन्फ़िगरेशन फ़ाइलें XingChen-AGI संगठन के तहत Hugging Face और ModelScope प्लेटफॉर्म पर उपलब्ध हैं। आधिकारिक तौर पर, मॉडल को चाइना टेलीकॉम / XingChen / Xing4.0 के रूप में प्रस्तुत किया गया है।

इस मॉडल को केवल एक सामान्य बड़े भाषा मॉडल के रिलीज के रूप में नहीं, बल्कि Ascend प्लेटफॉर्म के लिए अनुकूलित Mixture-of-Experts (MoE) एजेंट कार्यान्वयन के रूप में प्रस्तुत किया गया है। कंपनी की सामग्री के अनुसार, यह पहली ऐसी मॉडल है जिसका प्रशिक्षण पूरी तरह से Ascend NPUs पर MindSpore फ्रेमवर्क का उपयोग करके किया गया है और इसे जटिल इंजीनियरिंग कार्यों और एजेंट वर्कलोड के लिए विशेष रूप से ट्यून किया गया है।

Hugging Face के आंकड़ों के अनुसार, मॉडल में कुल 29 बिलियन पैरामीटर हैं, जिसमें प्रति टोकन लगभग 4 बिलियन पैरामीटर सक्रिय होते हैं। यह 256K की नेटिव संदर्भ लंबाई का समर्थन करता है, जिसे 512K तक बढ़ाया जा सकता है, इसमें 40 परतें हैं, MLA अटेंशन का उपयोग करता है, और इसमें 64 रूट किए गए विशेषज्ञ शामिल हैं, जिनमें से प्रत्येक टोकन के लिए चार विशेषज्ञ और एक सामान्य विशेषज्ञ सक्रिय होते हैं। आर्किटेक्चरल नोट्स mHC + MLA + MTP स्टैक का संकेत देते हैं, जो बहु-चरणीय योजना, टूल कॉलिंग और लंबी संदर्भ में निरंतरता बनाए रखने के लिए डिज़ाइन किया गया है।

रिपोर्ट किया गया है कि MindSpore/MindFormers के माध्यम से Ascend 910C क्लस्टर्स पर संयुक्त रूप से प्रशिक्षण को अनुकूलित करने, जिसमें mHC ऑपरेटरों का संयोजन और MoE संचार ट्यूनिंग शामिल है, ने विक्रेता द्वारा प्रदान किए गए डेटा के अनुसार प्रशिक्षण थ्रूपुट को बेसलाइन सेटिंग्स की तुलना में लगभग 96% बढ़ा दिया है।

उपयोग के लिए ट्रांसफॉर्मर्स, vLLM, SGLang और KTransformers जैसे विभिन्न सेवा पथ प्रदान किए जाते हैं। LLaMA-Factory और MindFormers का उपयोग करके फाइन-ट्यूनिंग का समर्थन भी उपलब्ध है, साथ ही ओपनकोड, क्लॉड कोड, ओपनक्लॉ और हर्मेस सहित एजेंट सिस्टम के लिए फॉर्मेटिंग भी उपलब्ध है। इसके अलावा, फीनिक्स टेक बताता है कि द्वितीयक आईटी विषयों का कवरेज सुपरसीएलयू एजेंटों के परिणाम देता है जो Qwen के अग्रणी मॉडलों के तुलनीय हैं, और दावा करता है कि 4-बिट क्वांटाइजेशन लंबी संदर्भ के साथ स्थानीय लॉन्च के लिए मेमोरी खपत को 15 जीबी तक कम कर सकता है, हालांकि ये बयान अभी तक स्वतंत्र सत्यापन से पहले तृतीय-पक्ष या कंपनी द्वारा किए गए दावे हैं।

Huawei Ascend स्टैक पर काम करने वाली टीमों को MindSpore पर स्पष्ट रूप से प्रशिक्षित Xing4.0-29B-A4B वज़न प्रदान किए जाते हैं और Apache इकोसिस्टम में इन्फेरेंस के लिए खुले इंटरफेस दिए जाते हैं। इस प्रकार, यह चीन टेलीकॉम का OSS प्रारूप में एजेंट MoE है, न कि केवल API पर आधारित बंद घोषणा।

समान कहानियाँ

शंघाई एआई लैब ने मेमोरी डिकोडर के साथ वैज्ञानिक मल्टीमॉडल मॉडल Intern-S2-397B जारी किया
और पढ़ें
pandaily.com

शंघाई एआई लैब ने मेमोरी डिकोडर के साथ वैज्ञानिक मल्टीमॉडल मॉडल Intern-S2-397B जारी किया

शंघाई एआई लेबोरेटरी ने Hugging Face और ModelScope प्लेटफॉर्म पर खुले वज़न वाला अपना वैज्ञानिक रूप से उन्मुख मल्टीमॉडल बेस मॉडल Intern-S2-397B प्रस्तुत किया है। यह घोषणा 13 सितंबर, 2026 को पुजियान इनोवेशन फोरम में प्रस्तुति और 21 सितंबर को प्रयोगशाला ब्रीफिंग के बाद हुई।

प्रयोगशाला का आधिकारिक अंग्रेजी नाम Shanghai AI Laboratory / Intern-S2 है। यह रिलीज़ प्रयोगशाला की हालिया प्रकाशनों, जैसे Atria Dawn, Intern Physical World Model W0 और NCP-ArchPreview से अलग है, क्योंकि यह किसी एजेंट या वर्ल्ड मॉडल की घोषणा के बजाय एक आर्किटेक्चर वाली वैज्ञानिक मॉडल के वज़न का रिलीज़ है।

Intern-S2 मॉडल लंबी अवधि के वैज्ञानिक कार्यों और एजेंट चक्रों को पूरा करने के लिए डिज़ाइन किया गया है। प्रयोगशाला की सामग्री में कनेक्टेबल मेमोरी डिकोडर (Memory Decoder) की उपस्थिति पर जोर दिया गया है, जो पूरी बेस मॉडल को पुनः प्रशिक्षित किए बिना डोमेन-विशिष्ट मॉड्यूल को जोड़ने की अनुमति देता है। उदाहरण के लिए, जैविक प्रयोगों में Intern-MemDec-4B का उपयोग करने से जैविक निर्देशों पर औसत स्कोर लगभग 56.92 से बढ़कर 60.32 हो गया, जबकि मुख्य मॉडल के स्तर पर समग्र परिणाम बरकरार रहे।

Hugging Face पर बताया गया है कि Intern-S2-397B मैप में लगभग 403 बिलियन पैरामीटर हैं। मॉडल को कच्चे वैज्ञानिक साहित्य के पेजों पर विज़ुअल प्री-ट्रेनिंग, 20 से अधिक क्षेत्रों में मल्टी-डोमेन वैज्ञानिक रीइन्फोर्समेंट लर्निंग, और आइसोलेटेड वातावरण में लॉन्ग-हॉरिजन एजेंट रीइन्फोर्समेंट लर्निंग पर प्रशिक्षित किया गया है। संचालन के लिए LMDeploy, vLLM और SGLang के माध्यम से सेवा पथ प्रदान किए गए हैं, और Intern का आधिकारिक API एंडपॉइंट प्रलेखित है।

शंघाई एआई लेबोरेटरी बताती है कि Intern-S2 को Huawei के Ascend कंप्यूटिंग स्टैक के साथ कंप्यूटिंग, कनेक्टिविटी और मेमोरी पहलुओं पर गहराई से अनुकूलित किया गया है। इसके अलावा, इस मॉडल को प्रयोगशाला के Intern DuanYan वैज्ञानिक खोज प्लेटफॉर्म में एकीकृत किया जाएगा, जो जीवन विज्ञान, सामग्री, सेमीकंडक्टर और संबंधित विषयों को कवर करता है। विक्रेता के बयानों के अनुसार, Intern-S2 ज्ञान, कोड और एजेंट सेटों में ओपन-सोर्स मॉडलों में पहले स्थान पर है, जिसमें जीव विज्ञान और सामग्री विज्ञान के कार्यों में मजबूत परिणाम दिखाए गए हैं; हालांकि, ये आंकड़े अभी भी स्वतंत्र परीक्षणों से पहले प्रयोगशाला के डेटा हैं।

शोध समूहों के लिए अंतिम परिणाम Intern-S2-397B के डाउनलोड करने योग्य वज़न तक पहुंच है, जो मेमोरी डिकोडर दस्तावेज़ीकरण और Ascend के साथ सहयोग पर एक नोट के साथ आता है। इस प्रकार, यह केवल एक बंद API पर आधारित घोषणा नहीं है, बल्कि समुदाय द्वारा उपयोग के लिए अपडेट किया गया एक खुला मल्टीमॉडल बेस मॉडल है।

शंघाई एआई लैब ने 744 बिलियन पैरामीटर वाले MoE आर्किटेक्चर पर आधारित Atria Dawn मॉडल का प्रीव्यू जारी किया
और पढ़ें
pandaily.com

शंघाई एआई लैब ने 744 बिलियन पैरामीटर वाले MoE आर्किटेक्चर पर आधारित Atria Dawn मॉडल का प्रीव्यू जारी किया

शंघाई आर्टिफिशियल इंटेलिजेंस लेबोरेटरी ने Atria Dawn Preview प्रस्तुत किया है — एक एजेंटिक भाषा मॉडल जिसे केवल प्रदर्शन चैट के लिए नहीं, बल्कि जटिल अनुसंधान और इंजीनियरिंग प्रक्रियाओं का समर्थन करने के लिए विकसित किया गया है। यह प्रीव्यू मॉडल 744 बिलियन पैरामीटर के Mixture-of-Experts (MoE) के आधार पर है, जिसे GLM-5.2 के रूप में पहचाना गया है।

इस मॉडल की संदर्भ विंडो 256K है और इसे MIT लाइसेंस के तहत वितरित किया जाता है। चेकपॉइंट्स, मानक निर्देशिका और FP8-instruct प्रारूप में क्वांटाइज़्ड दोनों, Hugging Face और ModelScope प्लेटफॉर्म पर उपलब्ध हैं। इसके अलावा, अंतरराष्ट्रीय और चीनी क्षेत्रों में उपयोगकर्ताओं के लिए एपीआई तक पहुंच प्रदान की जाती है।

मॉडल के दस्तावेज़ीकरण और arXiv पर सहवर्ती लेख के अनुसार, सिस्टम को Verifiable Experience Pipeline का उपयोग करके प्रशिक्षित किया गया था। यह पाइपलाइन टूल-मध्यस्थता वाले तर्क को निष्पादन वातावरण और बाहरी रूप से सत्यापन योग्य परिणामों से जोड़ती है। मुख्य अवधारणा पूर्ण निष्पादन चक्र में निहित है: समस्या का विश्लेषण करना, समाधान डिजाइन करना, उपकरणों को कॉल करना, कोड और प्रयोगों को निष्पादित करना, परिणामों की जाँच करना और पर्यावरण से निरंतर फीडबैक के भीतर विफलताओं से उबरना, न कि केवल एक एकल उत्तर प्राप्त करना।

प्रयोगशाला ने मॉडल की क्षमताओं को खोज, निर्माण, वितरण और साइबर सुरक्षा को कवर करने वाले परिदृश्यों के लिए समूहीकृत किया है। इन परिदृश्यों में गहन शोध, सॉफ्टवेयर विकास, संरचित कार्यालय सामग्री तैयार करना और अधिकृत सुरक्षा ऑडिट शामिल हैं।

प्रयोगशाला द्वारा प्रस्तुत 16 बेंचमार्क पर मूल्यांकन में, Atria Dawn Preview ने पांच कार्यों में उच्चतम स्कोर प्रदर्शित किया। इनमें AutomationBench पर 53.8, BrowseComp पर 92.5, DeepSearchQA पर 96.0, BFCL v4 पर 77.0 और CyberGym पर 86.5 शामिल हैं। अन्य मेट्रिक्स प्रतिस्पर्धी बने हुए हैं, लेकिन उन्नत एजेंट बेस मॉडलों की तुलना में प्रमुख नहीं हैं।

यह रिलीज़ शंघाई एआई लैब के पिछले विकासों, जैसे Intern W0 और संबंधित NCP कार्यों से अलग है। Dawn को बहु-चरणीय वैज्ञानिक और इंजीनियरिंग परियोजनाओं के लिए एक ओपन एजेंट पार्टनर के रूप में स्थापित किया गया है, और वज़न जारी होने के साथ ही GitHub और Atria परियोजना की विशेष वेबसाइट पर सार्वजनिक संपत्ति भी प्रदान की गई है।

डेवलपर्स SGLang और vLLM जैसे फ्रेमवर्क के माध्यम से स्थानीय उपयोग के लिए वज़न डाउनलोड कर सकते हैं, या क्षेत्रीय एपीआई कंसोल का उपयोग कर सकते हैं। कोडेक्स-शैली के क्लाइंट टेक्स्ट-ओनली मोड सेटिंग्स का उपयोग करके रिस्पॉन्स एपीआई के साथ इंटरैक्ट कर सकते हैं। फिर भी, टीमों को दीर्घकालिक कार्यों के लिए AutomationBench और टूलचेन परिणामों को स्वयं दोहराने और लाइसेंसिंग तथा परिनियोजन की शर्तों की जांच करने की सलाह दी जाती है। 'प्रीव्यू' लेबल को गंभीरता से लेना महत्वपूर्ण है, क्योंकि प्रकाशित डेटासेट के बाहर एजेंट की विश्वसनीयता अभी भी एक खुला प्रश्न है, जबकि प्रयोगशालाएं कार्य सहायक से परियोजनाओं पर सहयोगात्मक कार्य की ओर बढ़ रही हैं।

लोकप्रिय