NaiveAI ने Naive-N0.5-Flash मॉडल जारी किया: MIT लाइसेंस के तहत 309B MoE, 1M संदर्भ के साथ
और पढ़ें
Pandaily
pandaily.com

NaiveAI ने Naive-N0.5-Flash मॉडल जारी किया: MIT लाइसेंस के तहत 309B MoE, 1M संदर्भ के साथ

NaiveAI कंपनी ने Hugging Face प्लेटफॉर्म पर ओपन-वेट्स मॉडल Naive-N0.5-Flash प्रस्तुत किया है। यह मॉडल मिश्रण-ऑफ-एक्सपर्ट्स (MoE) आर्किटेक्चर का प्रतिनिधित्व करता है, जिसे सॉफ्टवेयर कोडिंग और आर्टिफिशियल इंटेलिजेंस अनुसंधान के कार्यों के लिए डिज़ाइन किया गया है। मॉडल की जानकारी सितंबर 2026 के मध्य या अंत में प्रकाशित हुई थी।

उत्पाद का आधिकारिक नाम NaiveAI / Naive-N0.5-Flash है। तकनीकी दस्तावेज़ीकरण के अनुसार, कुल पैरामीटर संख्या लगभग 309 बिलियन है, जबकि सक्रिय भार 15.5 बिलियन हैं। मॉडल MIT लाइसेंस के तहत वितरित किया जाता है और इसमें इन्फेरेंस के लिए कोड के साथ-साथ एक मिलियन टोकन के संदर्भ विंडो के लिए नेटिव समर्थन शामिल है।

संदर्भ लंबाई स्लाइडिंग-विंडो अटेंशन (SWA) तंत्र और हल्के डीपसीक स्पार्स अटेंशन (DSA) के हाइब्रिड संयोजन के माध्यम से प्राप्त की जाती है, जो ग्रुप अटेंशन का उपयोग करता है। आर्किटेक्चर को मुख्य रूप से SWA–DSA अनुपात लगभग 5:1 के रूप में वर्णित किया गया है, जिसमें स्टैक में पूरी तरह से ध्यान देने वाले परतें अनुपस्थित हैं। मॉडल MiMo-V2.5 नामक एक ओपन मॉडल पर आधारित है, जिसके बाद पूर्ण स्क्रैच से प्री-ट्रेनिंग के बजाय फाइन-ट्यूनिंग और पोस्ट-ट्रेनिंग की जाती है।

सेवा के संबंध में, NaiveAI NaiveRT पर जोर देता है - एक इन्फेरेंस स्टैक जिसे एआई-केंद्रित शोध का उपयोग करके विकसित किया गया है। यह स्टैक मेगा-कर्नेल फ्यूजन, प्रोग्रामेटिक डिपेंडेंट लॉन्च और स्यूडो-डिकोडिंग को जोड़ता है। विक्रेता के आंकड़ों के अनुसार, मानक मोड में प्रति उपयोगकर्ता प्रसंस्करण गति लगभग 50 टोकन प्रति सेकंड और अल्ट्राफास्ट मोड में 2000 टोकन प्रति सेकंड तक पहुंच जाती है।

Hugging Face टैग इस बात पर जोर देते हैं कि मॉडल कोड के लिए टेक्स्ट जनरेशन, लंबी संदर्भ हैंडलिंग और एआई अनुसंधान कार्यों के लिए उपयुक्त है। यह मजबूत ओपन बेस पर फाइन-ट्यूनिंग और पोस्ट-ट्रेनिंग की घोषित अवधारणा के अनुरूप है जो कोडिंग एजेंटों के लिए सीमाओं को आगे बढ़ा सकती है। डेवलपर्स के लिए, जो इस सप्ताह चीनी MoE रिलीज़ की तुलना कर रहे हैं, Naive-N0.5-Flash एक विशिष्ट उदाहरण है: MIT लाइसेंस के तहत 309B / 15.5B MoE के साथ एक मिलियन टोकन का हाइब्रिड संदर्भ, जो लागत या उत्पाद लॉन्च के बजाय वास्तुकला की खबर प्रस्तुत करता है।

समान कहानियाँ

Xiaomi के शोधकर्ताओं ने टोकन प्रीप्रोसेसिंग में कम्प्यूटेशनल लागत को कम करने के लिए MiMo-V3 के लिए HySparse2 प्रस्तुत किया
और पढ़ें
pandaily.com

Xiaomi के शोधकर्ताओं ने टोकन प्रीप्रोसेसिंग में कम्प्यूटेशनल लागत को कम करने के लिए MiMo-V3 के लिए HySparse2 प्रस्तुत किया

Xiaomi की LLM-Core कंपनी के शोधकर्ताओं ने arXiv (2609.26368) पर एक पेपर में HySparse2 आर्किटेक्चर प्रकाशित किया है। यह तकनीक दो-स्तरीय कुंजी-मूल्य (KV) साझाकरण तंत्र के साथ एक हाइब्रिड विरल ध्यान (sparse attention) का प्रतिनिधित्व करती है और लंबी क्षितिज वाली MiMo-V3 वर्ग के एजेंट कार्यों के साथ काम करने के लिए डिज़ाइन की गई है।

इस विकास के आधिकारिक ब्रांडिंग में Xiaomi, MiMo और HySparse2 शामिल हैं। यह प्रकाशन खुले वजन वाले पिछले MiMo-V2.6 समीक्षाओं से अलग, अनुसंधान आर्किटेक्चर और घोषित प्रदर्शन मेट्रिक्स पर केंद्रित है।

HySparse2 मॉडल के मुख्य भाग को YOCO शैली के सेल्फ-डिकोडर और क्रॉस-डिकोडर में विभाजित करता है। बाहरी स्तर पर, KV ब्रिजिंग तंत्र केवल पूर्ण ध्यान परतों को जोड़ता है, जबकि क्रॉस-डिकोडर के KV कैश को सेल्फ-डिकोडर की छिपी हुई अवस्थाओं से प्रोजेक्ट किया जाता है। आंतरिक स्तर पर, उन्नत KV पुन: उपयोग प्रत्येक हाइब्रिड ब्लॉक के भीतर HySparse शैली में साझाकरण को बनाए रखता है, हालांकि यह ब्लॉक स्तर के चयन से टोकन स्तर के चयन में बदल जाता है। इसके अलावा, स्लाइडिंग विंडो की अलग शाखा के बजाय, विरल चयन में हाल की स्थानीय विंडो को अनिवार्य रूप से शामिल किया जाता है।

इन परिवर्तनों के कारण, प्रीफिल चरण सेल्फ-डिकोडर के बाद समाप्त हो सकता है, क्रॉस-डिकोडर परतों को कैश बनाने के दौरान दरकिनार करते हुए। यह मल्टी-स्टेप एजेंटों के लिए विशेष रूप से उपयोगी है जहां इनपुट टोकन काफी हद तक टूल ऑब्जर्वेशन से बने होते हैं।

समान डेटा और ग्राफ़ पर प्रशिक्षित 80B-A3B आकार के MoE मॉडल का उपयोग करते समय, लेख बताता है कि मामूली फाइन-ट्यूनिंग के बाद HySparse2 क्रमशः MRCR-v2 और RULER-v2 के प्रदर्शन को 11.30 और 19.81 प्रतिशत अंक तक बढ़ाता है, जबकि 256 हजार टोकन के संदर्भ में AgentPPL और LongPPL के निचले मानों को बनाए रखता है। 1 मिलियन टोकन के साथ काम करते समय, विश्लेषण में HySparse की तुलना में प्रीप्रोसेसिंग में FLOPs में 2.92× और Hybrid SWA की तुलना में 5.02× की कमी दिखाई देती है। यह भी नोट किया गया है कि निर्दिष्ट बेस मॉडलों के लिए FP8 KV कैश का आकार क्रमशः 6.72 GB और 12.09 GB की तुलना में लगभग 2.69 GB तक कम हो जाता है।

एब्लेशन विश्लेषण से पता चलता है कि टोकन स्तर का चयन निश्चित ध्यान बजट के साथ अधिक मजबूत खोज को बढ़ावा देता है। 290B-A8B तक स्केल करने पर, KV ब्रिजिंग तंत्र तुलनीय गुणवत्ता बनाए रखता है, साथ ही प्रीप्रोसेसिंग के दौरान प्रारंभिक निकास की अनुमति भी देता है। चीनी LLM सिस्टम के शोध का अध्ययन करने वाले विशेषज्ञों के लिए, HySparse2 MiMo-V3 के प्रदर्शन दावों के पीछे एक वास्तुशिल्प संकेत है, न कि खुले वजन वाला नया रिलीज़।

शंघाई एआई लैब ने मेमोरी डिकोडर के साथ वैज्ञानिक मल्टीमॉडल मॉडल Intern-S2-397B जारी किया
और पढ़ें
pandaily.com

शंघाई एआई लैब ने मेमोरी डिकोडर के साथ वैज्ञानिक मल्टीमॉडल मॉडल Intern-S2-397B जारी किया

शंघाई एआई लेबोरेटरी ने Hugging Face और ModelScope प्लेटफॉर्म पर खुले वज़न वाला अपना वैज्ञानिक रूप से उन्मुख मल्टीमॉडल बेस मॉडल Intern-S2-397B प्रस्तुत किया है। यह घोषणा 13 सितंबर, 2026 को पुजियान इनोवेशन फोरम में प्रस्तुति और 21 सितंबर को प्रयोगशाला ब्रीफिंग के बाद हुई।

प्रयोगशाला का आधिकारिक अंग्रेजी नाम Shanghai AI Laboratory / Intern-S2 है। यह रिलीज़ प्रयोगशाला की हालिया प्रकाशनों, जैसे Atria Dawn, Intern Physical World Model W0 और NCP-ArchPreview से अलग है, क्योंकि यह किसी एजेंट या वर्ल्ड मॉडल की घोषणा के बजाय एक आर्किटेक्चर वाली वैज्ञानिक मॉडल के वज़न का रिलीज़ है।

Intern-S2 मॉडल लंबी अवधि के वैज्ञानिक कार्यों और एजेंट चक्रों को पूरा करने के लिए डिज़ाइन किया गया है। प्रयोगशाला की सामग्री में कनेक्टेबल मेमोरी डिकोडर (Memory Decoder) की उपस्थिति पर जोर दिया गया है, जो पूरी बेस मॉडल को पुनः प्रशिक्षित किए बिना डोमेन-विशिष्ट मॉड्यूल को जोड़ने की अनुमति देता है। उदाहरण के लिए, जैविक प्रयोगों में Intern-MemDec-4B का उपयोग करने से जैविक निर्देशों पर औसत स्कोर लगभग 56.92 से बढ़कर 60.32 हो गया, जबकि मुख्य मॉडल के स्तर पर समग्र परिणाम बरकरार रहे।

Hugging Face पर बताया गया है कि Intern-S2-397B मैप में लगभग 403 बिलियन पैरामीटर हैं। मॉडल को कच्चे वैज्ञानिक साहित्य के पेजों पर विज़ुअल प्री-ट्रेनिंग, 20 से अधिक क्षेत्रों में मल्टी-डोमेन वैज्ञानिक रीइन्फोर्समेंट लर्निंग, और आइसोलेटेड वातावरण में लॉन्ग-हॉरिजन एजेंट रीइन्फोर्समेंट लर्निंग पर प्रशिक्षित किया गया है। संचालन के लिए LMDeploy, vLLM और SGLang के माध्यम से सेवा पथ प्रदान किए गए हैं, और Intern का आधिकारिक API एंडपॉइंट प्रलेखित है।

शंघाई एआई लेबोरेटरी बताती है कि Intern-S2 को Huawei के Ascend कंप्यूटिंग स्टैक के साथ कंप्यूटिंग, कनेक्टिविटी और मेमोरी पहलुओं पर गहराई से अनुकूलित किया गया है। इसके अलावा, इस मॉडल को प्रयोगशाला के Intern DuanYan वैज्ञानिक खोज प्लेटफॉर्म में एकीकृत किया जाएगा, जो जीवन विज्ञान, सामग्री, सेमीकंडक्टर और संबंधित विषयों को कवर करता है। विक्रेता के बयानों के अनुसार, Intern-S2 ज्ञान, कोड और एजेंट सेटों में ओपन-सोर्स मॉडलों में पहले स्थान पर है, जिसमें जीव विज्ञान और सामग्री विज्ञान के कार्यों में मजबूत परिणाम दिखाए गए हैं; हालांकि, ये आंकड़े अभी भी स्वतंत्र परीक्षणों से पहले प्रयोगशाला के डेटा हैं।

शोध समूहों के लिए अंतिम परिणाम Intern-S2-397B के डाउनलोड करने योग्य वज़न तक पहुंच है, जो मेमोरी डिकोडर दस्तावेज़ीकरण और Ascend के साथ सहयोग पर एक नोट के साथ आता है। इस प्रकार, यह केवल एक बंद API पर आधारित घोषणा नहीं है, बल्कि समुदाय द्वारा उपयोग के लिए अपडेट किया गया एक खुला मल्टीमॉडल बेस मॉडल है।

शंघाई एआई लैब ने 744 बिलियन पैरामीटर वाले MoE आर्किटेक्चर पर आधारित Atria Dawn मॉडल का प्रीव्यू जारी किया
और पढ़ें
pandaily.com

शंघाई एआई लैब ने 744 बिलियन पैरामीटर वाले MoE आर्किटेक्चर पर आधारित Atria Dawn मॉडल का प्रीव्यू जारी किया

शंघाई आर्टिफिशियल इंटेलिजेंस लेबोरेटरी ने Atria Dawn Preview प्रस्तुत किया है — एक एजेंटिक भाषा मॉडल जिसे केवल प्रदर्शन चैट के लिए नहीं, बल्कि जटिल अनुसंधान और इंजीनियरिंग प्रक्रियाओं का समर्थन करने के लिए विकसित किया गया है। यह प्रीव्यू मॉडल 744 बिलियन पैरामीटर के Mixture-of-Experts (MoE) के आधार पर है, जिसे GLM-5.2 के रूप में पहचाना गया है।

इस मॉडल की संदर्भ विंडो 256K है और इसे MIT लाइसेंस के तहत वितरित किया जाता है। चेकपॉइंट्स, मानक निर्देशिका और FP8-instruct प्रारूप में क्वांटाइज़्ड दोनों, Hugging Face और ModelScope प्लेटफॉर्म पर उपलब्ध हैं। इसके अलावा, अंतरराष्ट्रीय और चीनी क्षेत्रों में उपयोगकर्ताओं के लिए एपीआई तक पहुंच प्रदान की जाती है।

मॉडल के दस्तावेज़ीकरण और arXiv पर सहवर्ती लेख के अनुसार, सिस्टम को Verifiable Experience Pipeline का उपयोग करके प्रशिक्षित किया गया था। यह पाइपलाइन टूल-मध्यस्थता वाले तर्क को निष्पादन वातावरण और बाहरी रूप से सत्यापन योग्य परिणामों से जोड़ती है। मुख्य अवधारणा पूर्ण निष्पादन चक्र में निहित है: समस्या का विश्लेषण करना, समाधान डिजाइन करना, उपकरणों को कॉल करना, कोड और प्रयोगों को निष्पादित करना, परिणामों की जाँच करना और पर्यावरण से निरंतर फीडबैक के भीतर विफलताओं से उबरना, न कि केवल एक एकल उत्तर प्राप्त करना।

प्रयोगशाला ने मॉडल की क्षमताओं को खोज, निर्माण, वितरण और साइबर सुरक्षा को कवर करने वाले परिदृश्यों के लिए समूहीकृत किया है। इन परिदृश्यों में गहन शोध, सॉफ्टवेयर विकास, संरचित कार्यालय सामग्री तैयार करना और अधिकृत सुरक्षा ऑडिट शामिल हैं।

प्रयोगशाला द्वारा प्रस्तुत 16 बेंचमार्क पर मूल्यांकन में, Atria Dawn Preview ने पांच कार्यों में उच्चतम स्कोर प्रदर्शित किया। इनमें AutomationBench पर 53.8, BrowseComp पर 92.5, DeepSearchQA पर 96.0, BFCL v4 पर 77.0 और CyberGym पर 86.5 शामिल हैं। अन्य मेट्रिक्स प्रतिस्पर्धी बने हुए हैं, लेकिन उन्नत एजेंट बेस मॉडलों की तुलना में प्रमुख नहीं हैं।

यह रिलीज़ शंघाई एआई लैब के पिछले विकासों, जैसे Intern W0 और संबंधित NCP कार्यों से अलग है। Dawn को बहु-चरणीय वैज्ञानिक और इंजीनियरिंग परियोजनाओं के लिए एक ओपन एजेंट पार्टनर के रूप में स्थापित किया गया है, और वज़न जारी होने के साथ ही GitHub और Atria परियोजना की विशेष वेबसाइट पर सार्वजनिक संपत्ति भी प्रदान की गई है।

डेवलपर्स SGLang और vLLM जैसे फ्रेमवर्क के माध्यम से स्थानीय उपयोग के लिए वज़न डाउनलोड कर सकते हैं, या क्षेत्रीय एपीआई कंसोल का उपयोग कर सकते हैं। कोडेक्स-शैली के क्लाइंट टेक्स्ट-ओनली मोड सेटिंग्स का उपयोग करके रिस्पॉन्स एपीआई के साथ इंटरैक्ट कर सकते हैं। फिर भी, टीमों को दीर्घकालिक कार्यों के लिए AutomationBench और टूलचेन परिणामों को स्वयं दोहराने और लाइसेंसिंग तथा परिनियोजन की शर्तों की जांच करने की सलाह दी जाती है। 'प्रीव्यू' लेबल को गंभीरता से लेना महत्वपूर्ण है, क्योंकि प्रकाशित डेटासेट के बाहर एजेंट की विश्वसनीयता अभी भी एक खुला प्रश्न है, जबकि प्रयोगशालाएं कार्य सहायक से परियोजनाओं पर सहयोगात्मक कार्य की ओर बढ़ रही हैं।

लोकप्रिय