StepFun ने Step 5 का प्रीव्यू जारी किया: 600 बिलियन पैरामीटर वाला मॉडल, स्पार्स MoE और 1 मिलियन टोकन संदर्भ के साथ
और पढ़ें
Pandaily
pandaily.com

StepFun ने Step 5 का प्रीव्यू जारी किया: 600 बिलियन पैरामीटर वाला मॉडल, स्पार्स MoE और 1 मिलियन टोकन संदर्भ के साथ

स्टेपफन कंपनी ने स्टेप 5 मॉडल का प्रीव्यू जारी किया है, जो एक बेस मॉडल है जिसमें स्पार्स मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) आर्किटेक्चर है और इसमें लगभग 600 बिलियन कुल पैरामीटर हैं, जबकि प्रति टोकन लगभग 27 बिलियन सक्रिय होते हैं। यह रिलीज़ लंबे समय तक चलने वाले एजेंट वर्कलोड पर केंद्रित है, जिसमें एआई का उपयोग करके कोड विकास, सॉफ्टवेयर इंजीनियरिंग, वित्तीय विश्लेषण और पेशेवर ज्ञान कार्य शामिल हैं। मॉडल एक मिलियन टोकन की संदर्भ विंडो का समर्थन करता है और पाठ और ग्राफिक दोनों इनपुट स्वीकार करता है। स्टेपफन ने बताया कि एपीआई के माध्यम से एक्सेस पहले ही खोल दिया गया है, और मॉडल वेट्स 15 अक्टूबर को सार्वजनिक रूप से उपलब्ध होने की योजना है।

नेटवर्क का विस्तार करने के बजाय, स्टेप 5 प्रीव्यू 92 परतों वाला एक संकीर्ण, गहरा ट्रांसफार्मर आर्किटेक्चर उपयोग करता है। कंपनी का दावा है कि गहरे स्टैक लंबी सूचना पासिंग पथ प्रदान करते हैं, जो लंबे प्रीफिलिंग के दौरान निहित बहु-चरणीय तर्क के लिए आवश्यक है, जब एजेंट टूल का उपयोग करके खोज करते हैं, कोड चलाते हैं और परिणामों को संसाधित करते हैं। एक मिलियन टोकन की सत्र व्यावहारिकता का समर्थन करने के लिए, मॉडल ब्लॉक द्वारा टोकन को समूहीकृत करने के साथ स्पार्स ग्रुपेड-क्वेरी अटेंशन (Sparse Grouped-Query Attention) को शामिल करता है। स्टेपफन के अनुसार, यह सघन बेस मॉडल की तुलना में इंडेक्सर और टॉप-के चयन की लागत को लगभग आठवें हिस्से तक कम करता है, जबकि ओवरलैपिंग पड़ोसी चयन को भी जोड़ता है।

प्रशिक्षण प्रक्रिया में नीति पर दीर्घकालिक क्षितिज के साथ सुदृढीकरण शिक्षण (on-policy long-horizon reinforcement learning) पर जोर दिया गया है, साथ ही MoE रूटिंग स्तर पर बिट स्तर पर प्रशिक्षण और अनुमान के संरेखण पर भी ध्यान दिया गया है। इसके अलावा, लोड-जागरूक शेड्यूलिंग (load-aware scheduling), MTP-3 स्पेक्युलेटिव डिकोडिंग, FP8 MoE और KV-कैश ऑफलोडिंग जैसी तकनीकों का उपयोग किया जाता है। स्टेपफन ने दीर्घकालिक क्षितिज के लिए एंड-टू-एंड आरएल प्रक्रिया में तीन गुना से अधिक त्वरण और नमूना रजिस्ट्री पर हानि मेट्रिक एक प्रतिशत से नीचे दर्ज की है। इस मॉडल का उपयोग मानव-नियंत्रित डेटा पाइपलाइन के भीतर भी किया जाता है, जो विज्ञान, सॉफ्टवेयर विकास और मशीन लर्निंग अनुसंधान को कवर करते हुए लाखों पैमाने पर सत्यापन योग्य जटिल कार्य उत्पन्न करता है।

एआई विश्लेषण के संबंध में, स्टेप 5 प्रीव्यू इंटेलिजेंस इंडेक्स पर लगभग 44 अंक प्राप्त करता है, जिसे स्टेपफन इस रेटिंग सिस्टम में ओपन-वेट्स मॉडलों में सर्वश्रेष्ठ में से एक के रूप में वर्गीकृत करती है। प्रकाशित कीमतों के अनुसार एपीआई की लागत प्रति मिलियन इनपुट टोकन पर लगभग 1 डॉलर और प्रति मिलियन आउटपुट टोकन पर 2.7 डॉलर है, जिसका आउटपुट गति लगभग 100 टोकन प्रति सेकंड है। मॉडल का मुख्य ध्यान वास्तुकला और एजेंट दक्षता पर है, जो इसे पिछले रिलीज़ स्टेप 3.5 फ्लैश और स्टेप 3.7 फ्लैश से अलग करता है, जो अक्टूबर में वेट्स उपलब्ध होने से पहले गहराई, स्पार्स लॉन्ग कॉन्टेक्स्ट और विश्वसनीय मल्टी-स्टेज टूल उपयोग पर जोर देता है।

समान कहानियाँ

शंघाई एआई लैब ने 744 बिलियन पैरामीटर वाले MoE आर्किटेक्चर पर आधारित Atria Dawn मॉडल का प्रीव्यू जारी किया
और पढ़ें
pandaily.com

शंघाई एआई लैब ने 744 बिलियन पैरामीटर वाले MoE आर्किटेक्चर पर आधारित Atria Dawn मॉडल का प्रीव्यू जारी किया

शंघाई आर्टिफिशियल इंटेलिजेंस लेबोरेटरी ने Atria Dawn Preview प्रस्तुत किया है — एक एजेंटिक भाषा मॉडल जिसे केवल प्रदर्शन चैट के लिए नहीं, बल्कि जटिल अनुसंधान और इंजीनियरिंग प्रक्रियाओं का समर्थन करने के लिए विकसित किया गया है। यह प्रीव्यू मॉडल 744 बिलियन पैरामीटर के Mixture-of-Experts (MoE) के आधार पर है, जिसे GLM-5.2 के रूप में पहचाना गया है।

इस मॉडल की संदर्भ विंडो 256K है और इसे MIT लाइसेंस के तहत वितरित किया जाता है। चेकपॉइंट्स, मानक निर्देशिका और FP8-instruct प्रारूप में क्वांटाइज़्ड दोनों, Hugging Face और ModelScope प्लेटफॉर्म पर उपलब्ध हैं। इसके अलावा, अंतरराष्ट्रीय और चीनी क्षेत्रों में उपयोगकर्ताओं के लिए एपीआई तक पहुंच प्रदान की जाती है।

मॉडल के दस्तावेज़ीकरण और arXiv पर सहवर्ती लेख के अनुसार, सिस्टम को Verifiable Experience Pipeline का उपयोग करके प्रशिक्षित किया गया था। यह पाइपलाइन टूल-मध्यस्थता वाले तर्क को निष्पादन वातावरण और बाहरी रूप से सत्यापन योग्य परिणामों से जोड़ती है। मुख्य अवधारणा पूर्ण निष्पादन चक्र में निहित है: समस्या का विश्लेषण करना, समाधान डिजाइन करना, उपकरणों को कॉल करना, कोड और प्रयोगों को निष्पादित करना, परिणामों की जाँच करना और पर्यावरण से निरंतर फीडबैक के भीतर विफलताओं से उबरना, न कि केवल एक एकल उत्तर प्राप्त करना।

प्रयोगशाला ने मॉडल की क्षमताओं को खोज, निर्माण, वितरण और साइबर सुरक्षा को कवर करने वाले परिदृश्यों के लिए समूहीकृत किया है। इन परिदृश्यों में गहन शोध, सॉफ्टवेयर विकास, संरचित कार्यालय सामग्री तैयार करना और अधिकृत सुरक्षा ऑडिट शामिल हैं।

प्रयोगशाला द्वारा प्रस्तुत 16 बेंचमार्क पर मूल्यांकन में, Atria Dawn Preview ने पांच कार्यों में उच्चतम स्कोर प्रदर्शित किया। इनमें AutomationBench पर 53.8, BrowseComp पर 92.5, DeepSearchQA पर 96.0, BFCL v4 पर 77.0 और CyberGym पर 86.5 शामिल हैं। अन्य मेट्रिक्स प्रतिस्पर्धी बने हुए हैं, लेकिन उन्नत एजेंट बेस मॉडलों की तुलना में प्रमुख नहीं हैं।

यह रिलीज़ शंघाई एआई लैब के पिछले विकासों, जैसे Intern W0 और संबंधित NCP कार्यों से अलग है। Dawn को बहु-चरणीय वैज्ञानिक और इंजीनियरिंग परियोजनाओं के लिए एक ओपन एजेंट पार्टनर के रूप में स्थापित किया गया है, और वज़न जारी होने के साथ ही GitHub और Atria परियोजना की विशेष वेबसाइट पर सार्वजनिक संपत्ति भी प्रदान की गई है।

डेवलपर्स SGLang और vLLM जैसे फ्रेमवर्क के माध्यम से स्थानीय उपयोग के लिए वज़न डाउनलोड कर सकते हैं, या क्षेत्रीय एपीआई कंसोल का उपयोग कर सकते हैं। कोडेक्स-शैली के क्लाइंट टेक्स्ट-ओनली मोड सेटिंग्स का उपयोग करके रिस्पॉन्स एपीआई के साथ इंटरैक्ट कर सकते हैं। फिर भी, टीमों को दीर्घकालिक कार्यों के लिए AutomationBench और टूलचेन परिणामों को स्वयं दोहराने और लाइसेंसिंग तथा परिनियोजन की शर्तों की जांच करने की सलाह दी जाती है। 'प्रीव्यू' लेबल को गंभीरता से लेना महत्वपूर्ण है, क्योंकि प्रकाशित डेटासेट के बाहर एजेंट की विश्वसनीयता अभी भी एक खुला प्रश्न है, जबकि प्रयोगशालाएं कार्य सहायक से परियोजनाओं पर सहयोगात्मक कार्य की ओर बढ़ रही हैं।

यूनिट्री ने यूनिफोएलएम-डब्ल्यूएलए-1.0 मॉडल प्रस्तुत किया - मानव सदृश रोबोटों के लिए एक मौलिक मॉडल
और पढ़ें
pandaily.com

यूनिट्री ने यूनिफोएलएम-डब्ल्यूएलए-1.0 मॉडल प्रस्तुत किया - मानव सदृश रोबोटों के लिए एक मौलिक मॉडल

यूनिट्री कंपनी ने 10 सितंबर को यूनिफोएलएम-डब्ल्यूएलए-1.0 प्रस्तुत किया, जो अगली पीढ़ी के मानव सदृश रोबोटों के लिए एक जनरेटिव मौलिक मॉडल है, जिसमें लगभग 6 अरब पैरामीटर हैं। कंपनी के बयान के अनुसार, वास्तविक रोबोट डेटा पर प्रशिक्षित एक नियंत्रण फ़ाइल, जिसकी अवधि लगभग 2500 घंटे है, 64 कार्यों का समन्वय कर सकती है, जिसमें पूरे शरीर की 10 मैनिपुलेशन और टेबल पर 54 मैनिपुलेशन शामिल हैं, साथ ही यह दो-उंगली वाले ग्रिपर और कई फुर्तीले पांच उंगली वाले हाथों दोनों के साथ काम कर सकती है।

यह रिलीज़ यूनिट्री के पिछले प्रदर्शन यूनिफोएलएम-एक्स2 स्पैरिंग से अलग है; यूनिफोएलएम-डब्ल्यूएलए-1.0 दैनिक घरेलू और डेस्क कार्यों को करने के लिए एक व्यापक 'विजन-लैंग्वेज-एक्शन' स्टैक प्रस्तुत करता है, न कि युद्ध-उन्मुख प्रदर्शन।

वास्तुकला के दृष्टिकोण से, यूनिफोएलएम-डब्ल्यूएलए-1.0 इंटरैक्शन-ओरिएंटेड वर्ल्ड मॉडलिंग पर आधारित है, जिसे एमएमडीआईटी एक्शन एक्सपर्ट द्वारा पूरक किया गया है। इस मूर्त तर्क चरण, जिसे यूनिफोएलएम-ईआर-1 कहा जाता है, Qwen3-VL-4B पर बनाया गया है और इसे 5 मिलियन से अधिक मूर्त नमूनों पर प्रशिक्षित किया गया है। ये नमूने बिंदु भविष्यवाणी, वस्तु का पता लगाना, मल्टी-इमेज रीजनिंग, 2डी-ट्रैजेक्टरी, 3डी-डिटेक्शन और स्थानिक प्रश्नों के उत्तर देने जैसे पहलुओं को कवर करते हैं, जो स्थानिक धारणा को बढ़ाते हैं, जबकि सामान्य छवि और पाठ डेटा के साथ सह-प्रशिक्षण के माध्यम से व्यापक 'विजन-लैंग्वेज' कौशल बनाए रखते हैं।

इसके अलावा, गतिशील क्षेत्रों की भविष्यवाणी दृश्य परिवर्तन निकालने के लिए ऑप्टिकल फ्लो का उपयोग करती है, उन्हें फिक्स्ड-लेंथ मास्क टोकन में VQ-VAE का उपयोग करके संपीड़ित करती है, और मॉडल को यह अनुमान लगाने के लिए 'विजन-लैंग्वेज' को प्रशिक्षित करती है कि इंटरैक्शन शुरू होने के बाद कौन से क्षेत्र हिलना शुरू करेंगे। रिज़िड क्वांटाइजेशन ऑफ वैक्टर के माध्यम से असतत एक्शन ट्रेनिंग, एकीकृत एक्शन स्पेस को एंड-इफेक्टर पोज़, हाथ के जोड़ों और निचले शरीर के जोड़ों में विभाजित करती है, इन टोकन को सामान्य समय चरणों के साथ संरेखित करती है और उन्हें यूनिफोएलएम-ईआर-फ्लो में फीड करती है। WLA मॉडल, जिसे उन्होंने जारी किया है, इस मल्टीमॉडल फ्रेमवर्क से रोबोट की निरंतर क्रियाओं को डिकोड करने के लिए एमएमडीआईटी एक्सपर्ट को शामिल करता है।

16 मल्टीमॉडल सेटों पर किए गए स्थानिक और मूर्त तर्क परीक्षणों में, यूनिट्री बताती है कि यूनिफोएलएम-ईआर-1-4बी सात परीक्षणों में ओपन मॉडल से आगे निकल जाता है। इसके अलावा, ओवरलैपिंग स्थानिक सेटों पर, यह Where2Place, BLINK spatial, CV-Bench और EmbSpatial जैसे मेट्रिक्स पर स्थानीय रूप से मालिकाना GPT-6 Astra से बेहतर प्रदर्शन करता है। प्रशिक्षण यूनिट्री ओपन डेटासेट और बिटरोबोट-एचआईडब्ल्यू-500 पर आधारित है, साथ ही वास्तविक रोबोट डेटा के अन्य स्रोतों पर भी आधारित है। वीडियो मूल्यांकन यूनिट्री जी1 हार्डवेयर पर तौलिये तह करने, फोन पैक करने, बिस्तर बनाने, जूते छांटने और बाथरूम साफ करने जैसे कार्यों को करने के लिए प्रदर्शित होते हैं - ऐसे कार्य जिनके लिए एक ही नीति के भीतर हाथों, एंड-इफेक्टर और निचले शरीर की समन्वित गति की आवश्यकता होती है।

यह ध्यान रखना महत्वपूर्ण है कि परियोजना पृष्ठ डेवलपर्स के लिए उपलब्ध है, हालांकि कोड, मॉडल और डेटासेट अभी भी 'जल्द आ रहा है' के रूप में चिह्नित हैं। यूनिट्री ने परियोजना को ओपन सोर्स बनाने के अपने इरादे की घोषणा की है और वास्तुकला और कार्य मैट्रिक्स पर दस्तावेज़ीकरण प्रकाशित किया है, लेकिन वज़न और डेटा कॉर्पस अभी भी डाउनलोड के लिए उपलब्ध नहीं हैं। इन संसाधनों के आने तक शोधकर्ताओं और इंटीग्रेटर्स के लिए व्यावहारिक संकेत सामान्य मानव सदृश आधार की प्रकट रोडमैप और बेंचमार्क तालिका है, न कि तृतीय-पक्ष रोबोटों के लिए तैयार नियंत्रण फ़ाइल।

OpenBMB ने डिवाइस पर चलने के लिए 4 बिलियन पैरामीटर से कम वजन का SOTA ओपन मॉडल MiniCPM5-2B जारी किया
और पढ़ें
pandaily.com

OpenBMB ने डिवाइस पर चलने के लिए 4 बिलियन पैरामीटर से कम वजन का SOTA ओपन मॉडल MiniCPM5-2B जारी किया

ओपनBMB, मॉडलबेस्ट से जुड़ा एक ओपन प्रोजेक्ट, ने सीधे डिवाइस पर चलने के लिए एक सघन भाषा मॉडल MiniCPM5-2B प्रस्तुत किया है। इस मॉडल में लगभग 2.52 बिलियन पैरामीटर हैं और यह Apache-2.0 लाइसेंस के तहत 131,072 टोकन की नेटिव कॉन्टेक्स्ट लंबाई का समर्थन करता है।

MiniCPM5-2B मिनीCPM5 श्रृंखला का दूसरा रिलीज़ है, जो MiniCPM5-1B के बाद आया है। यह LlamaForCausalLM की मानक संरचना का उपयोग करता है, जिसमें 42 परतें और ग्रुपेड-क्वेरी अटेंशन (grouped-query attention) शामिल है, जो 16 क्वेरी हेड्स और 2 की/वैल्यू हेड्स का उपयोग करता है। इसके कारण, मुख्य इंजन बिना कस्टम कर्नेल या मॉडल कोड फोर्क की आवश्यकता के मॉडल को लोड कर सकते हैं।

एम्बेडिंग के अलावा पैरामीटर लगभग 1.98 बिलियन हैं, जो मॉडल को 4 बिलियन पैरामीटर से कम वर्ग में रखने की अनुमति देता है, जो फोन, लैपटॉप और पेरिफेरल उपकरणों पर होस्टिंग के लिए उपयुक्त है।

34-बेंचमार्क डेटासेट पर तुलना करने पर, MiniCPM5-2B औसतन 53.9 स्कोर प्रदर्शित करता है, जो कई बड़े ओपन बेस मॉडलों से आगे निकल जाता है। इनमें Qwen3.5-4B ने 51.1 और granite-4.2-3B ने 42.7 स्कोर किया। वहीं, समान आकार के मॉडल जैसे LFM2.5-2.6B और Qwen3.5-2B पीछे रह जाते हैं।

मॉडल की ताकत कोडिंग एजेंटों, टूल उपयोग और लंबे संदर्भ से जानकारी निकालने के क्षेत्रों पर केंद्रित है। उदाहरण के लिए, LiveCodeBench v6 पर MiniCPM5-2B ने Qwen3.5-4B के 56.4 की तुलना में 69.1 स्कोर किया, और SWE-bench Verified पर 46.4 बनाम 33.6 स्कोर किया। उच्च परिणाम τ²-Bench Telecom (97.1), BFCL v4 (66.6) और NoLiMa (43.5 की तुलना में 68.1) पर भी प्राप्त किए गए।

गहन ज्ञान की आवश्यकता वाले कार्यों में, प्रदर्शन आकार की ऊपरी सीमा के करीब रहता है; उदाहरण के लिए, MMLU-Pro पर मॉडल ने 70.8 दिखाया, जबकि 4B आकार का बेंचमार्क मॉडल Qwen ने 78.0 हासिल किया। ओपनBMB विशेष रूप से आर्टिफिशियल एनालिसिस स्रोतों से प्राप्त पंक्तियों को चिह्नित करता है ताकि उपयोगकर्ता विक्रेता और तृतीय-पक्ष परिणामों के बीच अंतर कर सकें।

पोस्ट-ट्रेनिंग प्रक्रिया अल्ट्राडेटा स्तर के प्रबंधन का पालन करती थी: पहले लगभग 400 बिलियन टोकन का उपयोग करके गहन सोच के आधार पर सुपरवाइज्ड फाइन-ट्यूनिंग (supervised fine-tuning) की गई। फिर गणित, कोड, एजेंट और लेखन के लिए जस्टRL II एल्गोरिथम पर आधारित विशेष रीइन्फोर्समेंट-लर्निंग टीचर्स (reinforcement-learning teachers) लागू किए गए। अंतिम चरण ऑन-पॉलिसी डिस्टिलेशन (on-policy distillation) था, जिसने 16 RL विशेषज्ञों—जिनमें से पांच एजेंट थे—को एक अंतिम छात्र मॉडल में मिला दिया।

ओपनBMB तर्क और सामान्य सेटों में लगभग 10.96 अंकों की वृद्धि और एजेंट सेटों में 6.96 अंकों की वृद्धि को RL और डिस्टिलेशन चरण से जोड़ता है। प्रत्येक भाग के योगदान को सीधे मापने की क्षमता के लिए, कंपनी मध्यवर्ती नियंत्रण बिंदु जारी करती है: बेस, मिडट्रेन और SFT-केवल।

वजन के साथ, अल्ट्राडेटा कॉर्पोरेशन वेब, कोड, गणित, SFT और एजेंटों के लिए RL नमूनों को कवर करने वाले डेटासेट प्रकाशित करते हैं, जिससे परिणामों को पुन: उत्पन्न करना संभव हो जाता है। रनटाइम समर्थन में vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX, LiteRT और मल्टी-चिप FlagOS बिल्ड शामिल हैं। स्थानीय सहायकों के लिए GGUF, MLX और GPTQ पैकेज प्रदान किए जाते हैं, जिन्हें डेटा सेंटर जीपीयू का उपयोग किए बिना टूल कॉल करने और लंबे संदर्भ के साथ काम करने की आवश्यकता होती है।

डिवाइस पर काम करने पर ध्यान केंद्रित करने वाले डेवलपर्स के लिए, MiniCPM5-2B को सामान्य ज्ञान के विशालकाय के रूप में नहीं, बल्कि Apache लाइसेंस वाला एक कॉम्पैक्ट एजेंट और कोडिंग साथी के रूप में स्थापित किया गया है, जो प्रकाशित औसत स्कोर के आधार पर कुछ 4B क्लास के ओपन बेस मॉडलों से बेहतर प्रदर्शन करता है।

लोकप्रिय