स्टेपफन कंपनी ने स्टेप 5 मॉडल का प्रीव्यू जारी किया है, जो एक बेस मॉडल है जिसमें स्पार्स मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) आर्किटेक्चर है और इसमें लगभग 600 बिलियन कुल पैरामीटर हैं, जबकि प्रति टोकन लगभग 27 बिलियन सक्रिय होते हैं। यह रिलीज़ लंबे समय तक चलने वाले एजेंट वर्कलोड पर केंद्रित है, जिसमें एआई का उपयोग करके कोड विकास, सॉफ्टवेयर इंजीनियरिंग, वित्तीय विश्लेषण और पेशेवर ज्ञान कार्य शामिल हैं। मॉडल एक मिलियन टोकन की संदर्भ विंडो का समर्थन करता है और पाठ और ग्राफिक दोनों इनपुट स्वीकार करता है। स्टेपफन ने बताया कि एपीआई के माध्यम से एक्सेस पहले ही खोल दिया गया है, और मॉडल वेट्स 15 अक्टूबर को सार्वजनिक रूप से उपलब्ध होने की योजना है।
नेटवर्क का विस्तार करने के बजाय, स्टेप 5 प्रीव्यू 92 परतों वाला एक संकीर्ण, गहरा ट्रांसफार्मर आर्किटेक्चर उपयोग करता है। कंपनी का दावा है कि गहरे स्टैक लंबी सूचना पासिंग पथ प्रदान करते हैं, जो लंबे प्रीफिलिंग के दौरान निहित बहु-चरणीय तर्क के लिए आवश्यक है, जब एजेंट टूल का उपयोग करके खोज करते हैं, कोड चलाते हैं और परिणामों को संसाधित करते हैं। एक मिलियन टोकन की सत्र व्यावहारिकता का समर्थन करने के लिए, मॉडल ब्लॉक द्वारा टोकन को समूहीकृत करने के साथ स्पार्स ग्रुपेड-क्वेरी अटेंशन (Sparse Grouped-Query Attention) को शामिल करता है। स्टेपफन के अनुसार, यह सघन बेस मॉडल की तुलना में इंडेक्सर और टॉप-के चयन की लागत को लगभग आठवें हिस्से तक कम करता है, जबकि ओवरलैपिंग पड़ोसी चयन को भी जोड़ता है।
प्रशिक्षण प्रक्रिया में नीति पर दीर्घकालिक क्षितिज के साथ सुदृढीकरण शिक्षण (on-policy long-horizon reinforcement learning) पर जोर दिया गया है, साथ ही MoE रूटिंग स्तर पर बिट स्तर पर प्रशिक्षण और अनुमान के संरेखण पर भी ध्यान दिया गया है। इसके अलावा, लोड-जागरूक शेड्यूलिंग (load-aware scheduling), MTP-3 स्पेक्युलेटिव डिकोडिंग, FP8 MoE और KV-कैश ऑफलोडिंग जैसी तकनीकों का उपयोग किया जाता है। स्टेपफन ने दीर्घकालिक क्षितिज के लिए एंड-टू-एंड आरएल प्रक्रिया में तीन गुना से अधिक त्वरण और नमूना रजिस्ट्री पर हानि मेट्रिक एक प्रतिशत से नीचे दर्ज की है। इस मॉडल का उपयोग मानव-नियंत्रित डेटा पाइपलाइन के भीतर भी किया जाता है, जो विज्ञान, सॉफ्टवेयर विकास और मशीन लर्निंग अनुसंधान को कवर करते हुए लाखों पैमाने पर सत्यापन योग्य जटिल कार्य उत्पन्न करता है।
एआई विश्लेषण के संबंध में, स्टेप 5 प्रीव्यू इंटेलिजेंस इंडेक्स पर लगभग 44 अंक प्राप्त करता है, जिसे स्टेपफन इस रेटिंग सिस्टम में ओपन-वेट्स मॉडलों में सर्वश्रेष्ठ में से एक के रूप में वर्गीकृत करती है। प्रकाशित कीमतों के अनुसार एपीआई की लागत प्रति मिलियन इनपुट टोकन पर लगभग 1 डॉलर और प्रति मिलियन आउटपुट टोकन पर 2.7 डॉलर है, जिसका आउटपुट गति लगभग 100 टोकन प्रति सेकंड है। मॉडल का मुख्य ध्यान वास्तुकला और एजेंट दक्षता पर है, जो इसे पिछले रिलीज़ स्टेप 3.5 फ्लैश और स्टेप 3.7 फ्लैश से अलग करता है, जो अक्टूबर में वेट्स उपलब्ध होने से पहले गहराई, स्पार्स लॉन्ग कॉन्टेक्स्ट और विश्वसनीय मल्टी-स्टेज टूल उपयोग पर जोर देता है।



