शंघाई एआई लैब और एसजेटीयू ने लेटेंट स्पेस के साथ NCP-ArchPreview मॉडल प्रस्तुत किया
और पढ़ें
Pandaily
pandaily.com

शंघाई एआई लैब और एसजेटीयू ने लेटेंट स्पेस के साथ NCP-ArchPreview मॉडल प्रस्तुत किया

शंघाई आर्टिफिशियल इंटेलिजेंस लेबोरेटरी (Shanghai Artificial Intelligence Laboratory) की NCP टीम ने शंघाई जियाओटोंग विश्वविद्यालय (Shanghai Jiao Tong University) की LUMIA Lab के साथ मिलकर NCP-ArchPreview जारी किया है - एक ओपन लैंग्वेज मॉडल जिसमें लेटेंट स्पेस है और जिसमें लगभग 8.9 बिलियन पैरामीटर हैं।

यह मॉडल मानक अगले टोकन भविष्यवाणी और अगली अवधारणा भविष्यवाणी (Next Concept Prediction) दोनों को एक साथ प्रशिक्षित करता है। तकनीकी रिपोर्ट arXiv पर 2609.10715 के तहत उपलब्ध है, और Hugging Face के लिए चेकपॉइंट्स ArchSpace-Collection में हैं। मूल्यांकन और इन्फेरेंस के लिए कोड पथ भी प्रकाशित किए गए हैं, जिनमें InternLM टूलकिट और LUMIA के मूल्यांकन रिपॉजिटरी के माध्यम से लिंक शामिल हैं।

यह परियोजना आज तक के सबसे बड़े लेटेंट स्पेस लैंग्वेज मॉडल प्रदर्शनों में से एक का प्रतिनिधित्व करती है, जिसे ट्रिलियन टोकन से अधिक के पैमाने पर प्रशिक्षित किया गया है।

केवल अगले टोकन की भविष्यवाणी करने के बजाय, NCP-ArchPreview उन असतत अवधारणाओं की भविष्यवाणी करने में सक्षम है जो कई टोकन को कवर करती हैं। इसके लिए मॉडल की आंतरिक अवस्थाओं पर आधारित एक उत्पादक रूप से क्वांटाइज्ड अवधारणा शब्दावली बनाई गई थी। एक विशेष अवधारणा मॉड्यूल भविष्य की अवधारणाओं की भविष्यवाणी करता है, और इन भविष्यवाणियों का उपयोग टोकन स्तर पर पीढ़ी को निर्देशित करने के लिए किया जाता है।

एनकोडर, कॉन्सेप्ट मॉड्यूल और डिकोडर हिडन लेयर आकार 4096 और अनुपात 16/8/16 के साथ एक कारण ट्रांसफार्मर आर्किटेक्चर का उपयोग करते हैं। अवधारणाएं प्रत्येक चार टोकन की स्थिति को संपीड़ित करती हैं, और उत्पादक क्वांटाइजेशन 128 कोड शब्दों वाले 32 शब्दकोशों पर लागू होता है। पीढ़ी NCPOlmo3ForCausalLM प्रकार की आर्किटेक्चर में अगले टोकन भविष्यवाणी के परिचित इंटरफ़ेस को बनाए रखती है, जिससे मॉडल का मूल्यांकन और उपयोग एक सामान्य ऑटोरेग्रेसिव चेकपॉइंट के रूप में किया जा सकता है, जबकि लेटेंट लक्ष्य प्री-ट्रेनिंग के दौरान पूरा किया जाता है।

प्रशिक्षण के लिए चरण 1 और चरण 2 के पाठ्यक्रम के हिस्से के रूप में Dolma-3 परिवार से लगभग 5.73 ट्रिलियन टोकन का उपयोग किया गया था। दक्षता का मुख्य दावा यह है कि NCP-ArchPreview केवल कुल प्रशिक्षण टोकन की लगभग 51.3% का उपयोग करके OLMo-3-7B के तुलनीय प्री-ट्रेनिंग अंतिम हानि प्राप्त करता है।

पूर्ण प्री-ट्रेनिंग के बाद, मॉडल बाद के कार्यों में औसत मैक्रो-स्कोर पर बेस 7B मॉडल से 2.45 अंक आगे निकल जाता है, जिसमें GSM8K बेंचमार्क पर 5.99 अंकों की वृद्धि शामिल है। नियंत्रित एब्लेशन विश्लेषण से पता चला कि यह वृद्धि लेटेंट आर्किटेक्चर और नेक्स्ट कॉन्सेप्ट ऑब्जेक्टिव दोनों के कारण है। तुलनीय पैरामीटर आकार पर, मॉडल 8.9B बेस टोकन मॉडल की प्रशिक्षण हानि के करीब पहुंचता है, जबकि लगभग 85% मानक कम्प्यूटेशनल बजट का उपयोग करता है।

प्री-ट्रेनिंग पूरी होने के बाद भी लेटेंट स्पेस उपयोग के लिए उपयुक्त रहता है। वेक्टर क्वांटाइजेशन मॉड्यूल का अद्यतन, जिसमें लगभग 17 मिलियन पैरामीटर होते हैं, डोमेन अनुकूलन के लिए एक आसान इंटरफ़ेस प्रदान करता है। इसके अलावा, DFlash2 ड्राफ्टर में अवधारणा प्रतिनिधित्वों को शामिल करने से वर्णित विन्यास में मामूली ओवरहेड के साथ औसत स्वीकृत लंबाई में लगभग 4.17% का सुधार हुआ। चरण 1 और कई चरण 2 के मूल चेकपॉइंट पूर्णता, मूल्यांकन और आगे के अनुकूलन के लिए उपलब्ध हैं। प्री-ट्रेनिंग दक्षता पर नज़र रखने वाले शोधकर्ताओं के लिए, NCP-ArchPreview एक साधारण चैट उत्पाद रिलीज से अधिक, लगभग 9B के पैमाने पर अवधारणा और टोकन स्तर के लक्ष्यों को संयोजित करने के लिए एक खुला नुस्खा है, जिसमें सार्वजनिक रूप से उपलब्ध वज़न और कोड शामिल हैं।

समान कहानियाँ

27 बिलियन पैरामीटर वाली स्थानीय मॉडल स्टार्टलक्स ने चीनी एआई बेंचमार्क में डीपसीक V4 फ्लैश को पछाड़ा
और पढ़ें
pandaily.com

27 बिलियन पैरामीटर वाली स्थानीय मॉडल स्टार्टलक्स ने चीनी एआई बेंचमार्क में डीपसीक V4 फ्लैश को पछाड़ा

चीनी सूचना और संचार प्रौद्योगिकी अकादमी (CAICT) द्वारा तैयार की गई एक रिपोर्ट के अनुसार, स्थानीय मॉडलों के मानचित्र पर एक नया खिलाड़ी उभरा है। शंघाई स्थित कंपनी स्टार्टलक्स ने स्टार्टलक्स-V1.0-27B-Preview मॉडल विकसित किया है, जिसने केवल 27 अरब मापदंडों का उपयोग करते हुए, सत्यापित एआई बेंचमार्क की श्रृंखला के भीतर विशेष MCP टेस्ट के समग्र स्कोर में दूसरा स्थान हासिल किया, और डीपसीक-V4-फ्लैश को पीछे छोड़ दिया।

MCP टेस्ट छह विशिष्ट कार्यों का मूल्यांकन करता है: स्थान नेविगेशन, इंटरनेट खोज, ब्राउज़र स्वचालन, वित्तीय विश्लेषण, कोड रिपॉजिटरी प्रबंधन और 3डी डिजाइन, और इसमें कई उपकरणों के समन्वय, जटिल कार्यों के निष्पादन और वास्तविक दुनिया की स्थितियों में बातचीत पर केंद्रित एक व्यापक मूल्यांकन भी शामिल है। परीक्षण किए गए मॉडलों में डीपसीक-V4-प्रो (1.6 ट्रिलियन पैरामीटर), डीपसीक-V4-फ्लैश-0731 (284 अरब), स्टेप-3.7-फ्लैश (198 अरब), स्टार्टलक्स-27बी-260715 (27 अरब), क्यूवेन-3.6-27बी (27 अरब) और एजेंटसीपीएम-एक्सप्लोर (4 अरब) शामिल थे।

स्टार्टलक्स-V1.0-27B-Preview ने 39.25 का स्कोर प्राप्त किया, जिससे उसे दूसरा स्थान मिला, जिसने 284 अरब पैरामीटर वाले डीपसीक-V4-फ्लैश और 198 अरब पैरामीटर वाले स्टेप-3.7-फ्लैश दोनों को पीछे छोड़ दिया। समान पैरामीटर आकार पर, इसने क्यूवेन-3.6-27बी को 5.34 अंकों से आगे निकल गया। मॉडल ने स्थान नेविगेशन में पहला स्थान हासिल किया, और ब्राउज़र स्वचालन और वित्तीय विश्लेषण में पहला स्थान प्राप्त किया या उसके बराबर प्रदर्शन किया, कुछ मामलों में डीपसीक-V4-प्रो के ट्रिलियन मॉडल के स्तर तक पहुंच गया।

यह मॉडल क्यूवेन3.6-27बी पर आधारित है जिसमें प्रशिक्षण के बाद अतिरिक्त सुधार किया गया है। स्टार्टलक्स ने 'एआई ट्रेन करता है एआई' (स्वचालित खोज) नामक एक दृष्टिकोण लागू किया है, जो स्वचालित रूप से प्रायोगिक प्रशिक्षण आयोजित करने और फीडबैक के माध्यम से रणनीति को परिष्कृत करने की अनुमति देता है। कंपनी का दावा है कि यह चीन में स्थानीय एजेंट मॉडल के लिए इस पद्धति का पहला अनुप्रयोग है।

यह परिणाम उद्योग में एक व्यापक बदलाव को दर्शाता है। चूंकि अत्याधुनिक मॉडलों का प्रदर्शन व्यावहारिक सीमा मूल्यों तक पहुंच गया है, इसलिए पैरामीटर दौड़ का युग समरूपता के चरण में बदल गया है; उपयोगकर्ताओं की प्राथमिकताएं तेजी से उच्च बेंचमार्क स्कोर प्राप्त करने के बजाय वास्तविक समस्याओं को हल करने, डेटा सुरक्षा और लागत नियंत्रण सुनिश्चित करने की ओर स्थानांतरित हो रही हैं। वैश्विक खिलाड़ी इसी दिशा में आगे बढ़ रहे हैं: गूगल का जेम्मा 4, मेटा का ओपन म्यूज ग्लिमर और एनवीडिया का नेमोट्रॉन 3.5 लाइटनिंग स्थानीय तैनाती पर लक्षित हैं।

स्टार्टलक्स-V1.0-27B-Preview उपभोक्ता पीसी पर चल सकता है, और कंपनी इस वर्ष अपने पहले पीढ़ी के स्थानीय इंटेलिजेंस समाधान जारी करने की योजना बना रही है। CAICT के परिणाम उद्यमों को संकेत देते हैं कि कॉम्पैक्ट, स्थानीय रूप से तैनात मॉडल अब वास्तविक कार्यप्रवाहों में महत्वपूर्ण कार्यों के लिए बहुत बड़े क्लाउड समाधानों के साथ प्रतिस्पर्धा करने में सक्षम हैं, जो खरीद निर्णयों को बदलना शुरू कर रहा है।

लोकप्रिय