शंघाई आर्टिफिशियल इंटेलिजेंस लेबोरेटरी (Shanghai Artificial Intelligence Laboratory) की NCP टीम ने शंघाई जियाओटोंग विश्वविद्यालय (Shanghai Jiao Tong University) की LUMIA Lab के साथ मिलकर NCP-ArchPreview जारी किया है - एक ओपन लैंग्वेज मॉडल जिसमें लेटेंट स्पेस है और जिसमें लगभग 8.9 बिलियन पैरामीटर हैं।
यह मॉडल मानक अगले टोकन भविष्यवाणी और अगली अवधारणा भविष्यवाणी (Next Concept Prediction) दोनों को एक साथ प्रशिक्षित करता है। तकनीकी रिपोर्ट arXiv पर 2609.10715 के तहत उपलब्ध है, और Hugging Face के लिए चेकपॉइंट्स ArchSpace-Collection में हैं। मूल्यांकन और इन्फेरेंस के लिए कोड पथ भी प्रकाशित किए गए हैं, जिनमें InternLM टूलकिट और LUMIA के मूल्यांकन रिपॉजिटरी के माध्यम से लिंक शामिल हैं।
यह परियोजना आज तक के सबसे बड़े लेटेंट स्पेस लैंग्वेज मॉडल प्रदर्शनों में से एक का प्रतिनिधित्व करती है, जिसे ट्रिलियन टोकन से अधिक के पैमाने पर प्रशिक्षित किया गया है।
केवल अगले टोकन की भविष्यवाणी करने के बजाय, NCP-ArchPreview उन असतत अवधारणाओं की भविष्यवाणी करने में सक्षम है जो कई टोकन को कवर करती हैं। इसके लिए मॉडल की आंतरिक अवस्थाओं पर आधारित एक उत्पादक रूप से क्वांटाइज्ड अवधारणा शब्दावली बनाई गई थी। एक विशेष अवधारणा मॉड्यूल भविष्य की अवधारणाओं की भविष्यवाणी करता है, और इन भविष्यवाणियों का उपयोग टोकन स्तर पर पीढ़ी को निर्देशित करने के लिए किया जाता है।
एनकोडर, कॉन्सेप्ट मॉड्यूल और डिकोडर हिडन लेयर आकार 4096 और अनुपात 16/8/16 के साथ एक कारण ट्रांसफार्मर आर्किटेक्चर का उपयोग करते हैं। अवधारणाएं प्रत्येक चार टोकन की स्थिति को संपीड़ित करती हैं, और उत्पादक क्वांटाइजेशन 128 कोड शब्दों वाले 32 शब्दकोशों पर लागू होता है। पीढ़ी NCPOlmo3ForCausalLM प्रकार की आर्किटेक्चर में अगले टोकन भविष्यवाणी के परिचित इंटरफ़ेस को बनाए रखती है, जिससे मॉडल का मूल्यांकन और उपयोग एक सामान्य ऑटोरेग्रेसिव चेकपॉइंट के रूप में किया जा सकता है, जबकि लेटेंट लक्ष्य प्री-ट्रेनिंग के दौरान पूरा किया जाता है।
प्रशिक्षण के लिए चरण 1 और चरण 2 के पाठ्यक्रम के हिस्से के रूप में Dolma-3 परिवार से लगभग 5.73 ट्रिलियन टोकन का उपयोग किया गया था। दक्षता का मुख्य दावा यह है कि NCP-ArchPreview केवल कुल प्रशिक्षण टोकन की लगभग 51.3% का उपयोग करके OLMo-3-7B के तुलनीय प्री-ट्रेनिंग अंतिम हानि प्राप्त करता है।
पूर्ण प्री-ट्रेनिंग के बाद, मॉडल बाद के कार्यों में औसत मैक्रो-स्कोर पर बेस 7B मॉडल से 2.45 अंक आगे निकल जाता है, जिसमें GSM8K बेंचमार्क पर 5.99 अंकों की वृद्धि शामिल है। नियंत्रित एब्लेशन विश्लेषण से पता चला कि यह वृद्धि लेटेंट आर्किटेक्चर और नेक्स्ट कॉन्सेप्ट ऑब्जेक्टिव दोनों के कारण है। तुलनीय पैरामीटर आकार पर, मॉडल 8.9B बेस टोकन मॉडल की प्रशिक्षण हानि के करीब पहुंचता है, जबकि लगभग 85% मानक कम्प्यूटेशनल बजट का उपयोग करता है।
प्री-ट्रेनिंग पूरी होने के बाद भी लेटेंट स्पेस उपयोग के लिए उपयुक्त रहता है। वेक्टर क्वांटाइजेशन मॉड्यूल का अद्यतन, जिसमें लगभग 17 मिलियन पैरामीटर होते हैं, डोमेन अनुकूलन के लिए एक आसान इंटरफ़ेस प्रदान करता है। इसके अलावा, DFlash2 ड्राफ्टर में अवधारणा प्रतिनिधित्वों को शामिल करने से वर्णित विन्यास में मामूली ओवरहेड के साथ औसत स्वीकृत लंबाई में लगभग 4.17% का सुधार हुआ। चरण 1 और कई चरण 2 के मूल चेकपॉइंट पूर्णता, मूल्यांकन और आगे के अनुकूलन के लिए उपलब्ध हैं। प्री-ट्रेनिंग दक्षता पर नज़र रखने वाले शोधकर्ताओं के लिए, NCP-ArchPreview एक साधारण चैट उत्पाद रिलीज से अधिक, लगभग 9B के पैमाने पर अवधारणा और टोकन स्तर के लक्ष्यों को संयोजित करने के लिए एक खुला नुस्खा है, जिसमें सार्वजनिक रूप से उपलब्ध वज़न और कोड शामिल हैं।

