स्टेबल एआई और त्सिंगहुआ विश्वविद्यालय ने संरचित डेटा के लिए LimiX-2 मॉडल प्रस्तुत किया
और पढ़ें
Pandaily
pandaily.com

स्टेबल एआई और त्सिंगहुआ विश्वविद्यालय ने संरचित डेटा के लिए LimiX-2 मॉडल प्रस्तुत किया

स्टेबल एआई ने त्सिंगहुआ विश्वविद्यालय के प्रोफेसर पेंग क्यूया के समूह के सहयोग से LimiX-2 जारी किया है - यह 400 मिलियन पैरामीटर का एक मौलिक मॉडल है जिसे संरचित और सारणीबद्ध डेटा के साथ काम करने के लिए डिज़ाइन किया गया है। Hugging Face पर stable-ai/LimiX-2 पर वेट्स और इन्फेरेंस कोड उपलब्ध हैं, जबकि तकनीकी रिपोर्ट arXiv पर 2609.17488 के तहत प्रकाशित की गई है।

एक सत्यापित मॉडल एक ही फॉरवर्ड पास में वर्गीकरण, रिग्रेशन और गुम मानों को भरने में सक्षम है, जिसके लिए किसी विशिष्ट कार्य के लिए फाइन-ट्यूनिंग की आवश्यकता नहीं होती है।

वास्तुकलात्मक रूप से, LimiX-2 कॉन्टेक्चुअल मैकेनिज्म नेटवर्क्स (Contextual Mechanism Networks, CMNs) का उपयोग करता है, जिन्हें कॉन्टेक्स्टुअली कंडीशनल मास्क्ड मॉडलिंग का उपयोग करके प्री-ट्रेन किया गया था। सारणीबद्ध डेटा पर केंद्रित पारंपरिक लक्ष्य फ़ंक्शन पर ध्यान केंद्रित करने के बजाय, जो संदर्भ के आधार पर एक निर्दिष्ट लक्ष्य की भविष्यवाणी करता है, CMNs सुविधाओं और लेबलों के बीच संयुक्त निर्भरता संरचना का पता लगाने के लिए प्रशिक्षित होते हैं, जो एक बार में एक कॉलम को ट्यून करने के बजाय चर द्वारा डेटा को सह-उत्पन्न करने के तरीके की पहचान के करीब है।

प्री-ट्रेनिंग विभिन्न ग्राफ, तंत्र और अवलोकन प्रक्रियाओं को कवर करने वाले स्ट्रक्चरल कॉज़ल मॉडल्स से प्राप्त सिंथेटिक डेटासेट पर की गई थी। फिर मॉडल को LimiX के पहले प्रकाशित स्केलिंग कानूनों के अनुसार 400M वर्ग तक बढ़ाया गया।

सार्वजनिक रैंकिंग तालिकाओं पर टीम ने TabArena पर Elo 1935, BCCO पर 1432 और TALENT पर 1506 प्रदर्शित किए। इन परिणामों को प्रकाशित प्रोटोकॉल के तहत तुलनात्मक सारणीबद्ध मौलिक मॉडलों और AutoGluon शैली के बेसलाइन मॉडलों में पहले बताया गया है। TabArena के परिणाम रिग्रेशन और वर्गीकरण विभाजनों में मजबूत प्रदर्शन पर भी प्रकाश डालते हैं; मॉडल कार्ड में फीचर अटेंशन के माध्यम से कॉज़ल स्केलेटन की बहाली का अतिरिक्त उल्लेख है, जो प्रत्यक्ष कारण संबंधों को एन्कोड करता है।

LimiX के पिछले रिलीज़ कॉर्पोरेट संरचित डेटा के सैकड़ों परिदृश्यों को कवर करते थे; LimiX-2 CMN का एक स्केल्ड जनरेशन है जिसका उद्देश्य सामान्य सारणीबद्ध मॉडल के इस क्षेत्र को आगे बढ़ाना है।

डेटा से निपटने वाली टीमों के लिए, व्यावहारिक मूल्य एक एकल ओपन वेट की उपलब्धता है जो बिना किसी पुन: ट्यूनिंग की आवश्यकता के विषम तालिकाओं में डेटा को वर्गीकृत, रिग्रेट और इम्पुट कर सकता है। यह विशेष रूप से उपयोगी है जहां कॉर्पोरेट तालिकाएँ सार्वजनिक पाठ कॉर्पोरा से मेल नहीं खाती हैं। हालांकि, यह ध्यान रखना महत्वपूर्ण है कि बेंचमार्क Elo के रूप में प्रस्तुत किए गए हैं, जैसा कि लेखकों ने कुछ विन्यासों के तहत दावा किया है; उत्पादन वातावरण में अंतिम उपयोगकर्ताओं को विशेष AutoML पाइपलाइनों को बदलने से पहले विलंबित नमूनों पर सत्यापन करने और डेटा लीक की निगरानी करने की आवश्यकता होगी।

समान कहानियाँ

शंघाई एआई लैब और एसजेटीयू ने लेटेंट स्पेस के साथ NCP-ArchPreview मॉडल प्रस्तुत किया
और पढ़ें
pandaily.com

शंघाई एआई लैब और एसजेटीयू ने लेटेंट स्पेस के साथ NCP-ArchPreview मॉडल प्रस्तुत किया

शंघाई आर्टिफिशियल इंटेलिजेंस लेबोरेटरी (Shanghai Artificial Intelligence Laboratory) की NCP टीम ने शंघाई जियाओटोंग विश्वविद्यालय (Shanghai Jiao Tong University) की LUMIA Lab के साथ मिलकर NCP-ArchPreview जारी किया है - एक ओपन लैंग्वेज मॉडल जिसमें लेटेंट स्पेस है और जिसमें लगभग 8.9 बिलियन पैरामीटर हैं।

यह मॉडल मानक अगले टोकन भविष्यवाणी और अगली अवधारणा भविष्यवाणी (Next Concept Prediction) दोनों को एक साथ प्रशिक्षित करता है। तकनीकी रिपोर्ट arXiv पर 2609.10715 के तहत उपलब्ध है, और Hugging Face के लिए चेकपॉइंट्स ArchSpace-Collection में हैं। मूल्यांकन और इन्फेरेंस के लिए कोड पथ भी प्रकाशित किए गए हैं, जिनमें InternLM टूलकिट और LUMIA के मूल्यांकन रिपॉजिटरी के माध्यम से लिंक शामिल हैं।

यह परियोजना आज तक के सबसे बड़े लेटेंट स्पेस लैंग्वेज मॉडल प्रदर्शनों में से एक का प्रतिनिधित्व करती है, जिसे ट्रिलियन टोकन से अधिक के पैमाने पर प्रशिक्षित किया गया है।

केवल अगले टोकन की भविष्यवाणी करने के बजाय, NCP-ArchPreview उन असतत अवधारणाओं की भविष्यवाणी करने में सक्षम है जो कई टोकन को कवर करती हैं। इसके लिए मॉडल की आंतरिक अवस्थाओं पर आधारित एक उत्पादक रूप से क्वांटाइज्ड अवधारणा शब्दावली बनाई गई थी। एक विशेष अवधारणा मॉड्यूल भविष्य की अवधारणाओं की भविष्यवाणी करता है, और इन भविष्यवाणियों का उपयोग टोकन स्तर पर पीढ़ी को निर्देशित करने के लिए किया जाता है।

एनकोडर, कॉन्सेप्ट मॉड्यूल और डिकोडर हिडन लेयर आकार 4096 और अनुपात 16/8/16 के साथ एक कारण ट्रांसफार्मर आर्किटेक्चर का उपयोग करते हैं। अवधारणाएं प्रत्येक चार टोकन की स्थिति को संपीड़ित करती हैं, और उत्पादक क्वांटाइजेशन 128 कोड शब्दों वाले 32 शब्दकोशों पर लागू होता है। पीढ़ी NCPOlmo3ForCausalLM प्रकार की आर्किटेक्चर में अगले टोकन भविष्यवाणी के परिचित इंटरफ़ेस को बनाए रखती है, जिससे मॉडल का मूल्यांकन और उपयोग एक सामान्य ऑटोरेग्रेसिव चेकपॉइंट के रूप में किया जा सकता है, जबकि लेटेंट लक्ष्य प्री-ट्रेनिंग के दौरान पूरा किया जाता है।

प्रशिक्षण के लिए चरण 1 और चरण 2 के पाठ्यक्रम के हिस्से के रूप में Dolma-3 परिवार से लगभग 5.73 ट्रिलियन टोकन का उपयोग किया गया था। दक्षता का मुख्य दावा यह है कि NCP-ArchPreview केवल कुल प्रशिक्षण टोकन की लगभग 51.3% का उपयोग करके OLMo-3-7B के तुलनीय प्री-ट्रेनिंग अंतिम हानि प्राप्त करता है।

पूर्ण प्री-ट्रेनिंग के बाद, मॉडल बाद के कार्यों में औसत मैक्रो-स्कोर पर बेस 7B मॉडल से 2.45 अंक आगे निकल जाता है, जिसमें GSM8K बेंचमार्क पर 5.99 अंकों की वृद्धि शामिल है। नियंत्रित एब्लेशन विश्लेषण से पता चला कि यह वृद्धि लेटेंट आर्किटेक्चर और नेक्स्ट कॉन्सेप्ट ऑब्जेक्टिव दोनों के कारण है। तुलनीय पैरामीटर आकार पर, मॉडल 8.9B बेस टोकन मॉडल की प्रशिक्षण हानि के करीब पहुंचता है, जबकि लगभग 85% मानक कम्प्यूटेशनल बजट का उपयोग करता है।

प्री-ट्रेनिंग पूरी होने के बाद भी लेटेंट स्पेस उपयोग के लिए उपयुक्त रहता है। वेक्टर क्वांटाइजेशन मॉड्यूल का अद्यतन, जिसमें लगभग 17 मिलियन पैरामीटर होते हैं, डोमेन अनुकूलन के लिए एक आसान इंटरफ़ेस प्रदान करता है। इसके अलावा, DFlash2 ड्राफ्टर में अवधारणा प्रतिनिधित्वों को शामिल करने से वर्णित विन्यास में मामूली ओवरहेड के साथ औसत स्वीकृत लंबाई में लगभग 4.17% का सुधार हुआ। चरण 1 और कई चरण 2 के मूल चेकपॉइंट पूर्णता, मूल्यांकन और आगे के अनुकूलन के लिए उपलब्ध हैं। प्री-ट्रेनिंग दक्षता पर नज़र रखने वाले शोधकर्ताओं के लिए, NCP-ArchPreview एक साधारण चैट उत्पाद रिलीज से अधिक, लगभग 9B के पैमाने पर अवधारणा और टोकन स्तर के लक्ष्यों को संयोजित करने के लिए एक खुला नुस्खा है, जिसमें सार्वजनिक रूप से उपलब्ध वज़न और कोड शामिल हैं।

ओपनएआई ने सहस्राब्दी की गणितीय समस्या के समाधान की घोषणा की
और पढ़ें
podrobno.uz

ओपनएआई ने सहस्राब्दी की गणितीय समस्या के समाधान की घोषणा की

कंपनी ओपनएआई ने बताया है कि उसकी आंतरिक कृत्रिम बुद्धिमत्ता प्रणाली सात सहस्राब्दी समस्याओं में से एक - नेवियर-स्टोक्स समीकरणों के अस्तित्व और सहजता की समस्या - का समाधान खोजने में सफल रही। गणितज्ञ कई दशकों से इस समस्या पर काम कर रहे थे।

सबूत प्रस्तुत करने के साथ, कंपनी ने लीन सिस्टम में इसका औपचारिक संस्करण भी प्रदान किया। नेवियर-स्टोक्स समीकरणों का उपयोग गैसों और तरल पदार्थों की गति का वर्णन करने के लिए किया जाता है, उदाहरण के लिए, वायु प्रवाह, मौसम और रक्त परिसंचरण के मॉडलिंग में। मुख्य विवादास्पद बिंदु यह था कि क्या शुरू में सहज तीन-आयामी तरल पदार्थ की गति एक निश्चित समय अवधि के लिए विलक्षणताओं - गणितीय मॉडल की सहजता को बाधित करने वाली स्थितियों - को उत्पन्न कर सकती है। ओपनएआई का दावा है कि उसकी प्रणाली ने ऐसी संभावना प्रदर्शित की है।

कंपनी के आंकड़ों के अनुसार, इस कार्य में लगभग 10 हजार एआई एजेंट शामिल थे। समाधान 5 सितंबर को काम शुरू करने के लगभग 88 घंटे बाद प्राप्त हुआ, और प्रमाण का बाद का औपचारिकीकरण और लीन में सत्यापन करने में अतिरिक्त 17 घंटे लगे। इस प्रक्रिया के दौरान एजेंटों ने 2.7 मिलियन संदेशों का आदान-प्रदान किया और लगभग 130 बिलियन आउटपुट टोकन उत्पन्न किए।

जर्नल नेचर ने इस घोषणा को गणित के क्षेत्र में संभावित महत्वपूर्ण सफलता बताया है, हालांकि अभी यह केवल एक घोषित परिणाम है। इस उपलब्धि की आधिकारिक मान्यता के लिए, क्ले गणित संस्थान चाहता है कि प्रमाण स्वतंत्र विशेषज्ञता से गुजरे और वैज्ञानिक समुदाय से व्यापक अनुमोदन प्राप्त करे। संस्थान के नियमों के अनुसार, पुरस्कार के दावेदार को समीक्षा से कम से कम दो साल पहले समाधान प्रकाशित करना होगा। सहस्राब्दी की प्रत्येक सात समस्याओं के लिए एक मिलियन डॉलर का पुरस्कार निर्धारित है, लेकिन ओपनएआई ने इस पुरस्कार का दावा करने से इनकार कर दिया है।

इसके अलावा, पहले यह बताया गया था कि जीपीटी-6 एस्ट्रा मॉडल ने 'मैं रोबोट नहीं हूं' टेस्ट के सभी 48 स्तर सफलतापूर्वक पास किए, जो विभिन्न प्रकार के कैप्चा का अनुकरण करता है। इन कार्यों को पूरा करने के लिए, कृत्रिम बुद्धिमत्ता ने स्वयं इंटरफ़ेस के साथ बातचीत की और स्क्रीन सामग्री को पहचानने का कार्य किया।

लोकप्रिय