स्टेबल एआई ने त्सिंगहुआ विश्वविद्यालय के प्रोफेसर पेंग क्यूया के समूह के सहयोग से LimiX-2 जारी किया है - यह 400 मिलियन पैरामीटर का एक मौलिक मॉडल है जिसे संरचित और सारणीबद्ध डेटा के साथ काम करने के लिए डिज़ाइन किया गया है। Hugging Face पर stable-ai/LimiX-2 पर वेट्स और इन्फेरेंस कोड उपलब्ध हैं, जबकि तकनीकी रिपोर्ट arXiv पर 2609.17488 के तहत प्रकाशित की गई है।
एक सत्यापित मॉडल एक ही फॉरवर्ड पास में वर्गीकरण, रिग्रेशन और गुम मानों को भरने में सक्षम है, जिसके लिए किसी विशिष्ट कार्य के लिए फाइन-ट्यूनिंग की आवश्यकता नहीं होती है।
वास्तुकलात्मक रूप से, LimiX-2 कॉन्टेक्चुअल मैकेनिज्म नेटवर्क्स (Contextual Mechanism Networks, CMNs) का उपयोग करता है, जिन्हें कॉन्टेक्स्टुअली कंडीशनल मास्क्ड मॉडलिंग का उपयोग करके प्री-ट्रेन किया गया था। सारणीबद्ध डेटा पर केंद्रित पारंपरिक लक्ष्य फ़ंक्शन पर ध्यान केंद्रित करने के बजाय, जो संदर्भ के आधार पर एक निर्दिष्ट लक्ष्य की भविष्यवाणी करता है, CMNs सुविधाओं और लेबलों के बीच संयुक्त निर्भरता संरचना का पता लगाने के लिए प्रशिक्षित होते हैं, जो एक बार में एक कॉलम को ट्यून करने के बजाय चर द्वारा डेटा को सह-उत्पन्न करने के तरीके की पहचान के करीब है।
प्री-ट्रेनिंग विभिन्न ग्राफ, तंत्र और अवलोकन प्रक्रियाओं को कवर करने वाले स्ट्रक्चरल कॉज़ल मॉडल्स से प्राप्त सिंथेटिक डेटासेट पर की गई थी। फिर मॉडल को LimiX के पहले प्रकाशित स्केलिंग कानूनों के अनुसार 400M वर्ग तक बढ़ाया गया।
सार्वजनिक रैंकिंग तालिकाओं पर टीम ने TabArena पर Elo 1935, BCCO पर 1432 और TALENT पर 1506 प्रदर्शित किए। इन परिणामों को प्रकाशित प्रोटोकॉल के तहत तुलनात्मक सारणीबद्ध मौलिक मॉडलों और AutoGluon शैली के बेसलाइन मॉडलों में पहले बताया गया है। TabArena के परिणाम रिग्रेशन और वर्गीकरण विभाजनों में मजबूत प्रदर्शन पर भी प्रकाश डालते हैं; मॉडल कार्ड में फीचर अटेंशन के माध्यम से कॉज़ल स्केलेटन की बहाली का अतिरिक्त उल्लेख है, जो प्रत्यक्ष कारण संबंधों को एन्कोड करता है।
LimiX के पिछले रिलीज़ कॉर्पोरेट संरचित डेटा के सैकड़ों परिदृश्यों को कवर करते थे; LimiX-2 CMN का एक स्केल्ड जनरेशन है जिसका उद्देश्य सामान्य सारणीबद्ध मॉडल के इस क्षेत्र को आगे बढ़ाना है।
डेटा से निपटने वाली टीमों के लिए, व्यावहारिक मूल्य एक एकल ओपन वेट की उपलब्धता है जो बिना किसी पुन: ट्यूनिंग की आवश्यकता के विषम तालिकाओं में डेटा को वर्गीकृत, रिग्रेट और इम्पुट कर सकता है। यह विशेष रूप से उपयोगी है जहां कॉर्पोरेट तालिकाएँ सार्वजनिक पाठ कॉर्पोरा से मेल नहीं खाती हैं। हालांकि, यह ध्यान रखना महत्वपूर्ण है कि बेंचमार्क Elo के रूप में प्रस्तुत किए गए हैं, जैसा कि लेखकों ने कुछ विन्यासों के तहत दावा किया है; उत्पादन वातावरण में अंतिम उपयोगकर्ताओं को विशेष AutoML पाइपलाइनों को बदलने से पहले विलंबित नमूनों पर सत्यापन करने और डेटा लीक की निगरानी करने की आवश्यकता होगी।


