SenseTime कंपनी ने SenseNova U1.5 प्रस्तुत किया है - आठ अरब मापदंडों वाला एक मॉडल जो पिक्सेल स्पेस में समझ, तर्क और पीढ़ी को एक एकीकृत नेटिव मल्टीमॉडल सिस्टम में जोड़ता है।
मौजूदा पाइपलाइनों के विपरीत, जो धारणा के लिए विजन एनकोडर और संश्लेषण के लिए एक अलग वैरिएशनल ऑटोएनकोडर का उपयोग करते हैं, U1.5 इन बाहरी मॉड्यूल के बिना पिक्सेल और टेक्स्ट को एक सामान्य फ्रेमवर्क में प्रदर्शित करता है। यह कंपनी की NEO-unify लाइन के अनुरूप है, जबकि उत्पादन रिज़ॉल्यूशन पर उच्च सटीकता प्राप्त करने के लिए स्थानिक पुनर्निर्माण में सुधार किया गया है।
वास्तुशिल्प परिवर्तन स्वतंत्र MLP पैच डिकोडिंग को एक हल्के स्थानिक डिकोडर से बदलने पर केंद्रित है। विज़ुअल टोकन को फीचर के दो-आयामी क्षेत्र में परिवर्तित किया जाता है, और फिर पिक्सेल शफल और स्थानीय कनवल्शन चरणों का उपयोग करके पुनर्स्थापित किया जाता है, जिससे अंतिम रूप देने से पहले आसन्न क्षेत्रों को जानकारी का आदान-प्रदान करने की अनुमति मिलती है।
SenseTime ने बताया कि इंटरफ़ेस अभी भी एक विज़ुअल टोकन पर 32x32 के आकार के प्रत्येक क्षेत्र को प्रदर्शित करता है, लेकिन यह पिछली U1 संस्करण की तुलना में कम सीम और बनावट विषमता के साथ 4K तक नेटिव जनरेशन का समर्थन करता है। यह चौड़े पहलू अनुपात में रिज़ॉल्यूशन को ध्यान में रखने वाले नॉइज़ कंडीशनिंग के कारण संभव हुआ है।
ट्रेनिंग के बाद की प्रक्रिया विशेषज्ञता, उसके बाद यूनिफिकेशन के नुस्खे का पालन करती है। रीइन्फोर्समेंट लर्निंग विशेषज्ञ विज़ुअल एस्थेटिक्स, बाइलिंगुअल टेक्स्ट रेंडरिंग, इन्फोग्राफिक लेआउट और इमेज एडिटिंग पर ध्यान केंद्रित करते हैं। फिर नीति पर बहु-विशेषज्ञ डिस्टिलेशन इन कौशलों को उनकी अपनी जनरेशन ट्रेजेक्टरी के साथ एक छात्र में एकीकृत करता है।
SenseTime का दावा है कि U1.5 के परिणाम छवि पीढ़ी और संपादन के डेटासेट में U1 से बेहतर हैं, जिसमें प्रतिस्पर्धी बाइलिंगुअल टेक्स्ट रेंडरिंग और मल्टी-रेफरेंस एडिटिंग शामिल है, जबकि मानक STEM, VQA और OCR बेंचमार्क पर समग्र रूप से उच्च मल्टीमॉडल समझ स्कोर बनाए रखता है।
arXiv और Hugging Face Papers पर प्रकाशित तकनीकी रिपोर्ट के अलावा, SenseTime प्रशिक्षण कोड को ओपन-सोर्स बनाता है, जिसमें नियंत्रित फाइन-ट्यूनिंग, रीइन्फोर्समेंट लर्निंग और पॉलिसी डिस्टिलेशन शामिल है। मॉडल एसेट्स OpenSenseNova संगठन के तहत SenseNova और Hugging Face संग्रहों में उपलब्ध हैं। यह रिलीज़ U1.5-Lite-Preview का प्रारंभिक संस्करण नहीं है, बल्कि एक पूर्ण U1.5 उत्पाद है, और यह डेवलपर्स के लिए डिज़ाइन किया गया है जो एक कॉम्पैक्ट नेटिव यूनिफाइड विजन मॉडल प्राप्त करना चाहते हैं जिसे पूरी तरह से एक्सप्लोर, ट्यून और रिट्रेन किया जा सके।
