SenseTime ने Raccoon और API के माध्यम से 8K तक रिज़ॉल्यूशन समर्थन के साथ SenseNova U1 Pro इमेज जनरेशन मॉडल जारी किया
और पढ़ें
Pandaily
pandaily.com

SenseTime ने Raccoon और API के माध्यम से 8K तक रिज़ॉल्यूशन समर्थन के साथ SenseNova U1 Pro इमेज जनरेशन मॉडल जारी किया

SenseTime कंपनी ने अपने इमेज क्रिएशन मॉडल SenseNova U1 Pro का प्रोडक्शन संस्करण पेश किया है। यह मॉडल अब कंपनी के Raccoon एप्लिकेशन के माध्यम से और SenseNova API सेवा के माध्यम से उपयोगकर्ताओं के लिए उपलब्ध है। TechNode द्वारा 22 सितंबर 2026 को प्रसारित एक संदेश के अनुसार, यह जानकारी Sina Finance पर प्रकाशित घोषणा से ली गई थी। उत्पाद का आधिकारिक अंग्रेजी नाम SenseTime / SenseNova है।

यह रिलीज़ SenseNova U1.5 अनुसंधान और ओपन-सोर्स प्रशिक्षण कोड की पिछली कवरेज से अलग है। SenseTime का दावा है कि U1 Pro संरचित जानकारी और सीधे कैनवास पर पठनीय पाठ वाली विज़ुअल सामग्री बनाने के लिए टेक्स्ट-टू-इमेज प्रक्रिया के साथ बारी-बारी से तर्क श्रृंखला का उपयोग करता है, साथ ही उत्पादन के लिए उपयुक्त लेआउट भी बनाता है।

लेबल और पिक्सेल को अलग-अलग चरणों के रूप में मानने के बजाय, मॉडल तर्क चरणों को छवि निर्माण के साथ एकीकृत करता है। यह सुनिश्चित करता है कि लेआउट की पदानुक्रम, टाइपोग्राफी की स्थिति और ग्राफिक तत्व पूरी पीढ़ी प्रक्रिया के दौरान सुसंगत बने रहें। उत्पाद 8K तक रिज़ॉल्यूशन वाली छवियों के आउटपुट का समर्थन करता है और उपयोगकर्ता-परिभाषित पहलू अनुपात की अनुमति देता है, जो सोशल मीडिया के लिए केवल चौकोर क्रॉप्स के बजाय बड़े प्रारूपों और उच्च विवरण के साथ काम करने पर केंद्रित है।

घोषणा में लक्षित कार्यों को सूचीबद्ध किया गया है, जिनमें इन्फोग्राफिक्स, पोस्टर, वास्तुशिल्प विज़ुअलाइज़ेशन और अन्य सामग्री शामिल है जिसके लिए तैयार किए गए कार्य में समान शैली और लेआउट की आवश्यकता होती है। ये परिदृश्य छवि के भीतर ही रचना और पाठ रेंडरिंग पर नियंत्रण की आवश्यकता पर जोर देते हैं, न कि पीढ़ी पूरी होने के बाद लेआउट के लिए एक अलग टूल का उपयोग करने पर। इस प्रकार, विपणन और डिजाइन टीमें एक ही प्रॉम्प्ट से उत्पादन के लिए तैयार फ्रेम का अनुरोध कर सकती हैं।

वितरण दो चैनलों के माध्यम से किया जाता है: उपभोक्ता और निर्माता Raccoon के माध्यम से एक्सेस प्राप्त करते हैं, जबकि उत्पाद टीमें अपने वर्कफ़्लो में जनरेशन को एकीकृत करने के लिए SenseNova API के माध्यम से सॉफ़्टवेयर एक्सेस का उपयोग कर सकती हैं। SenseTime ने TechNode के अंग्रेजी सारांश में मॉडल के मापदंडों, लाइसेंसिंग शर्तों या स्वतंत्र बेंचमार्किंग तालिकाओं के साथ पूर्ण सार्वजनिक मॉडल कार्ड प्रकाशित नहीं किया है। इसलिए, खरीदारों को 8K सीमा और लेआउट क्षमताओं के दावों को तीसरे पक्ष के मूल्यांकन आने तक कंपनी के बयानों के रूप में देखना चाहिए। चीनी इमेज मॉडलों को ट्रैक करने वाले मल्टीमॉडल सिस्टम के खरीदारों के लिए, निकटतम संकेत Raccoon और API चैनलों में अल्ट्रा-हाई रेज़ोल्यूशन के स्पष्ट प्रतिबंध के साथ U1 Pro के उत्पादन के लिए तैयार SKU की उपस्थिति है।

समान कहानियाँ

SenseTime ने SenseNova U1.5 जारी किया: ओपन-सोर्स ट्रेनिंग के साथ यूनिफाइड विजन के लिए 8 बिलियन पैरामीटर मॉडल
और पढ़ें
pandaily.com

SenseTime ने SenseNova U1.5 जारी किया: ओपन-सोर्स ट्रेनिंग के साथ यूनिफाइड विजन के लिए 8 बिलियन पैरामीटर मॉडल

SenseTime कंपनी ने SenseNova U1.5 प्रस्तुत किया है - आठ अरब मापदंडों वाला एक मॉडल जो पिक्सेल स्पेस में समझ, तर्क और पीढ़ी को एक एकीकृत नेटिव मल्टीमॉडल सिस्टम में जोड़ता है।

मौजूदा पाइपलाइनों के विपरीत, जो धारणा के लिए विजन एनकोडर और संश्लेषण के लिए एक अलग वैरिएशनल ऑटोएनकोडर का उपयोग करते हैं, U1.5 इन बाहरी मॉड्यूल के बिना पिक्सेल और टेक्स्ट को एक सामान्य फ्रेमवर्क में प्रदर्शित करता है। यह कंपनी की NEO-unify लाइन के अनुरूप है, जबकि उत्पादन रिज़ॉल्यूशन पर उच्च सटीकता प्राप्त करने के लिए स्थानिक पुनर्निर्माण में सुधार किया गया है।

वास्तुशिल्प परिवर्तन स्वतंत्र MLP पैच डिकोडिंग को एक हल्के स्थानिक डिकोडर से बदलने पर केंद्रित है। विज़ुअल टोकन को फीचर के दो-आयामी क्षेत्र में परिवर्तित किया जाता है, और फिर पिक्सेल शफल और स्थानीय कनवल्शन चरणों का उपयोग करके पुनर्स्थापित किया जाता है, जिससे अंतिम रूप देने से पहले आसन्न क्षेत्रों को जानकारी का आदान-प्रदान करने की अनुमति मिलती है।

SenseTime ने बताया कि इंटरफ़ेस अभी भी एक विज़ुअल टोकन पर 32x32 के आकार के प्रत्येक क्षेत्र को प्रदर्शित करता है, लेकिन यह पिछली U1 संस्करण की तुलना में कम सीम और बनावट विषमता के साथ 4K तक नेटिव जनरेशन का समर्थन करता है। यह चौड़े पहलू अनुपात में रिज़ॉल्यूशन को ध्यान में रखने वाले नॉइज़ कंडीशनिंग के कारण संभव हुआ है।

ट्रेनिंग के बाद की प्रक्रिया विशेषज्ञता, उसके बाद यूनिफिकेशन के नुस्खे का पालन करती है। रीइन्फोर्समेंट लर्निंग विशेषज्ञ विज़ुअल एस्थेटिक्स, बाइलिंगुअल टेक्स्ट रेंडरिंग, इन्फोग्राफिक लेआउट और इमेज एडिटिंग पर ध्यान केंद्रित करते हैं। फिर नीति पर बहु-विशेषज्ञ डिस्टिलेशन इन कौशलों को उनकी अपनी जनरेशन ट्रेजेक्टरी के साथ एक छात्र में एकीकृत करता है।

SenseTime का दावा है कि U1.5 के परिणाम छवि पीढ़ी और संपादन के डेटासेट में U1 से बेहतर हैं, जिसमें प्रतिस्पर्धी बाइलिंगुअल टेक्स्ट रेंडरिंग और मल्टी-रेफरेंस एडिटिंग शामिल है, जबकि मानक STEM, VQA और OCR बेंचमार्क पर समग्र रूप से उच्च मल्टीमॉडल समझ स्कोर बनाए रखता है।

arXiv और Hugging Face Papers पर प्रकाशित तकनीकी रिपोर्ट के अलावा, SenseTime प्रशिक्षण कोड को ओपन-सोर्स बनाता है, जिसमें नियंत्रित फाइन-ट्यूनिंग, रीइन्फोर्समेंट लर्निंग और पॉलिसी डिस्टिलेशन शामिल है। मॉडल एसेट्स OpenSenseNova संगठन के तहत SenseNova और Hugging Face संग्रहों में उपलब्ध हैं। यह रिलीज़ U1.5-Lite-Preview का प्रारंभिक संस्करण नहीं है, बल्कि एक पूर्ण U1.5 उत्पाद है, और यह डेवलपर्स के लिए डिज़ाइन किया गया है जो एक कॉम्पैक्ट नेटिव यूनिफाइड विजन मॉडल प्राप्त करना चाहते हैं जिसे पूरी तरह से एक्सप्लोर, ट्यून और रिट्रेन किया जा सके।

Kinetix AI ने एआई मॉडल के हार्डवेयर विकास के लिए $75 मिलियन का एंजेल फंडिंग राउंड जुटाया
और पढ़ें
ventureburn.com

Kinetix AI ने एआई मॉडल के हार्डवेयर विकास के लिए $75 मिलियन का एंजेल फंडिंग राउंड जुटाया

इंजीनियर लंबे समय से एक समस्या का सामना कर रहे थे: कृत्रिम बुद्धिमत्ता, जो सेकंडों में उपन्यास लिख सकती है, नाजुक कांच को बिना तोड़े पकड़ने में कठिनाई महसूस करती है। यह समस्या डिजिटल बुद्धिमत्ता और भौतिक निष्पादन के बीच महत्वपूर्ण अंतर से संबंधित है।

इस अंतर को पाटने के लिए सॉफ्टवेयर सिस्टम और यांत्रिक निकायों के बीच त्रुटिहीन और निरंतर फीडबैक की आवश्यकता होती है। इस संकीर्ण समस्या को हल करने के लिए, Kinetix AI ने बड़े और महत्वपूर्ण एंजेल फंडिंग राउंड के हिस्से के रूप में $75 मिलियन जुटाए हैं, जो एम्बेडेड इंटेलिजेंस के क्षेत्र में एक बड़ा कदम है।

कंपनी के ऐतिहासिक फंडिंग राउंड का नेतृत्व वर्टेक्स वेंचर्स ने किया, जो सिंगापुर की टेमासेक होल्डिंग्स की एक शक्तिशाली उद्यम शाखा है। F&G वेंचर और वान्शी कैपिटल ने भी राउंड में शामिल होकर Kinetix AI, एक शुरुआती चरण के स्टार्टअप में 500 मिलियन युआन (लगभग $75 मिलियन) का निवेश किया।

Kinetix AI कोई छोटा गैरेज प्रोजेक्ट नहीं है। सितंबर 2025 में स्थापित, कंपनी तेजी से लगभग 200 कर्मचारियों तक बढ़ी है। Kinetix AI की तेज वृद्धि के पीछे सीईओ यू ज़े हैं, जिन्होंने पहले Huawei के स्वायत्त खनन ट्रकों का व्यावसायीकरण किया था।

टीम में HKU के उत्कृष्ट उप डीन लो पिंग और XPeng में रोबोटिक्स विभाग के पूर्व प्रमुख झेंग क्यूनयुआन भी शामिल हैं। इस समूह के पास अकादमिक सिद्धांत, स्वायत्त वाहनों की तर्कशक्ति और विनिर्माण क्षमताओं का गहरा ज्ञान है।

कई रोबोटिक्स कंपनियां गुणवत्ता पर बचत करती हैं, लेकिन Kinetix इसे स्वीकार नहीं करता है। कंपनी दृढ़ता से मानती है कि चूंकि दुनिया का बुनियादी ढांचा मनुष्यों के लिए बनाया गया है, इसलिए रोबोटों को निर्बाध रूप से एकीकृत होने के लिए हमारे जैसे दिखना और चलना चाहिए।

उनकी फ्लैगशिप रचना, KAIBot, 1.73 मीटर ऊंचा है और इसमें आश्चर्यजनक 115 डिग्री की स्वतंत्रता है। यह उच्च गुणवत्ता और अति-यथार्थवाद की विशेषता है। हालांकि ऐसे रोबोट का निर्माण काफी अधिक प्रारंभिक लागत और आपूर्ति श्रृंखला दुःस्वप्न की मांग करता है, सह-संस्थापक झेंग क्यूनयुआन का तर्क है कि सस्ते, निम्न-गुणवत्ता वाले उपकरण के साथ शुरुआत करना मूर्खता है। सच्चे मानव फॉर्म फैक्टर को स्थिर करके, वे सुनिश्चित करते हैं कि उनके एआई मॉडल किसी भी जोड़ के अपडेट होने पर विफल नहीं होंगे।

कल्पना कीजिए एक रोबोट जो न केवल मानव आकृति की नकल करता है, बल्कि मानव गति डेटा से पूरी तरह मेल खाता है। जब हार्डवेयर सीधे हमारी जीव विज्ञान को दर्शाता है, तो एल्गोरिथम कार्य सहजता से स्थानांतरित हो जाता है।

मुख्य जादू जुटाई गई पूंजी के कारण होता है, जिसका उद्देश्य उनकी बंद पारिस्थितिकी तंत्र को गति देना है। इसे तीन सिर वाले राक्षस के रूप में समझा जा सकता है। सबसे पहले, मल्टीमॉडल, आत्म-केंद्रित डेटा एकत्र किया जाता है। फिर इस कच्चे डेटा को सीधे शरीर में समाहित मूल मॉडल में फीड किया जाता है। अंत में, KAIBot और KAI Hand जैसे हार्डवेयर सीखे गए कार्यों को भौतिक रूप से निष्पादित करता है।

यह निरंतर चक्र 'बुद्धिमत्ता का फ्लाईव्हील' बनाता है। चूंकि रोबोट वास्तविक दुनिया से संवेदी डेटा एकत्र करता है, एआई मॉडल अधिक बुद्धिमान हो जाता है, जिससे भौतिक हार्डवेयर की क्षमता तुरंत बढ़ जाती है। अब हर सॉफ़्टवेयर अपडेट के साथ भौतिक मशीन को पुनर्गठित करने की आवश्यकता नहीं है।

सिस्टम की गतिशीलता को 2026 में मानव रोबोटिक्स विश्व खेलों में प्रदर्शित किया गया था, जहां उनकी प्रणाली ने विश्व चैंपियन डिन निंग के खिलाफ टेबल टेनिस खेला। लक्ष्य जटिल वास्तविक दुनिया के कार्यों के लिए तैयार प्रीमियम श्रेणी के रोबोट बनाना है।

लोकप्रिय