लाइट ओरिजिन ने पूरे शरीर के नियंत्रण के लिए लाइट-ओ1-प्रीव्यू 6बी मॉडल जारी किया
और पढ़ें
Pandaily
pandaily.com

लाइट ओरिजिन ने पूरे शरीर के नियंत्रण के लिए लाइट-ओ1-प्रीव्यू 6बी मॉडल जारी किया

लाइट ओरिजिन कंपनी ने लाइट-ओ1-प्रीव्यू नामक एक मॉडल को सार्वजनिक रूप से उपलब्ध कराया है, जिसमें लगभग 6 अरब पैरामीटर हैं और यह पूरे शरीर की गतिविधियों के लिए है। यह मॉडल कंपनी के तकनीकी ब्लॉग और उसकी अंग्रेजी कवरेज के अनुसार 21 सितंबर को हगिंग फेस और गिटहब पर Apache 2.0 लाइसेंस के तहत जारी किया गया है।

इस मॉडल का प्रीव्यू संस्करण लाइट ओरिजिन की मौलिक एम्बोडीड सिस्टम लाइन, लाइट-ओ1 का एक सार्वजनिक रूप से उपलब्ध खंड है। यह लाइन पहले वीडियो सामग्री से निकाले गए संरचित मानव कार्यों पर प्रशिक्षित होती है, और फिर विभिन्न रोबोटिक निकायों के लिए अनुकूलित की जाती है। कंपनी का आधिकारिक ब्रांडिंग नाम लाइट ओरिजिन है; यह रिलीज़ पिछले नेविगेशन मॉड्यूल लाइटनेव-0 से अलग है।

लाइट ओरिजिन ने एक कार्यप्रवाह का वर्णन किया है जिसमें वीडियो में लोगों का सेगमेंटेशन, त्रि-आयामी गति का पुनर्निर्माण और मूल, शरीर की मुद्रा और हाथ की स्थिति के पथ का टोकनाइजेशन करके उन्हें असतत क्रिया टोकन में बदलना शामिल है। ये टोकन ट्रांसफार्मर के ऑटोरेग्रेसिव प्री-ट्रेनिंग के लिए भाषाई और दृश्य डेटा के साथ बारी-बारी से आते हैं।

स्केलिंग प्रयोगों ने 3.75 अरब से लेकर 120 अरब मल्टीमॉडल टोकन तक को कवर किया - जो सबसे बड़े बजट पर अनुमानित 100,000 घंटे के पुनर्निर्मित मानव कार्यों के बराबर है - जिससे एगोसेंट्रिक दृष्टिकोण से मानव डेटा और यूनिट्री जी1 और लाइट ओरिजिन के अपने लाइटबॉट डेटासेट के सिस्टम के अनुकूलन के बाद अगले कार्य हानि और पूरे शरीर की मुद्रा त्रुटि में कमी आई है।

लॉन्च सामग्री में उल्लिखित प्रदर्शन इस पिछले अनुभव को लाइटबॉट और यूनिट्री जी1 पर स्क्वाट, संतुलन बनाना, पोंछना और वस्तुओं को उठाना जैसी क्रियाएं करने के लिए स्थानांतरित करते हैं।

हगिंग फेस पेज पर, प्रीव्यू संस्करण Qwen3.5-4B-Base मॉडल ट्री में 6बी चेकपॉइंट दिखाता है। मॉडल एक पाठ निर्देश लेता है, एक संक्षिप्त तर्क ट्रेस उत्पन्न करता है, और प्रति सेकंड 20 फ्रेम की दर से पूरे शरीर की क्रियाओं के अनुक्रम आउटपुट करता है। आउटपुट प्रारूप प्रति फ्रेम 138 मानों का होता है, जिसमें मूल गति, कूल्हे की ऊंचाई, यॉ, 22 जोड़ और हाथ की खोलने की स्थिति शामिल होती है।

वास्तविक हार्डवेयर पर इन पथों को लागू करने के लिए अभी भी एक अलग व्यवहार मॉडल या निम्न-स्तरीय नियंत्रक की आवश्यकता होती है। लाइट ओरिजिन यूनिट्री जी1 के लिए एक उदाहरण पथ का दस्तावेजीकरण करती है, जो वर्तमान में अतिरिक्त नीति चेकपॉइंट के साथ सिमुलेशन में चल रहा है। कंपनी द्वारा किए गए RoboCasa GR-1 रसोई सिमुलेशन के परिणामों की भी सूचना दी गई है, जिसने 24 कार्यों में मैक्रोमेट्रिक रूप से 79.3% सफलता हासिल की, हालांकि यह स्वतंत्र सार्वजनिक रेटिंग नहीं है।

रोबोटिक्स में लगे टीमों के लिए, लाइट-ओ1-प्रीव्यू एक अनुमत लाइसेंस के तहत डाउनलोड करने योग्य मोशन-प्राथमिकता परत है, न कि रोबोट के लिए तैयार ऑपरेटिंग सिस्टम। खुले वजन प्रयोगशालाओं को मानव वीडियो सामग्री पर प्री-ट्रेनिंग दावों का परीक्षण करने की अनुमति देते हैं; हालाँकि, विभिन्न निकायों के बीच स्थानीय हेरफेर कार्यों की गुणवत्ता अभी भी अनुकूलन डेटा और नियंत्रकों पर निर्भर करती है, जो आंशिक रूप से मालिकाना बने हुए हैं।

समान कहानियाँ

SenseTime ने SenseNova U1.5 जारी किया: ओपन-सोर्स ट्रेनिंग के साथ यूनिफाइड विजन के लिए 8 बिलियन पैरामीटर मॉडल
और पढ़ें
pandaily.com

SenseTime ने SenseNova U1.5 जारी किया: ओपन-सोर्स ट्रेनिंग के साथ यूनिफाइड विजन के लिए 8 बिलियन पैरामीटर मॉडल

SenseTime कंपनी ने SenseNova U1.5 प्रस्तुत किया है - आठ अरब मापदंडों वाला एक मॉडल जो पिक्सेल स्पेस में समझ, तर्क और पीढ़ी को एक एकीकृत नेटिव मल्टीमॉडल सिस्टम में जोड़ता है।

मौजूदा पाइपलाइनों के विपरीत, जो धारणा के लिए विजन एनकोडर और संश्लेषण के लिए एक अलग वैरिएशनल ऑटोएनकोडर का उपयोग करते हैं, U1.5 इन बाहरी मॉड्यूल के बिना पिक्सेल और टेक्स्ट को एक सामान्य फ्रेमवर्क में प्रदर्शित करता है। यह कंपनी की NEO-unify लाइन के अनुरूप है, जबकि उत्पादन रिज़ॉल्यूशन पर उच्च सटीकता प्राप्त करने के लिए स्थानिक पुनर्निर्माण में सुधार किया गया है।

वास्तुशिल्प परिवर्तन स्वतंत्र MLP पैच डिकोडिंग को एक हल्के स्थानिक डिकोडर से बदलने पर केंद्रित है। विज़ुअल टोकन को फीचर के दो-आयामी क्षेत्र में परिवर्तित किया जाता है, और फिर पिक्सेल शफल और स्थानीय कनवल्शन चरणों का उपयोग करके पुनर्स्थापित किया जाता है, जिससे अंतिम रूप देने से पहले आसन्न क्षेत्रों को जानकारी का आदान-प्रदान करने की अनुमति मिलती है।

SenseTime ने बताया कि इंटरफ़ेस अभी भी एक विज़ुअल टोकन पर 32x32 के आकार के प्रत्येक क्षेत्र को प्रदर्शित करता है, लेकिन यह पिछली U1 संस्करण की तुलना में कम सीम और बनावट विषमता के साथ 4K तक नेटिव जनरेशन का समर्थन करता है। यह चौड़े पहलू अनुपात में रिज़ॉल्यूशन को ध्यान में रखने वाले नॉइज़ कंडीशनिंग के कारण संभव हुआ है।

ट्रेनिंग के बाद की प्रक्रिया विशेषज्ञता, उसके बाद यूनिफिकेशन के नुस्खे का पालन करती है। रीइन्फोर्समेंट लर्निंग विशेषज्ञ विज़ुअल एस्थेटिक्स, बाइलिंगुअल टेक्स्ट रेंडरिंग, इन्फोग्राफिक लेआउट और इमेज एडिटिंग पर ध्यान केंद्रित करते हैं। फिर नीति पर बहु-विशेषज्ञ डिस्टिलेशन इन कौशलों को उनकी अपनी जनरेशन ट्रेजेक्टरी के साथ एक छात्र में एकीकृत करता है।

SenseTime का दावा है कि U1.5 के परिणाम छवि पीढ़ी और संपादन के डेटासेट में U1 से बेहतर हैं, जिसमें प्रतिस्पर्धी बाइलिंगुअल टेक्स्ट रेंडरिंग और मल्टी-रेफरेंस एडिटिंग शामिल है, जबकि मानक STEM, VQA और OCR बेंचमार्क पर समग्र रूप से उच्च मल्टीमॉडल समझ स्कोर बनाए रखता है।

arXiv और Hugging Face Papers पर प्रकाशित तकनीकी रिपोर्ट के अलावा, SenseTime प्रशिक्षण कोड को ओपन-सोर्स बनाता है, जिसमें नियंत्रित फाइन-ट्यूनिंग, रीइन्फोर्समेंट लर्निंग और पॉलिसी डिस्टिलेशन शामिल है। मॉडल एसेट्स OpenSenseNova संगठन के तहत SenseNova और Hugging Face संग्रहों में उपलब्ध हैं। यह रिलीज़ U1.5-Lite-Preview का प्रारंभिक संस्करण नहीं है, बल्कि एक पूर्ण U1.5 उत्पाद है, और यह डेवलपर्स के लिए डिज़ाइन किया गया है जो एक कॉम्पैक्ट नेटिव यूनिफाइड विजन मॉडल प्राप्त करना चाहते हैं जिसे पूरी तरह से एक्सप्लोर, ट्यून और रिट्रेन किया जा सके।

लाइट ओरिजिन ने लाइटनेव-0 मॉडल जारी किया - ओपन-सोर्स यूनिवर्सल नेविगेशनल ब्रेन
और पढ़ें
pandaily.com

लाइट ओरिजिन ने लाइटनेव-0 मॉडल जारी किया - ओपन-सोर्स यूनिवर्सल नेविगेशनल ब्रेन

लाइट ओरिजिन कंपनी ने अपना मॉडल लाइटनेव-0 सार्वजनिक कर दिया है। यह कॉम्पैक्ट यूनिवर्सल नेविगेशनल मॉडल Qwen3-VL-4B बैकबोन पर बनाया गया है और इसे वज़न, कोड, तकनीकी रिपोर्ट और INSIGHT-Bench मूल्यांकन किट के साथ जारी किया गया है।

कंपनी इस मॉडल को एक नेविगेशनल ब्रेन के रूप में प्रस्तुत करती है जो निर्देशों का पालन करने, खुले शब्दावली वाले ऑब्जेक्ट्स पर नेविगेट करने और विज़ुअल ट्रैकिंग जैसे कार्यों को पूरा करने के लिए एक एकीकृत टोकन इंटरफ़ेस का उपयोग करता है, जिसके लिए प्रत्येक कार्य के लिए विशेष आउटपुट लेयर्स की आवश्यकता नहीं होती है।

कार्य का आधार घोषित पैमाने पर Real2Sim2Real प्रक्रिया है। एक विशेष डेटा इंजन इंटरनेट से एकत्र किए गए 2000 से अधिक वास्तविक दृश्यों को पुन: प्रयोज्य सिमुलेटर में परिवर्तित करता है। फिर दृष्टि, भाषा और क्रिया की सुसंगत बातचीत के 4000 घंटे से अधिक का संश्लेषण किया जाता है।

प्रशिक्षण प्रक्रिया तीन चरणों में होती है: पहले स्थानिक प्रतिनिधित्व बनाने के लिए एम्बोडीड रीजनिंग के साथ प्रशिक्षण होता है; इसके बाद सुसंगत ट्रेजेक्टरीज़ पर एम्बोडीड कंट्रोल्ड फाइन-ट्यूनिंग होती है; और अंत में, ऑनलाइन रीइन्फोर्समेंट लर्निंग का उपयोग किया जाता है, जिससे नीति अपनी स्वयं की त्रुटियों के आधार पर बेहतर हो सके।

विविधता सुनिश्चित करने के लिए, कैमरे की ऊंचाई, दृश्य क्षेत्र और झुकाव को यादृच्छिक बनाया जाता है ताकि किसी भी फाइन-ट्यूनिंग पर शुरू होने से पहले समान दृश्यों को कई दृष्टिकोणों से कवर किया जा सके।

मूल्यांकन करते हुए, लाइट ओरिजिन बताती है कि फर्स्ट-पर्सन व्यू से लिया गया मोनोक्युलर RGB लाइटनेव-0 दस विभिन्न नेविगेशनल परिदृश्यों में उच्च परिणाम प्रदर्शित करता है। इन परिदृश्यों में VLN-CE, मैटरपोर्ट3D/HM3D ऑब्जेक्ट नेविगेशन, HM3D-OVON और EVT-Bench ट्रैकिंग शामिल हैं।

यह मॉडल सिंगल-कैमरा तरीकों में शीर्ष स्थान रखता है और पैनोरमिक सिस्टम को शामिल करने पर भी प्रतिस्पर्धी बना रहता है। दो-चैनल निर्देश टोकन छवि स्थान में स्थानिक इरादों को व्यक्त करते हैं। आगे, अवशेष वेक्टर क्वांटाइजेशन के साथ त्रि-स्तरीय एक्शन टोकनाइज़र टीम के अनुसार सेंटीमीटर में पुनर्निर्माण त्रुटि के साथ 10-स्टेप चंक को डिकोड करता है।

जीरो-नॉलेज डेमो विभिन्न आंतरिक और बाहरी दृश्यों में मानवोइड, चौपाया, पहिया और हवाई प्लेटफार्मों पर एक ही चेकपॉइंट को लागू करने की अनुमति देते हैं जो पहले कभी नहीं देखे गए थे, जिसमें भीड़भाड़ वाली सड़कों पर ट्रैकिंग भी शामिल है।

सभी कलाकृतियाँ GitHub पर lightorigins/LightNav-0 और Hugging Face पर LightOriginsHQ/LightNav-0 पर Apache 2.0 लाइसेंस के तहत सार्वजनिक रूप से उपलब्ध हैं। रोबोटिक्स में लगे टीमों के लिए, सबसे मूल्यवान पहलू केवल एक और VLN स्कोर नहीं है, बल्कि सुसंगतता का पुनरुत्पादनीय चक्र है - वास्तविक दृश्यों से सिमुलेशन तक, और फिर विषम निकायों तक - जिसका उद्देश्य टेलीऑपरेशन पर अत्यधिक निर्भर नेविगेशन डेटा संग्रह को कम करना है, जबकि एक एकीकृत RGB और भाषा इंटरफ़ेस बनाए रखा जाता है।

शंघाई एआई लैब ने 744 बिलियन पैरामीटर वाले MoE आर्किटेक्चर पर आधारित Atria Dawn मॉडल का प्रीव्यू जारी किया
और पढ़ें
pandaily.com

शंघाई एआई लैब ने 744 बिलियन पैरामीटर वाले MoE आर्किटेक्चर पर आधारित Atria Dawn मॉडल का प्रीव्यू जारी किया

शंघाई आर्टिफिशियल इंटेलिजेंस लेबोरेटरी ने Atria Dawn Preview प्रस्तुत किया है — एक एजेंटिक भाषा मॉडल जिसे केवल प्रदर्शन चैट के लिए नहीं, बल्कि जटिल अनुसंधान और इंजीनियरिंग प्रक्रियाओं का समर्थन करने के लिए विकसित किया गया है। यह प्रीव्यू मॉडल 744 बिलियन पैरामीटर के Mixture-of-Experts (MoE) के आधार पर है, जिसे GLM-5.2 के रूप में पहचाना गया है।

इस मॉडल की संदर्भ विंडो 256K है और इसे MIT लाइसेंस के तहत वितरित किया जाता है। चेकपॉइंट्स, मानक निर्देशिका और FP8-instruct प्रारूप में क्वांटाइज़्ड दोनों, Hugging Face और ModelScope प्लेटफॉर्म पर उपलब्ध हैं। इसके अलावा, अंतरराष्ट्रीय और चीनी क्षेत्रों में उपयोगकर्ताओं के लिए एपीआई तक पहुंच प्रदान की जाती है।

मॉडल के दस्तावेज़ीकरण और arXiv पर सहवर्ती लेख के अनुसार, सिस्टम को Verifiable Experience Pipeline का उपयोग करके प्रशिक्षित किया गया था। यह पाइपलाइन टूल-मध्यस्थता वाले तर्क को निष्पादन वातावरण और बाहरी रूप से सत्यापन योग्य परिणामों से जोड़ती है। मुख्य अवधारणा पूर्ण निष्पादन चक्र में निहित है: समस्या का विश्लेषण करना, समाधान डिजाइन करना, उपकरणों को कॉल करना, कोड और प्रयोगों को निष्पादित करना, परिणामों की जाँच करना और पर्यावरण से निरंतर फीडबैक के भीतर विफलताओं से उबरना, न कि केवल एक एकल उत्तर प्राप्त करना।

प्रयोगशाला ने मॉडल की क्षमताओं को खोज, निर्माण, वितरण और साइबर सुरक्षा को कवर करने वाले परिदृश्यों के लिए समूहीकृत किया है। इन परिदृश्यों में गहन शोध, सॉफ्टवेयर विकास, संरचित कार्यालय सामग्री तैयार करना और अधिकृत सुरक्षा ऑडिट शामिल हैं।

प्रयोगशाला द्वारा प्रस्तुत 16 बेंचमार्क पर मूल्यांकन में, Atria Dawn Preview ने पांच कार्यों में उच्चतम स्कोर प्रदर्शित किया। इनमें AutomationBench पर 53.8, BrowseComp पर 92.5, DeepSearchQA पर 96.0, BFCL v4 पर 77.0 और CyberGym पर 86.5 शामिल हैं। अन्य मेट्रिक्स प्रतिस्पर्धी बने हुए हैं, लेकिन उन्नत एजेंट बेस मॉडलों की तुलना में प्रमुख नहीं हैं।

यह रिलीज़ शंघाई एआई लैब के पिछले विकासों, जैसे Intern W0 और संबंधित NCP कार्यों से अलग है। Dawn को बहु-चरणीय वैज्ञानिक और इंजीनियरिंग परियोजनाओं के लिए एक ओपन एजेंट पार्टनर के रूप में स्थापित किया गया है, और वज़न जारी होने के साथ ही GitHub और Atria परियोजना की विशेष वेबसाइट पर सार्वजनिक संपत्ति भी प्रदान की गई है।

डेवलपर्स SGLang और vLLM जैसे फ्रेमवर्क के माध्यम से स्थानीय उपयोग के लिए वज़न डाउनलोड कर सकते हैं, या क्षेत्रीय एपीआई कंसोल का उपयोग कर सकते हैं। कोडेक्स-शैली के क्लाइंट टेक्स्ट-ओनली मोड सेटिंग्स का उपयोग करके रिस्पॉन्स एपीआई के साथ इंटरैक्ट कर सकते हैं। फिर भी, टीमों को दीर्घकालिक कार्यों के लिए AutomationBench और टूलचेन परिणामों को स्वयं दोहराने और लाइसेंसिंग तथा परिनियोजन की शर्तों की जांच करने की सलाह दी जाती है। 'प्रीव्यू' लेबल को गंभीरता से लेना महत्वपूर्ण है, क्योंकि प्रकाशित डेटासेट के बाहर एजेंट की विश्वसनीयता अभी भी एक खुला प्रश्न है, जबकि प्रयोगशालाएं कार्य सहायक से परियोजनाओं पर सहयोगात्मक कार्य की ओर बढ़ रही हैं।

लोकप्रिय