रोबोटेरा का VPP2 मॉडल रोबोडोजो में पहला स्थान हासिल करता है और वास्तविक ALOHA मैनिपुलेटर पर कार्यों में 58.5% सफलता दिखाता है
और पढ़ें
Pandaily
pandaily.com

रोबोटेरा का VPP2 मॉडल रोबोडोजो में पहला स्थान हासिल करता है और वास्तविक ALOHA मैनिपुलेटर पर कार्यों में 58.5% सफलता दिखाता है

रोबोटेरा कंपनी, जिसके पास Tsinghua विश्वविद्यालय का समर्थन है, ने घोषणा की है कि उसका विश्व स्तरीय मॉडल VPP2 अब रोबोडोजो में पहले स्थान पर है। इस सिमुलेशन बेंचमार्क का क्यूरेशन हांगकांग विश्वविद्यालय के MMLab द्वारा किया जाता है और इसमें लगभग 20 शैक्षणिक संस्थान शामिल हैं।

QbitAI के आंकड़ों के अनुसार, VPP2 ने दो रोबोडोजो मैनिपुलेटर के साथ 42 कार्यों में औसतन 32.26% सफलता दर और 39.26 का औसत स्कोर प्रदर्शित किया। ये कार्य सामान्यीकरण, सटीक हेरफेर, लंबी क्षितिज वाले कार्य, स्मृति और खुले शब्दावली वाले निर्देशों जैसे पहलुओं का परीक्षण करते हैं। मॉडल ने सामान्यीकरण, सटीकता और स्मृति श्रेणियों में भी पहला स्थान प्राप्त किया।

रोबोटेरा इस बात पर जोर देता है कि इन प्रदर्शनों को अतिरिक्त प्रशिक्षण डेटा या एजेंट-आधारित पुनरावर्ती आत्म-सुधार जैसी ओवरले के उपयोग के बिना प्राप्त किया गया था, जिसमें केवल मानक डेटासेट का उपयोग किया गया था। उनके शोध में उल्लिखित सबसे मजबूत नियंत्रण मॉडल - अतिरिक्त प्रशिक्षण के बाद GPT-6-Astra - ने क्रमशः 22.48% और 28.97 परिणाम दिखाए। रैंकिंग वैज्ञानिक पेपर में प्रस्तुत आंकड़ों से मेल खाती है। इससे पहले, Simate कंपनी ने रोबोडोजो में Simate-beta सिस्टम के साथ अपनी सफलता की घोषणा की थी।

VPP2 मॉडल विश्व स्तरीय मॉडलों की ज्ञात कमजोरी को दूर करने के लिए डिज़ाइन किया गया है: यदि वीडियो पूर्वानुमान गलत है, तो कार्रवाई उस पूर्वानुमान का पालन करती है। रोबोटेरा में प्रशिक्षण प्रक्रिया को तीन चरणों में विभाजित किया गया है। पहला चरण अलीबाबा के ओपन सोर्स Wan2.1-I2V-14B पर आधारित इवेंट स्तर पर वीडियो प्री-ट्रेनिंग है। यह मॉडल को रोबोट, मनुष्यों और सामान्य वीडियो सामग्री से विस्तृत रूप से एनोटेट किए गए क्लिप का उपयोग करके शुरुआत से अंत तक पूरी हेरफेर प्रक्रिया की भविष्यवाणी करना सिखाता है।

इसके बाद, पूर्वानुमान को निश्चित आठ-सेकंड के खंडों तक कम किया जाता है और एक चरण में आसवित किया जाता है जो लगभग 0.12 सेकंड लेता है। तीसरा चरण 0.9 बिलियन पैरामीटर के Action DiT का उपयोग करता है, जो पूर्वानुमानों को गति में बदलने के लिए सीखता है, जबकि वीडियो मॉडल फ्रीज रहता है और केवल LoRA के माध्यम से अनुकूलित होता है। एक्शन ब्लॉक के लिए कुल विलंबता लगभग 0.22 सेकंड है।

वास्तविक दो-मैनिपुलेटर रोबोट ALOHA पर परीक्षण करते समय, VPP2 ने पूर्व-प्रशिक्षण के बिना 10 प्रकार के कार्यों में औसतन 58.5% दिखाया, जिसमें पिकअप, प्लेसमेंट, स्टैकिंग, फोल्डिंग और पोरिंग शामिल हैं। यह फिजिकल इंटेलिजेंस के pi0.5 के 40% से अधिक है, और मॉडल इन कार्यों में से नौ में सर्वश्रेष्ठ था। इसने LIBERO-Pro पर 45.0% और LIBERO-OOD पर 63.9% अंक प्राप्त किए। उच्च-स्तरीय योजनाकार के रूप में दृष्टि और भाषा मॉडल को जोड़ने से रोबोडोजो के चयनित लंबी क्षितिज वाले कार्यों के परिणाम 27.6% से बढ़कर 57.6% हो गए।

रोबोटेरा पहले से ही चीन पोस्ट और SF एक्सप्रेस जैसी कंपनियों के साथ साझेदारी में पांच प्रांतों और शहरों में 10 से अधिक लॉजिस्टिक केंद्रों में रोबोट का उपयोग कर रहा है, हालांकि इसका मतलब VPP2 का पूर्ण पैमाने पर कार्यान्वयन नहीं है। मॉडल कोड GitHub पर सार्वजनिक रूप से उपलब्ध है।

समान कहानियाँ

डालियन यूनिवर्सिटी ऑफ टेक्नोलॉजी का VA-बेंच ने दिखाया कि सर्वश्रेष्ठ मल्टीमॉडल मॉडल रोबोटिक्स के केवल आधे कार्यों को ही पूरा करते हैं
और पढ़ें
pandaily.com

डालियन यूनिवर्सिटी ऑफ टेक्नोलॉजी का VA-बेंच ने दिखाया कि सर्वश्रेष्ठ मल्टीमॉडल मॉडल रोबोटिक्स के केवल आधे कार्यों को ही पूरा करते हैं

डालियन यूनिवर्सिटी ऑफ टेक्नोलॉजी की एक शोध टीम ने VA-बेंच प्रस्तुत किया है - एक नया बेंचमार्क जो यह जांचने के लिए डिज़ाइन किया गया है कि सामान्य मल्टीमॉडल बड़े भाषा मॉडल दृश्य जानकारी को रोबोटिक हाथ की सफल क्रियाओं में कैसे परिवर्तित कर सकते हैं।

परीक्षणित बारह कॉन्फ़िगरेशन में से, अलीबाबा का सर्वश्रेष्ठ मॉडल, Qwen3.8-max, औसतन 53.93% कार्यों को पूरा करने में सक्षम था। यह इंगित करता है कि 'दृश्य' करने में सक्षम मॉडल अभी भी संबंधित कार्यों को विश्वसनीय रूप से निष्पादित करने में चुनौतियों का सामना कर रहे हैं।

बेंचमार्क का विवरण arXiv (2609.19554) और चीनी प्रकाशन Sina Tech पर एक लेख में प्रकाशित किया गया है। VA-बेंच प्रक्रिया के पूरे चक्र का मूल्यांकन करता है: अवलोकन, तर्क, कार्रवाई और सुधार। प्रत्येक परीक्षण शुरू होने से पहले, मॉडल सफल प्रदर्शन का वीडियो देखता है, लेकिन उसे वस्तुओं के निर्देशांक, विशेषज्ञों के पथ या क्रियाओं के सटीक पैरामीटर प्रदान नहीं किए जाते हैं।

परीक्षण के दौरान, मॉडल स्वतंत्र रूप से कैमरे के कोण बदल सकता है, जिससे इंटरैक्शन चरणों की संख्या बढ़ जाती है, और उसे विशिष्ट कमांड जारी करनी होती है: प्रत्येक अक्ष पर मिलीमीटर में विस्थापन, घुमाव के कोण और ग्रिपर को खोलने या बंद करने के निर्देश। एक निश्चित नियंत्रक केवल उन निर्देशों का पालन करता है जो मॉडल प्रदान करता है।

परीक्षण का दायरा और संरचना

बेंचमार्क में 14 प्रकार के मैनिपुलेशन कार्य शामिल हैं, जिसमें एक हाथ के साथ 11 कार्य और दो हाथों के साथ तीन कार्य शामिल हैं। प्रत्येक कार्य में भौतिकी सिमुलेशन में 20 भौतिक रूप से सत्यापित दृश्य शामिल हैं, जो 280 मूल दृश्य बनाते हैं। इसके अलावा, ज्यामिति और लेआउट के विकल्प जोड़े गए थे, साथ ही पांच वस्तुओं वाला एक ट्रैक भी जोड़ा गया, जिसके लिए लंबे समय तक निष्पादन की आवश्यकता थी। मॉडल की प्रत्येक कॉन्फ़िगरेशन को तीन बार चलाया गया था।

प्रमुख मॉडलों ने लक्ष्य स्थानीयकरण में 100% सटीकता और आवश्यक हेरफेर को समझने में 99.6%–100% प्राप्त किया, हालांकि पूरे कार्य की समग्र सफलता लगभग आधी रही। विदेश में प्रस्तुत Opus-5 और GPT-5.6-sol ने Qwen3.8-max का अनुसरण किया, क्रमशः 52.86% और 51.55% परिणाम दिखाए। लेखकों ने उल्लेख किया कि तीनों लीडर 2.38 प्रतिशत अंकों के भीतर हैं, और विश्वसनीय रैंकिंग के बारे में कोई बयान नहीं देते हैं। उप-कार्यों के पूरा होने का प्रतिशत 65.9% से 68.6% रहा, जो दर्शाता है कि कई विफलताएं आंशिक प्रगति के बाद होती हैं। अन्य सभी शर्तों ने 23.10% या उससे कम का परिणाम दिखाया।

मुख्य रूप से पहचानी गई समस्याएं

दो प्रमुख कमियां पाई गईं। Qwen3.8-max 73.6% मामलों में त्रुटियों को पहचानने में सक्षम था, लेकिन उन्हें केवल 46.7% मामलों में ऑनलाइन ठीक किया। एक हाथ के कार्यों में इसकी सफलता दर 65.61% थी, लेकिन दो हाथ के कार्यों में केवल 11.11% थी, जिनके लिए प्रत्येक हाथ के बीच वस्तुओं का वितरण और उनके आपसी स्थान का समन्वय आवश्यक है।

सक्रिय अवलोकन अतिरिक्त कैमरों की उपस्थिति की तुलना में अधिक महत्वपूर्ण कारक साबित हुआ। तुलनात्मक विश्लेषण में, जब Qwen3.8-max ने स्वयं देखने के बिंदु चुने, तो वह 280 दृश्यों में से 57.50% सफलता प्राप्त करने में सक्षम था, जबकि जब उसे पांच निश्चित दृश्य प्रदान किए गए, तो यह 27.86% था। इस बीच, चारों परीक्षण किए गए मॉडल सक्रिय अवलोकन के बिना परीक्षण में भाग लेने से इनकार कर दिए।

एक ही कार्य को बनाए रखते हुए वस्तुओं, कंटेनरों या लेआउट के आकार में परिवर्तन ने एक मानक मॉडल की सफलता को 30 अंक से अधिक कम कर दिया - 80.00% से 47.86% तक। इसी तरह, Qwen3.8-max ने अपने आंकड़े को 77.86% से 67.86% तक कम कर दिया। लंबे समय तक चलने वाले ट्रैक में, Qwen3.8-max ने 100 में से 61 वस्तुओं को रखा, लेकिन किसी भी मॉडल ने एक भी सख्त एपिसोड को पूरा नहीं किया।

यह बेंचमार्क इस सप्ताह प्रकाशित 'एम्बोडीड ब्रेन' SuperCLUE रैंकिंग से अलग है, क्योंकि VA-बेंच यह मापता है कि धारणा, तर्क और योजना के निर्णय एक सफल भौतिक कार्रवाई की ओर ले जाते हैं या नहीं, जबकि SuperCLUE इन पहलुओं का मूल्यांकन करता है।

SemiDrive और Radxa ने D9-Max पर आधारित रोबोट गति नियंत्रक RoboX D9M प्रस्तुत किया
और पढ़ें
pandaily.com

SemiDrive और Radxa ने D9-Max पर आधारित रोबोट गति नियंत्रक RoboX D9M प्रस्तुत किया

ऑटोमोटिव चिपमेकर SemiDrive और ओपन-सोर्स हार्डवेयर निर्माता Radxa ने 29 सितंबर को एक रणनीतिक सहयोग समझौते पर हस्ताक्षर किए और RoboX D9M जारी किया - रोबोटों के लिए एक तैयार उपयोग योग्य मस्तिष्क नियंत्रक। रोबोटिक्स के क्षेत्र में, मस्तिष्क गति नियंत्रण का वह स्तर है जो रोबोट की उच्च-स्तरीय कृत्रिम बुद्धिमत्ता के अधीन होता है।

यह बोर्ड SemiDrive के D9-Max एज कंप्यूटिंग सिस्टम-ऑन-चिप (SoC) पर काम करता है। दोनों कंपनियों ने कहा कि इस समाधान के कारण रोबोट निर्माताओं को अपने स्वयं के होस्ट बोर्ड विकसित करने की आवश्यकता से मुक्ति मिलती है, जिससे टीमों को गति एल्गोरिदम और उत्पाद परिभाषा पर ध्यान केंद्रित करने की अनुमति मिलती है।

D9-Max चिप 12-कोर CPU, 8 TOPS क्षमता वाले NPU और सिंक्रोनस निष्पादन मोड में काम करने के लिए तीन जोड़े Cortex-R5/R5F क्लॉक कोर को एकीकृत करता है। यह 4,266 एमबीपीएस की गति वाले LPDDR4X मेमोरी और eMMC 5.1 स्टोरेज का समर्थन करता है, और ISO 26262 ASIL-B कार्यात्मक सुरक्षा स्तर का अनुपालन करता है। SemiDrive के उत्पाद पृष्ठ पर उल्लेख किया गया है कि हार्डवेयर अलगाव एक ही चिप को दो सिस्टम चलाने की अनुमति देता है, जिसमें गति नियंत्रण को इंटरैक्शन, धारणा, डिस्प्ले और संचार से अलग किया जाता है।

800 मेगाहर्ट्ज की आवृत्ति वाले क्लॉक कोर 25 नैनोसेकंड की इंटरप्ट प्रतिक्रिया समय प्रदान करते हैं और EtherCAT मास्टर के रूप में कार्य कर सकते हैं, जबकि दो DSPs इनवर्स काइनेमेटिक्स के समाधान को तेज करते हैं। चिप में 12 CAN FD चैनल, डुअल गीगाबिट TSN ईथरनेट, एक हार्डवेयर सुरक्षा मॉड्यूल और माइनस 40 से 105 डिग्री सेल्सियस तक के ऑपरेटिंग तापमान के लिए डिज़ाइन किया गया है। SemiDrive ने मई 2025 में D9-Max प्रस्तुत किया था और बताया कि इसके D9 चिप्स प्रमुख मानविकी रोबोट डेवलपर्स के पास बड़े पैमाने पर उत्पादन में हैं।

RoboX D9M इस चिप को 100 x 100 मिमी के बोर्ड पर एकीकृत करता है, जिसमें अंतर्निहित EtherCAT, कई CAN-FD चैनल और RS485 औद्योगिक बस इंटरफेस होते हैं। बोर्ड Linux 6.12.31, Ubuntu 26.04 LTS और ROS 2 Lyrical के पूर्व-स्थापित ऑपरेटिंग सिस्टम के साथ आता है, और इसे मानविकी रोबोट, चार पैरों वाले मशीनों और सहयोगी मैनिपुलेटरों से सीधे कनेक्ट करने के लिए डिज़ाइन किया गया है। यह Radxa का पहला विशेष गति नियंत्रक है जो मूर्त एआई के लिए है, जिसे मानविकी और पहिया रोबोट निर्माताओं के लिए एक पूर्ण 'बोर्ड-SDK' किट के रूप में बेचा जाता है।

उत्पाद के अलावा, भागीदार हार्डवेयर संदर्भ डिजाइनों, ओपन-सोर्स सॉफ्टवेयर स्टैक और वैश्विक डेवलपर समुदाय पर संयुक्त रूप से काम करने की योजना बना रहे हैं। 2012 में स्थापित और शेंज़ेन में स्थित Radxa, सिंगल-बोर्ड कंप्यूटर, सिस्टम मॉड्यूल और एज कंप्यूटिंग प्लेटफॉर्म बनाती है। SemiDrive का दावा है कि उसने 70 से अधिक ऑटोमोटिव ब्रांडों और 170 वाहन मॉडलों को 14 मिलियन से अधिक ऑटोमोटिव चिप्स की आपूर्ति की है, और रोबोटिक्स को ऑटोमोटिव चिप्स से मूर्त बुद्धिमत्ता में संक्रमण की रणनीति के हिस्से के रूप में देखता है। SemiDrive के संस्थापक और अध्यक्ष, Qiu Yujing ने टिप्पणी की कि यह साझेदारी ऑटोमोटिव-क्लास कंप्यूटिंग पावर को Radxa के ओपन-सोर्स इंजीनियरिंग समाधानों के साथ जोड़ती है। Radxa के संस्थापक, Tang Liang ने कहा कि आज रोबोट डेवलपर्स के लिए सबसे बड़ी समस्या कंप्यूटिंग शक्ति नहीं है, बल्कि प्रोटोटाइप और सीरियल उत्पादन के बीच विश्वसनीयता का अंतर है। मूल्य निर्धारण और उपलब्धता की जानकारी अभी तक जारी नहीं की गई है।

लोकप्रिय