रोबोटेरा कंपनी, जिसके पास Tsinghua विश्वविद्यालय का समर्थन है, ने घोषणा की है कि उसका विश्व स्तरीय मॉडल VPP2 अब रोबोडोजो में पहले स्थान पर है। इस सिमुलेशन बेंचमार्क का क्यूरेशन हांगकांग विश्वविद्यालय के MMLab द्वारा किया जाता है और इसमें लगभग 20 शैक्षणिक संस्थान शामिल हैं।
QbitAI के आंकड़ों के अनुसार, VPP2 ने दो रोबोडोजो मैनिपुलेटर के साथ 42 कार्यों में औसतन 32.26% सफलता दर और 39.26 का औसत स्कोर प्रदर्शित किया। ये कार्य सामान्यीकरण, सटीक हेरफेर, लंबी क्षितिज वाले कार्य, स्मृति और खुले शब्दावली वाले निर्देशों जैसे पहलुओं का परीक्षण करते हैं। मॉडल ने सामान्यीकरण, सटीकता और स्मृति श्रेणियों में भी पहला स्थान प्राप्त किया।
रोबोटेरा इस बात पर जोर देता है कि इन प्रदर्शनों को अतिरिक्त प्रशिक्षण डेटा या एजेंट-आधारित पुनरावर्ती आत्म-सुधार जैसी ओवरले के उपयोग के बिना प्राप्त किया गया था, जिसमें केवल मानक डेटासेट का उपयोग किया गया था। उनके शोध में उल्लिखित सबसे मजबूत नियंत्रण मॉडल - अतिरिक्त प्रशिक्षण के बाद GPT-6-Astra - ने क्रमशः 22.48% और 28.97 परिणाम दिखाए। रैंकिंग वैज्ञानिक पेपर में प्रस्तुत आंकड़ों से मेल खाती है। इससे पहले, Simate कंपनी ने रोबोडोजो में Simate-beta सिस्टम के साथ अपनी सफलता की घोषणा की थी।
VPP2 मॉडल विश्व स्तरीय मॉडलों की ज्ञात कमजोरी को दूर करने के लिए डिज़ाइन किया गया है: यदि वीडियो पूर्वानुमान गलत है, तो कार्रवाई उस पूर्वानुमान का पालन करती है। रोबोटेरा में प्रशिक्षण प्रक्रिया को तीन चरणों में विभाजित किया गया है। पहला चरण अलीबाबा के ओपन सोर्स Wan2.1-I2V-14B पर आधारित इवेंट स्तर पर वीडियो प्री-ट्रेनिंग है। यह मॉडल को रोबोट, मनुष्यों और सामान्य वीडियो सामग्री से विस्तृत रूप से एनोटेट किए गए क्लिप का उपयोग करके शुरुआत से अंत तक पूरी हेरफेर प्रक्रिया की भविष्यवाणी करना सिखाता है।
इसके बाद, पूर्वानुमान को निश्चित आठ-सेकंड के खंडों तक कम किया जाता है और एक चरण में आसवित किया जाता है जो लगभग 0.12 सेकंड लेता है। तीसरा चरण 0.9 बिलियन पैरामीटर के Action DiT का उपयोग करता है, जो पूर्वानुमानों को गति में बदलने के लिए सीखता है, जबकि वीडियो मॉडल फ्रीज रहता है और केवल LoRA के माध्यम से अनुकूलित होता है। एक्शन ब्लॉक के लिए कुल विलंबता लगभग 0.22 सेकंड है।
वास्तविक दो-मैनिपुलेटर रोबोट ALOHA पर परीक्षण करते समय, VPP2 ने पूर्व-प्रशिक्षण के बिना 10 प्रकार के कार्यों में औसतन 58.5% दिखाया, जिसमें पिकअप, प्लेसमेंट, स्टैकिंग, फोल्डिंग और पोरिंग शामिल हैं। यह फिजिकल इंटेलिजेंस के pi0.5 के 40% से अधिक है, और मॉडल इन कार्यों में से नौ में सर्वश्रेष्ठ था। इसने LIBERO-Pro पर 45.0% और LIBERO-OOD पर 63.9% अंक प्राप्त किए। उच्च-स्तरीय योजनाकार के रूप में दृष्टि और भाषा मॉडल को जोड़ने से रोबोडोजो के चयनित लंबी क्षितिज वाले कार्यों के परिणाम 27.6% से बढ़कर 57.6% हो गए।
रोबोटेरा पहले से ही चीन पोस्ट और SF एक्सप्रेस जैसी कंपनियों के साथ साझेदारी में पांच प्रांतों और शहरों में 10 से अधिक लॉजिस्टिक केंद्रों में रोबोट का उपयोग कर रहा है, हालांकि इसका मतलब VPP2 का पूर्ण पैमाने पर कार्यान्वयन नहीं है। मॉडल कोड GitHub पर सार्वजनिक रूप से उपलब्ध है।


