एजीआईबॉट (AgiBot) ने GE-Act 2.0 जारी किया है - एक मॉडल जो वैश्विक स्तर पर मूल है और जिसे मौजूदा वीडियो जनरेटर से अनुकूलित करने के बजाय पूरी तरह से मूर्त रूप में हेरफेर डेटा पर प्रशिक्षित किया गया है। कंपनी का दावा है कि यह रिलीज़ इस बात की पहली व्यवस्थित जांच प्रस्तुत करती है कि कैसे एक वैश्विक मॉडल सीखने के घंटों को दो परिमाणों तक बढ़ाने पर वास्तविक रोबोटों के लिए नई क्षमताएं खोल सकता है - लगभग 300 घंटे से 30,000 घंटों तक, बिना किसी विशिष्ट कार्य के लिए फाइन-ट्यूनिंग या मूल्यांकन के दौरान प्रदर्शन क्लिप का उपयोग किए बिना।
मौजूदा प्रणालियों के विपरीत, जो एक्शन हेड को एक स्थिर वीडियो मॉडल से जोड़ती हैं, GE-Act 2.0 रोबोट डेटा पर दृष्टि प्रतिनिधित्व, भविष्य की भविष्यवाणी और कार्रवाई की भविष्यवाणी को एक साथ प्रशिक्षित करता है। परीक्षण के दौरान, दृश्यों, पृष्ठभूमि, प्रकाश व्यवस्था और ऑब्जेक्ट इंस्टेंस को प्रशिक्षण प्रक्रिया से बाहर रखा जाता है। इस शून्य-फायर प्रोटोकॉल के तहत, जिसमें 100 परमाणु कार्य और दो मूर्त रूपों पर लगभग 20 कौशल परिवार शामिल हैं, डेटा की मात्रा बढ़ने के साथ सफलता दर बढ़ी: G1-OP प्लेटफॉर्म पर समग्र सफलता दर 17.1% से बढ़कर 44.1% हो गई, और G2-90D पर 13.4% से बढ़कर 31.1% हो गई, और 5000 और 30,000 घंटों के बीच वृद्धि दोनों स्तरों पर उल्लेखनीय बनी रही।
कंपनी सूक्ष्म कौशल के लिए 'इग्निशन' घटना पर जोर देती है। वे कार्य जो गैर-शून्य सफलता प्रदर्शित करते थे, G1-OP पर 39 से 76 और G2-90D पर 24 से 72 तक बढ़ गए। तौलिया मोड़ना, कागज के कप डालना, पेन कैप हटाना और बदलना, और नए दृश्यों में गुलदस्ता बनाना जैसे कार्यों ने केवल सबसे बड़े डेटा स्तर तक पहुंचने के बाद ही विश्वसनीय रूप से प्रकट होना शुरू किया। क्रॉस-मूर्त रूप स्थानांतरण भी देखा गया: G1-OP ने आधे से अधिक प्रशिक्षण डेटा प्रदान किया, जबकि G2-90D ने 2% से कम प्रदान किया, फिर भी कम दुर्लभ शरीर ने कुल डेटा बढ़ने पर लगभग 17.7 प्रतिशत अंक हासिल किए।
वास्तुकला के दृष्टिकोण से, CoAE विज़ुअल एन्कोडर प्रत्येक 256x384 पिक्सेल फ्रेम को 24 टोकन में संपीड़ित करता है, जबकि सिमेंटिक, मोशन और स्थानीय संरचनात्मक संकेतों को बनाए रखता है। एक-चरणीय विज़ुअल प्लानर भविष्य के पूर्ण खंड की भविष्यवाणी करता है, और एक रिवर्स डायनेमिक्स मॉडल अनुमानित परिवर्तन को क्रियाओं में परिवर्तित करता है; AgiBot इंगित करता है कि RTX 5090 पर प्रति एक्शन चंक लगभग 104 मिलीसेकंड लगते हैं। नॉलेज-अलाइंड सेलेक्टिव ऑप्टिमाइजेशन विधि कई भविष्य के परिदृश्यों का चयन करती है और उस को बनाए रखती है जो रिकॉर्ड की गई कार्रवाइयों से सबसे अधिक मेल खाता है ताकि योजना और कार्रवाई के बीच विचलन को कम किया जा सके।
डेटा रेसिपी में अधूरे स्ट्रीम का मिश्रण शामिल है: वैश्विक मॉडल के प्री-ट्रेनिंग के लिए वीडियो निर्देश घंटों (कार्रवाई लेबल के बिना ईगोसेंट्रिक फ्रेम सहित), रिवर्स डायनेमिक्स के लिए ट्रैजेक्टरी घंटे जिनमें विफलताएं और रन शामिल हैं, और संयुक्त शिक्षण के लिए पूरी तरह से युग्मित वीडियो निर्देश और कार्रवाई घंटे। AgiBot के GE स्टैक में, GE-Sim नीति मूल्यांकन और वातावरण निर्माण पर लक्षित है, जबकि GE-Act अनुमानित भविष्य की स्थितियों को रोबोट गति में परिवर्तित करता है। वैकल्पिक फाइन-ट्यूनिंग के बाद, AgiBot ने RoboTwin के बाहर वितरण परीक्षणों में 60.52% और GenieSim निर्देशों के पालन में 0.770 का स्कोर बताया, जिससे यह कई तुलनीय बेस मॉडलों से आगे निकल गया। परियोजना सामग्री ge-act-v2.github.io पर उपलब्ध है।
