Songyan Dynamics ने HERON-CRA (संदर्भ सुदृढीकरण क्रिया मॉडल) जारी किया है, जो अपनी HERON श्रृंखला में दूसरी मॉडल है, इसके बाद पिछले सप्ताह HERON-World Model प्रस्तुत किया गया था। कंपनी HERON-CRA को एक मौलिक मॉडल के रूप में प्रस्तुत करती है जो संदर्भ, सुदृढीकरण शिक्षण और कार्यों को एकीकृत करता है, जिसे रोबोटों को कार्यों के इतिहास को याद रखने, त्रुटियों को ठीक करने और विभिन्न रोबोटों के बीच कौशल स्थानांतरित करने में मदद करने के लिए डिज़ाइन किया गया है।
यह रिलीज़ तीन मुख्य घटकों द्वारा परिभाषित है। संदर्भ विशेषज्ञ (Context Expert) मल्टीमॉडल इतिहास को संरचित स्थानिक-सामयिक 4डी टोकन में एन्कोड करता है, जिससे नीति केवल वर्तमान फ्रेम पर ही नहीं, बल्कि एक मिनट से अधिक की मेमोरी विंडो प्रदर्शित करके भी विचार कर सकती है। सुदृढीकरण शिक्षण इंजन (RL Engine) एक हल्के अवशेष अभिनेता-आलोचक के रूप में कार्य करता है, जो संदर्भ विशेषज्ञ की जमी हुई कुंजी और मानों का पुन: उपयोग करता है, जब सिमुलेशन स्वयं भटकना शुरू कर देता है तो सुधारात्मक क्रियाएं सीखता है।
क्रॉस-एम्बॉडिमेंट प्रीट्रेनिंग (Cross-embodiment pretraining) टेलीऑपरेशन, सिमुलेशन, UMI शैली के डेटा और विभिन्न मैनिपुलेटर, पहिया प्लेटफॉर्म, ग्रिपर और फुर्तीले हाथों से एकत्र किए गए प्रथम-व्यक्ति वीडियो को जोड़ती है। यह प्रशिक्षण के बाद मॉडल को कम फाइन-ट्यूनिंग की आवश्यकता के साथ नई मॉर्फोलॉजी पर लागू करने की अनुमति देता है।
प्रदर्शन заявित प्रदर्शन वृद्धि पर जोर देते हैं। नरम वस्तु के साथ मोज़े मोड़ने के कार्य में Scalabot ने केवल सिमुलेशन का उपयोग करने पर 38.5% से बढ़कर RL Engine सक्रिय होने के बाद 97.8% सफलता दर में वृद्धि दर्ज की। व्यक्तिगत वीडियो लंबी अवधि के कॉफी बनाने की प्रक्रिया - पीसने से लेकर दूध डालने तक - को 30 सेकंड से भी कम समय में पूरा होते हुए दिखाते हैं। इसके अलावा, इस कौशल परिवार के ARX मैनिपुलेटर और पहिया मानवजनित Noetix M1 के बीच स्थानांतरण प्रदर्शित किया गया है। मॉडल पकड़ते समय कप के हिलने पर भी ठीक हो सकता है, और दृश्य के संक्षिप्त ओवरलैप के दौरान कुछ गति जारी रख सकता है।
तकनीकी रूप से, संदर्भ विशेषज्ञ और क्रिया विशेषज्ञ ट्रांसफॉर्मर के मिश्रण के रूप में प्रशिक्षित होते हैं। सुदृढीकरण शिक्षण पथ समय अंतर बाधाओं के साथ एक मूल्य मॉडल जोड़ता है और बिना किसी अतिरिक्त हार्डवेयर जोखिम के HERON-World Model के माध्यम से काल्पनिक प्रक्षेपवक्र चला सकता है। हालांकि स्वतंत्र टीमें अपने स्वयं के उपकरणों पर मोज़े और कॉफी मोड़ने के मेट्रिक्स को दोहराना चाहेंगी, यह रिलीज़ एक स्पष्ट एल्गोरिथम प्रदान करती है - स्मृति, अवशेष RL और क्रॉस-बॉडी प्रीट्रेनिंग - जो एकल-चरण प्रदर्शनों से परे लंबी अवधि के घरेलू हेरफेर को निष्पादित करता है।
