यूनिट्री कंपनी ने 10 सितंबर को यूनिफोएलएम-डब्ल्यूएलए-1.0 प्रस्तुत किया, जो अगली पीढ़ी के मानव सदृश रोबोटों के लिए एक जनरेटिव मौलिक मॉडल है, जिसमें लगभग 6 अरब पैरामीटर हैं। कंपनी के बयान के अनुसार, वास्तविक रोबोट डेटा पर प्रशिक्षित एक नियंत्रण फ़ाइल, जिसकी अवधि लगभग 2500 घंटे है, 64 कार्यों का समन्वय कर सकती है, जिसमें पूरे शरीर की 10 मैनिपुलेशन और टेबल पर 54 मैनिपुलेशन शामिल हैं, साथ ही यह दो-उंगली वाले ग्रिपर और कई फुर्तीले पांच उंगली वाले हाथों दोनों के साथ काम कर सकती है।
यह रिलीज़ यूनिट्री के पिछले प्रदर्शन यूनिफोएलएम-एक्स2 स्पैरिंग से अलग है; यूनिफोएलएम-डब्ल्यूएलए-1.0 दैनिक घरेलू और डेस्क कार्यों को करने के लिए एक व्यापक 'विजन-लैंग्वेज-एक्शन' स्टैक प्रस्तुत करता है, न कि युद्ध-उन्मुख प्रदर्शन।
वास्तुकला के दृष्टिकोण से, यूनिफोएलएम-डब्ल्यूएलए-1.0 इंटरैक्शन-ओरिएंटेड वर्ल्ड मॉडलिंग पर आधारित है, जिसे एमएमडीआईटी एक्शन एक्सपर्ट द्वारा पूरक किया गया है। इस मूर्त तर्क चरण, जिसे यूनिफोएलएम-ईआर-1 कहा जाता है, Qwen3-VL-4B पर बनाया गया है और इसे 5 मिलियन से अधिक मूर्त नमूनों पर प्रशिक्षित किया गया है। ये नमूने बिंदु भविष्यवाणी, वस्तु का पता लगाना, मल्टी-इमेज रीजनिंग, 2डी-ट्रैजेक्टरी, 3डी-डिटेक्शन और स्थानिक प्रश्नों के उत्तर देने जैसे पहलुओं को कवर करते हैं, जो स्थानिक धारणा को बढ़ाते हैं, जबकि सामान्य छवि और पाठ डेटा के साथ सह-प्रशिक्षण के माध्यम से व्यापक 'विजन-लैंग्वेज' कौशल बनाए रखते हैं।
इसके अलावा, गतिशील क्षेत्रों की भविष्यवाणी दृश्य परिवर्तन निकालने के लिए ऑप्टिकल फ्लो का उपयोग करती है, उन्हें फिक्स्ड-लेंथ मास्क टोकन में VQ-VAE का उपयोग करके संपीड़ित करती है, और मॉडल को यह अनुमान लगाने के लिए 'विजन-लैंग्वेज' को प्रशिक्षित करती है कि इंटरैक्शन शुरू होने के बाद कौन से क्षेत्र हिलना शुरू करेंगे। रिज़िड क्वांटाइजेशन ऑफ वैक्टर के माध्यम से असतत एक्शन ट्रेनिंग, एकीकृत एक्शन स्पेस को एंड-इफेक्टर पोज़, हाथ के जोड़ों और निचले शरीर के जोड़ों में विभाजित करती है, इन टोकन को सामान्य समय चरणों के साथ संरेखित करती है और उन्हें यूनिफोएलएम-ईआर-फ्लो में फीड करती है। WLA मॉडल, जिसे उन्होंने जारी किया है, इस मल्टीमॉडल फ्रेमवर्क से रोबोट की निरंतर क्रियाओं को डिकोड करने के लिए एमएमडीआईटी एक्सपर्ट को शामिल करता है।
16 मल्टीमॉडल सेटों पर किए गए स्थानिक और मूर्त तर्क परीक्षणों में, यूनिट्री बताती है कि यूनिफोएलएम-ईआर-1-4बी सात परीक्षणों में ओपन मॉडल से आगे निकल जाता है। इसके अलावा, ओवरलैपिंग स्थानिक सेटों पर, यह Where2Place, BLINK spatial, CV-Bench और EmbSpatial जैसे मेट्रिक्स पर स्थानीय रूप से मालिकाना GPT-6 Astra से बेहतर प्रदर्शन करता है। प्रशिक्षण यूनिट्री ओपन डेटासेट और बिटरोबोट-एचआईडब्ल्यू-500 पर आधारित है, साथ ही वास्तविक रोबोट डेटा के अन्य स्रोतों पर भी आधारित है। वीडियो मूल्यांकन यूनिट्री जी1 हार्डवेयर पर तौलिये तह करने, फोन पैक करने, बिस्तर बनाने, जूते छांटने और बाथरूम साफ करने जैसे कार्यों को करने के लिए प्रदर्शित होते हैं - ऐसे कार्य जिनके लिए एक ही नीति के भीतर हाथों, एंड-इफेक्टर और निचले शरीर की समन्वित गति की आवश्यकता होती है।
यह ध्यान रखना महत्वपूर्ण है कि परियोजना पृष्ठ डेवलपर्स के लिए उपलब्ध है, हालांकि कोड, मॉडल और डेटासेट अभी भी 'जल्द आ रहा है' के रूप में चिह्नित हैं। यूनिट्री ने परियोजना को ओपन सोर्स बनाने के अपने इरादे की घोषणा की है और वास्तुकला और कार्य मैट्रिक्स पर दस्तावेज़ीकरण प्रकाशित किया है, लेकिन वज़न और डेटा कॉर्पस अभी भी डाउनलोड के लिए उपलब्ध नहीं हैं। इन संसाधनों के आने तक शोधकर्ताओं और इंटीग्रेटर्स के लिए व्यावहारिक संकेत सामान्य मानव सदृश आधार की प्रकट रोडमैप और बेंचमार्क तालिका है, न कि तृतीय-पक्ष रोबोटों के लिए तैयार नियंत्रण फ़ाइल।

