Tencent Robotics ने WAIC 2026 कार्यक्रम के हिस्से के रूप में तीन मूर्त मौलिक मॉडल प्रस्तुत किए। इन मॉडलों में दृश्य समझ के लिए VLM, दृश्य स्थितियों को ध्यान में रखते हुए योजना बनाने के लिए संज्ञानात्मक मॉडल RxBrain और 500-1000 हर्ट्ज की दर से निरंतर क्रियाओं के लिए VLA शामिल हैं।
तीन स्तरीय वास्तुकला
मुख्य वैज्ञानिक अधिकारी डॉ. झांग झेनयौ ने इस वास्तुकला को एक मौलिक समस्या के समाधान के रूप में प्रस्तुत किया जिसे वर्तमान VLA दृष्टिकोण पर्याप्त रूप से संबोधित नहीं करते हैं। उन्होंने उल्लेख किया कि विभिन्न प्रकार की रोबोटिक बुद्धिमत्ता को विभिन्न आवृत्तियों पर कार्य करना चाहिए, क्योंकि भौतिक दुनिया स्वयं कई समय पैमानों पर काम करती है।
इस समस्या की समझ ओपनक्लॉ में रोबोट की क्षमताओं को स्थानांतरित करने के एक असफल प्रयोग के बाद आई, जिससे दर्जनों सेकंड की देरी हुई, जो भौतिक रोबोटों के लिए अस्वीकार्य है, जहां 2-3 सेकंड की संज्ञानात्मक देरी भी एक समस्या है।
आवृत्ति विभाजन का सिद्धांत
तीन-स्तरीय वास्तुकला आवृत्ति विभाजन के माध्यम से इस समस्या का समाधान करती है। Hy-Embodied-VLM कम आवृत्ति पर स्थानिक समझ के लिए जिम्मेदार है, जो दृश्य दृश्यों और वस्तुओं के संबंधों की व्याख्या करता है। Hy-Embodied-RxBrain संज्ञानात्मक वास्तुकला में एक महत्वपूर्ण नवीनता है: यह न केवल भाषा में कार्य चरणों को उत्पन्न करता है, बल्कि यह भी विज़ुअलाइज़ करता है कि प्रत्येक उप-कार्य पूरा होने के बाद भौतिक दुनिया कैसी दिखनी चाहिए, पाठ विवरणों के बजाय दृश्य स्थिति प्रस्तुतियों का उपयोग करके।
यह केवल भाषा पर आधारित योजना प्रणालियों की मुख्य सीमा को दूर करता है, क्योंकि पाठ विवरण स्थानिक संबंधों और भौतिक बाधाओं को प्रभावी ढंग से प्रसारित नहीं कर सकते हैं जिन्हें दृष्टि के माध्यम से तुरंत संप्रेषित किया जा सकता है। Hy-Embodied-VLA उच्चतम आवृत्ति पर काम करता है, उच्च-स्तरीय लक्ष्यों को निरंतर निम्न-स्तरीय क्रिया कमांड में परिवर्तित करता है जिसकी गति वास्तविक समय में भौतिक दुनिया के साथ इंटरैक्ट करने के लिए पर्याप्त है।
औद्योगिक परीक्षण और लाभ
Tencent ने बताया कि Hy-Embodied-VLA का रासायनिक संयंत्र में उत्पादन परीक्षण किया गया था। यह मॉडल अत्यधिक मिश्रित, कम बैच, SKU-गहन असेंबली लाइनों को संभालता है, प्रति भाग चक्र समय 6 सेकंड से कम सुनिश्चित करता है। इसके अलावा, मॉडल केवल 8 घंटे के डेटा संग्रह और फाइन-ट्यूनिंग के साथ नए SKU के अनुकूल हो सकता है।
परीक्षण की स्थितियाँ प्रयोगशाला प्रदर्शनों से काफी भिन्न हैं: वस्तुएं यादृच्छिक रूप से रखी जाती हैं, प्रकाश व्यवस्था बदलती रहती है, उत्पादन में रुकावटें आती हैं, और रोबोट को लगभग शून्य विफलता स्तर प्राप्त करना होता है। डॉ. झांग ने जोर देकर कहा कि बिना वास्तविक कार्यान्वयन के 80-90 अंक प्राप्त करने वाला प्रदर्शन वास्तव में महत्वहीन है, और कारखाना परीक्षण मापनीय औद्योगिक प्रदर्शन के प्रति प्रतिबद्धता को दर्शाता है, न कि बेंचमार्किंग मेट्रिक्स को।
तर्क और पारिस्थितिकी तंत्र में सुधार
संज्ञानात्मक मॉडल RxBrain दूसरी जटिल समस्या का समाधान करता है - रोबोटिक तर्क में भाषा की बाधा। पिछले Tairos सिस्टम अंतर-मस्तिष्क संचार के लिए पाठ पर निर्भर थे, हालांकि वस्तुओं के स्थानिक संबंधों का शब्दों में वर्णन अक्सर शब्दजालपूर्ण और अस्पष्ट होता है। नियोजन चक्र में दृश्य स्थिति प्रतिनिधित्व को शामिल करके, RxBrain धारणा और कार्रवाई के बीच सूचना हस्तांतरण की उच्च थ्रूपुट सुनिश्चित करता है।
इस मॉडल को पूर्ण विश्व मॉडल के बजाय एक मूर्त संज्ञानात्मक दुनिया मॉडल के रूप में वर्णित किया गया है, क्योंकि इस क्षेत्र में अभी तक एक सर्वसम्मत एकल विश्व मॉडल वास्तुकला हासिल नहीं की गई है। तीनों मॉडल और Tairos प्लेटफॉर्म मिलकर Tencent के संपूर्ण मूर्त बुद्धिमत्ता स्टैक का निर्माण करते हैं, जो किसी भी डेवलपर या निर्माता के उपयोग के लिए उपलब्ध है। इस प्रकार, रोबोटिक्स समुदाय अब उस आवृत्ति-संवेदनशील वास्तुकला पर निर्माण कर सकता है जिसे Tencent ने वास्तविक विफलताओं और पुनरावृत्तीय सुधार के माध्यम से विकसित किया है।