डालियन यूनिवर्सिटी ऑफ टेक्नोलॉजी का VA-बेंच ने दिखाया कि सर्वश्रेष्ठ मल्टीमॉडल मॉडल रोबोटिक्स के केवल आधे कार्यों को ही पूरा करते हैं
और पढ़ें
Pandaily
pandaily.com

डालियन यूनिवर्सिटी ऑफ टेक्नोलॉजी का VA-बेंच ने दिखाया कि सर्वश्रेष्ठ मल्टीमॉडल मॉडल रोबोटिक्स के केवल आधे कार्यों को ही पूरा करते हैं

डालियन यूनिवर्सिटी ऑफ टेक्नोलॉजी की एक शोध टीम ने VA-बेंच प्रस्तुत किया है - एक नया बेंचमार्क जो यह जांचने के लिए डिज़ाइन किया गया है कि सामान्य मल्टीमॉडल बड़े भाषा मॉडल दृश्य जानकारी को रोबोटिक हाथ की सफल क्रियाओं में कैसे परिवर्तित कर सकते हैं।

परीक्षणित बारह कॉन्फ़िगरेशन में से, अलीबाबा का सर्वश्रेष्ठ मॉडल, Qwen3.8-max, औसतन 53.93% कार्यों को पूरा करने में सक्षम था। यह इंगित करता है कि 'दृश्य' करने में सक्षम मॉडल अभी भी संबंधित कार्यों को विश्वसनीय रूप से निष्पादित करने में चुनौतियों का सामना कर रहे हैं।

बेंचमार्क का विवरण arXiv (2609.19554) और चीनी प्रकाशन Sina Tech पर एक लेख में प्रकाशित किया गया है। VA-बेंच प्रक्रिया के पूरे चक्र का मूल्यांकन करता है: अवलोकन, तर्क, कार्रवाई और सुधार। प्रत्येक परीक्षण शुरू होने से पहले, मॉडल सफल प्रदर्शन का वीडियो देखता है, लेकिन उसे वस्तुओं के निर्देशांक, विशेषज्ञों के पथ या क्रियाओं के सटीक पैरामीटर प्रदान नहीं किए जाते हैं।

परीक्षण के दौरान, मॉडल स्वतंत्र रूप से कैमरे के कोण बदल सकता है, जिससे इंटरैक्शन चरणों की संख्या बढ़ जाती है, और उसे विशिष्ट कमांड जारी करनी होती है: प्रत्येक अक्ष पर मिलीमीटर में विस्थापन, घुमाव के कोण और ग्रिपर को खोलने या बंद करने के निर्देश। एक निश्चित नियंत्रक केवल उन निर्देशों का पालन करता है जो मॉडल प्रदान करता है।

परीक्षण का दायरा और संरचना

बेंचमार्क में 14 प्रकार के मैनिपुलेशन कार्य शामिल हैं, जिसमें एक हाथ के साथ 11 कार्य और दो हाथों के साथ तीन कार्य शामिल हैं। प्रत्येक कार्य में भौतिकी सिमुलेशन में 20 भौतिक रूप से सत्यापित दृश्य शामिल हैं, जो 280 मूल दृश्य बनाते हैं। इसके अलावा, ज्यामिति और लेआउट के विकल्प जोड़े गए थे, साथ ही पांच वस्तुओं वाला एक ट्रैक भी जोड़ा गया, जिसके लिए लंबे समय तक निष्पादन की आवश्यकता थी। मॉडल की प्रत्येक कॉन्फ़िगरेशन को तीन बार चलाया गया था।

प्रमुख मॉडलों ने लक्ष्य स्थानीयकरण में 100% सटीकता और आवश्यक हेरफेर को समझने में 99.6%–100% प्राप्त किया, हालांकि पूरे कार्य की समग्र सफलता लगभग आधी रही। विदेश में प्रस्तुत Opus-5 और GPT-5.6-sol ने Qwen3.8-max का अनुसरण किया, क्रमशः 52.86% और 51.55% परिणाम दिखाए। लेखकों ने उल्लेख किया कि तीनों लीडर 2.38 प्रतिशत अंकों के भीतर हैं, और विश्वसनीय रैंकिंग के बारे में कोई बयान नहीं देते हैं। उप-कार्यों के पूरा होने का प्रतिशत 65.9% से 68.6% रहा, जो दर्शाता है कि कई विफलताएं आंशिक प्रगति के बाद होती हैं। अन्य सभी शर्तों ने 23.10% या उससे कम का परिणाम दिखाया।

मुख्य रूप से पहचानी गई समस्याएं

दो प्रमुख कमियां पाई गईं। Qwen3.8-max 73.6% मामलों में त्रुटियों को पहचानने में सक्षम था, लेकिन उन्हें केवल 46.7% मामलों में ऑनलाइन ठीक किया। एक हाथ के कार्यों में इसकी सफलता दर 65.61% थी, लेकिन दो हाथ के कार्यों में केवल 11.11% थी, जिनके लिए प्रत्येक हाथ के बीच वस्तुओं का वितरण और उनके आपसी स्थान का समन्वय आवश्यक है।

सक्रिय अवलोकन अतिरिक्त कैमरों की उपस्थिति की तुलना में अधिक महत्वपूर्ण कारक साबित हुआ। तुलनात्मक विश्लेषण में, जब Qwen3.8-max ने स्वयं देखने के बिंदु चुने, तो वह 280 दृश्यों में से 57.50% सफलता प्राप्त करने में सक्षम था, जबकि जब उसे पांच निश्चित दृश्य प्रदान किए गए, तो यह 27.86% था। इस बीच, चारों परीक्षण किए गए मॉडल सक्रिय अवलोकन के बिना परीक्षण में भाग लेने से इनकार कर दिए।

एक ही कार्य को बनाए रखते हुए वस्तुओं, कंटेनरों या लेआउट के आकार में परिवर्तन ने एक मानक मॉडल की सफलता को 30 अंक से अधिक कम कर दिया - 80.00% से 47.86% तक। इसी तरह, Qwen3.8-max ने अपने आंकड़े को 77.86% से 67.86% तक कम कर दिया। लंबे समय तक चलने वाले ट्रैक में, Qwen3.8-max ने 100 में से 61 वस्तुओं को रखा, लेकिन किसी भी मॉडल ने एक भी सख्त एपिसोड को पूरा नहीं किया।

यह बेंचमार्क इस सप्ताह प्रकाशित 'एम्बोडीड ब्रेन' SuperCLUE रैंकिंग से अलग है, क्योंकि VA-बेंच यह मापता है कि धारणा, तर्क और योजना के निर्णय एक सफल भौतिक कार्रवाई की ओर ले जाते हैं या नहीं, जबकि SuperCLUE इन पहलुओं का मूल्यांकन करता है।

लोकप्रिय