Dalian University of Technology tomonidan yaratilgan VA-Bench sinov maydoni eng yaxshi multimodal modellar robototexnika vazifalarining atigi yarmini bajarishini koʻrsatdi
Batafsil
Pandaily
pandaily.com

Dalian University of Technology tomonidan yaratilgan VA-Bench sinov maydoni eng yaxshi multimodal modellar robototexnika vazifalarining atigi yarmini bajarishini koʻrsatdi

Dalian University of Technology tadqiqotchilar guruhining VA-Bench — universal multimodal katta til modellarining vizual maʼlumotlarni robot qoʻlning muvaffaqiyatli harakatlariga aylantirish qobiliyatini tekshirish uchun moʻljallangan yangi benchmarkini taqdim etdi.

Sinovdan oʻtkazilgan oʻn ikki konfiguratsiya orasida eng yaxshi model boʻlgan Alibaba ning Qwen3.8-max oʻrtacha 53,93% vazifalarni bajara olgan. Bu, tasvirni «tushunadigan» modellar hali ham tegishli harakatlarni ishonchli bajarishda qiyinchiliklarga duch kelayotganini koʻrsatadi.

Benchmark tavsifi arXiv (2609.19554) va Sina Tech xitoy nashrida maqolada eʼlon qilingan. VA-Bench jarayonning toʻliq siklini baholaydi: kuzatish, fikrlash, harakat va tuzatish. Har bir sinovdan oldin model muvaffaqiyatli namoyish videosini koʻrib chiqadi, ammo unga obʼektlarning koordinatalari, ekspertlarning yoʻnalishlari yoki harakatlarning aniq parametrlari berilmaydi.

Sinov davomida model kameraning burchaklarini mustaqil ravishda oʻzgartirishi mumkin, bu esa oʻzaro aloqa bosqichlari sonini oshiradi va u aniq buyruqlarni berishi kerak: har bir oʻq boʻyicha millimetrlik siljishlar, burilish burchaklari va ushlagichni ochish yoki yopish boʻyicha koʻrsatmalar. Fiksatsiyalangan kontroller faqat model tomonidan taqdim etilgan koʻrsatmalarni bajaradi.

Sinov hajmi va tuzilmasi

Benchmark 14 ta manipulyatsion vazifa turini qamrab oladi, shu jumladan bitta qoʻl bilan bajariladigan 11 ta va ikkita qoʻl bilan bajariladigan uchta vazifa. Har bir vazifa fizika simulyatsiyasida 20 ta amaliy tekshirilgan sahna ni oʻz ichiga oladi, bu 280 ta asosiy sahna tashkil qiladi. Bundan tashqari, geometriya va rejalashtirish variantlari, shuningdek, uzoq muddatli bajarilishi talab qilinadigan beshta obʼektli trek qoʻshildi. Har bir model konfiguratsiyasi uch marta ishga tushirildi.

Yetakchi modellar maqsadlarni joylashtirishda 100% aniqlikka va talab qilinadigan manipulyatsiyani tushunishda 99,6%–100% ga erishdi, ammo butun topshiriqning umumiy muvaffaqiyati atigi yarim atrofida qoldi. Chet elda taqdim etilgan Opus-5 va GPT-5.6-sol modellarining natijalari mos ravishda 52,86% va 51,55% ni koʻrsatib, Qwen3.8-max orqasidan keldi. Mualliflar uchta yetakchi 2,38 foiz balligacha farqda ekanligini taʼkidlaydilar va ishonchli reyting haqida bayonot bermaydilar. Sub-vazifalarni yakunlash foizi 65,9% dan 68,6% gacha boʻldi, bu koʻplab nosozliklar qisman progressdan keyin sodir boʻlishini koʻrsatadi. Barcha boshqa shartlar 23,10% yoki undan past natija koʻrsatdi.

Asosiy aniqlangan muammolar

Ikki asosiy kamchilik aniqlandi. Qwen3.8-max 73,6% hollarda xatoliklarni sezishga qodir edi, ammo ularni onlayn faqat 46,7% hollarda tuzatdi. Uning muvaffaqiyati bitta qoʻl bilan bajariladigan vazifalarda 65,61% ni tashkil etdi, ammo har bir qoʻlga obʼektlarni taqsimlash va ularning oʻzaro joylashuvini muvofiqlashtirishni talab qiladigan ikkita qoʻl bilan bajariladigan vazifalarda atigi 11,11% ni tashkil etdi.

Faol kuzatuv qoʻshimcha kameralar mavjudligidan koʻra muhimroq ekanligi maʼlum boʻldi. Taqqoslash tahlilida Qwen3.8-max oʻzi tomosha nuqtalarini tanlaganda 280 ta sahna ichidan 57,50% da muvaffaqiyatga erishdi, bu esa beshta fiksatsiyalangan koʻrinish berilganda 27,86% ga nisbatan yuqori. Shu bilan birga, sinovdan oʻtgan toʻrtta model faol kuzatuvsiz testda ishtirok etishdan bosh tortdi.

Obʼektlar, konteynerlar yoki rejalashtirish shaklining oʻzgarishi, vazifa bir xil boʻlsa ham, referens modellardan birining muvaffaqiyatini 30 ballgacha pasaytirdi — 80,00% dan 47,86% gacha. Shu bilan birga, Qwen3.8-max oʻz koʻrsatkichini 77,86% dan 67,86% gacha pasaytirdi. Uzoq muddatli bajariladigan trekda Qwen3.8-max 100 ta obʼektning 61 tasirasini joylashtirdi, ammo hech bir model biron bir qatʼiy epizodni yakunlamadi.

Bu benchmark shu hafta eʼlon qilingan SuperCLUE «embodied brain» reytingidan farq qiladiki, VA-Bench idrok, fikrlash va rejalashtirish haqidagi hukmlar muvaffaqiyatli jismoniy harakatga olib kelishini oʻlchaydi, SuperCLUE esa aynan shu jihatlarni baholaydi.

Mashhur