Robotera kompaniyasi Tsinghua universiteti tomonidan qoʻllab-quvvatlanishi bilan oʻzining jahon miqyosidagi VPP2 modelini RoboDojo da birinchi oʻringa qoʻyganini eʼlon qildi. Bu simulyatsion benchmark Hong Kong universiteti MMLab tomonidan nazorat qilinadi va taxminan 20 ta akademik muassasani oʻz ichiga oladi.
QbitAI maʼlumotlariga koʻra, VPP2 42 ta vazifa boʻyicha ikkita RoboDojo manipulyatori bilan ishtirok etib, oʻrtacha 32,26% muvaffaqiyat darajasi va 39,26 oʻrtacha ballni namoyish etdi. Ushbu vazifalar umumlashtirish, aniq manipulyatsiya, uzoq muddatli vazifalar, xotira va ochiq lugʻatli koʻrsatmalar kabi jihatlarni tekshiradi. Model shuningdek umumlashtirish, aniqlik va xotira kategoriyalarida birinchi oʻrinni egalladi.
Robotera ushbu koʻrsatkichlarga erishish standart maʼlumotlar toʻplamini ishlatgan holda, qoʻshimcha oʻquv maʼlumotlari yoki agentlarga asoslangan rekursiv oʻz-oʻzini takomillashtirish kabi qoʻshimcha qurilmalar yordamida amalga oshirilganini taʼkidlaydi. Ularning tadqiqotida tilga olingan eng kuchli nazorat modeli — qoʻshimcha oʻqitilgan GPT-6-Astra — 22,48% va 28,97 natijalarni koʻrsatdi. Reyting ilmiy maqolada keltirilgan raqamlarga mos keladi. Avvalroq Simate kompaniyasi RoboDojo da Simate-beta tizimi bilan oʻz muvaffaqiyatini eʼlon qilgan edi.
VPP2 modeli jahon miqyosidagi modellarning maʼlum bir zaifligini bartaraf etishga qaratilgan: agar video prognozi notoʻgʻri boʻlsa, harakat shu prognozga amal qiladi. Roboteraning oʻquv jarayoni uch bosqichga boʻlingan. Birinchi bosqich — Alibaba ning ochiq manba boʻlgan Wan2.1-I2V-14B dan foydalangan holda voqealar darajasida videoni oldindan oʻqitish. U robotlar, odamlar va umumiy videomateriallardan batafsil annotatsiyalangan kliplardan foydalanib, modelga butun manipulyatsiya jarayonini boshidan oxirigacha bashorat qilishni oʻrgatadi.
Keyin, prognoz fiksatsiya qilingan sakkiz soniyalik segmentlarga qisqartiriladi va bitta qadamga destillatsiya qilinadi, bu qadam taxminan 0,12 soniya davom etadi. Uchinchi bosqichda 0,9 milliard parametrli Action DiTdan foydalaniladi, u prognozlarni harakatga aylantirishni oʻrganadi, shu bilan birga videomodel muzlatilib, faqat LoRA orqali moslashadi. Harakat bloki uchun umumiy kechikish taxminan 0,22 soniya ni tashkil etadi.
Haqiqiy ikki manipulyatorli ALOHA robotida sinovdan oʻtkazilganda, VPP2 oldindan oʻqitilmagan holda 10 ta turdagi vazifada oʻrtacha 58,5% koʻrsatdi, jumladan tanlash, joylashtirish, steklash, qatlash va quyish. Bu Physical Intelligence ning pi0.5 modelining 40% dan yuqori va model ushbu vazifalarning toʻqqiztasida eng yaxshi natija koʻrsatdi. U LIBERO-Pro da 45,0% va LIBERO-OOD da 63,9% ball oldi. Koʻrish va til modelini yuqori darajadagi rejalashtiruvchi sifatida qoʻshish RoboDojo ning tanlangan uzoq muddatli vazifalar natijalarini 27,6% dan 57,6% gacha oshirdi.
Robotera allaqachon China Post va SF Express kabi kompaniyalar bilan hamkorlikda beshta viloyat va shaharlardagi 10 dan ortiq logistika markazlarida robotlardan foydalanmoqda, ammo bu VPP2 ning toʻliq joriy etilishini anglatmaydi. Model kodi GitHubda ochiq kirishda mavjud.
