Tsinghua AIR ning Zeva usuli qoʻshimcha oʻqitishsiz ijro etilgan manipulyatsiya muvaffaqiyatini 26% dan 73% gacha oshirdi
Batafsil
Pandaily
pandaily.com

Tsinghua AIR ning Zeva usuli qoʻshimcha oʻqitishsiz ijro etilgan manipulyatsiya muvaffaqiyatini 26% dan 73% gacha oshirdi

Tsinhua universitetining Sunʼiy intellekt sanoati tadqiqotlari instituti (AIR) Domain Transform bilan hamkorlikda Zeva nomli ijro etilgan manipulyatsiya usulini taqdim etdi. Ushbu usul asosiy modelning vaznlarini muzlatib turadi va faqat kontekstdagi sabab-oqibat xotirasi yordamida joylashtirish paytida yaxshilanadi.

Ijro etilgan manipulyatsiya uchun sinovdan oʻtgan bir qator benchmarklarda umumiy muvaffaqiyat foizi taxminan 26% dan 73% gacha oshdi, bu standart maʼlumotlarni yigʻish, belgilash va mayda sozlash siklini oʻtkazish shart emas, 47 ballik ortiqchilikni tashkil etadi. «Zeva: Umumlashtiriladigan Ijro Etilgan Manipulyatsiya uchun Kontekstdagi Sabab-Oqibat Oʻrganishi» nomli maqolada Cosmos3 modeli asos sifatida ishlatiladi, va mualliflar orasida Tsinghua AIR dan Liu Yunxin va Zhao Ting nomlari tilga olinadi.

Yondashuvning mohiyati koʻrish, til va harakat modellarini yanada keng miqyosda sozlashda emas, balki fiksatsiyalangan modelga uning oʻz harakatlari sahna qanday oʻzgarishini oʻrgatadigan xotira qatlamini qoʻshishda namoyon boʻladi. Zeva uchta asosiy komponentdan iborat.

Sabab-oqibat transformatsion kodlovchi har bir harakatni keyingi holat oʻzgarishi bilan bogʻlaydi, bu esa keyingi soʻrovlar uchun boshlangʻich materialni hosil qiladi. Soʻngra sabab-oqibat xotira ikki vaqt oraligʻida ishlaydi: joriy urinish uchun qisqa oʻzaro taʼsir yoʻnalishi va urinishlar orasidagi filtrlangan tajribani toʻplaydigan uzoqroq doimiy oʻzaro taʼsir xotirasi. Ushbu omborlarni maqsadli ajratish muvaffaqiyatsizlik shovqinlari tufayli uzoq muddatli xotiraning darhol ifloslanishining oldini oladi, shu bilan birga shu epizod ichida keyingi buyruqni yetkazib beradi.

Nihoyat, kontekstdagi siyosatni joriy etish muzlatilgan modelning kirish qismiga sabab-oqibat ishoralar kiritadi, bu jarayon davomida gradienlarni yangilash amalga oshirilmaydi. Bu shuni anglatadiki, muhitga moslashish oʻquv operatsion sozlash muammosidan kontekst muhandisligi muammosiga aylanadi.

RoboCasa365-Atomic5 platformasida oʻrtacha muvaffaqiyat koʻrsatkichi 76,8% ga yetdi. Kimyoviy laboratoriya vazifalari toʻplami ChemLab-Evo da yanada koʻproq natijalar erishildi: probovkalar tanlash 65% dan 100% gacha, stakan joylashtirish 25% dan 70% gacha va suv quyish 30% dan 80% gacha oshdi. Oshish asosiy koʻrsatkichlar zaifroq boʻlgan joylarda yanada sezilarliroq boʻldi, bu tez-tez sodir boʻladigan nosozliklar yanada foydali sabab-oqibat juftlarini yaratishi gʻoyasiga mos keladi.

Bitta inson demonstratsion harakati stakan joylashtirishga taxminan 20 ball, quyishga esa taxminan 15 ball qoʻshdi — mualliflar bu ortiqchini parametr oʻzgarishi bilan emas, balki xotira joriy etilishi bilan bogʻlaydilar. Bu belgilash byudjetlari cheklangan vaqtda jozibador jihatdir.

Kimyoviy mavzu tanlanganligi sababli, suyuqlik darajasi va idoning holati kabi holat oʻzgarishlari nisbatan toza boʻlib, kodlovchi juftlari past shovqin darajasida qoladi; ammo maqolada yuvish kabi deformatsiyalangan obʼektlarga ega vazifalar murakkabroq boʻlishi mumkinligi qayd etiladi. Amalda, Zeva joyga xos haftalik mayda sozlashni uzoqroq kontekstlar va har bir qadam uchun yuqori chiqarish xarajatlari bilan almashtiradi, bu esa foydalanish orqali yaxshilanadi. Kamdan-kam oʻzgaradigan joylar iqtisodiy sabablarga koʻra klassik mayda sozlashni afzal koʻrishi mumkin. Cosmos3 sozlamasidan tashqaridagi mustaqil robototexnika platformalari ochilgan paketga kirmaganligi sababli, oʻtkazish bayonotlari boshqa laboratoriyalar turli uskuna va vazifa taksonomiyalari ustida xotira stekini qayta tiklamaguncha nazariy boʻlib qoladi.

Oʻxshash hikoyalar

Shengshu Technology Motus2ni taqdim etdi — yuqori aniqlikdagi manipulyatsiyalar uchun oʻz-oʻzini rivojlantiruvchi global model
Batafsil
pandaily.com

Shengshu Technology Motus2ni taqdim etdi — yuqori aniqlikdagi manipulyatsiyalar uchun oʻz-oʻzini rivojlantiruvchi global model

Shengshu Technology kompaniyasi robotlar bilan murakkab manipulyatsiyalarni bajarish uchun maxsus ishlab chiqilgan oʻz-oʻzini rivojlantiruvchi umumiy global model boʻlgan Motus2ni chiqarib berdi. Ham-tashkilotchi va Bosh ijrochi Luo Yihan (Luo Yihang) ushbu tizimni 2026 yildagi Bund sammitida namoyish etdi.

Motus2 loyihasining mualliflar roʻyxatida Shengshuning tadqiqot identifikatori — GensPI, shuningdek Tsinghua universiteti koʻrsatilgan, shu bilan birga texnik maqola arXivda 2608.30237 raqami ostida nashr etilgan. Koʻplab tizimlarning harakatlar modulini alohida dunyo simulyatori bilan bogʻlashidan farqli oʻlaroq, Motus2 siyosat, simulyatsiya va baholashni umumiy parametrli bitta video-harakat tarmogʻida birlashtiradi.

Bu tarmoq uchta boshqaruv interfeysini taqdim etadi. Dunyo-harakat modeli bajariladigan harakat bloklarini taklif qiladi. Harakatga asoslangan dunyo modeli bu bloklarning vizual natijalarini bashorat qiladi. Va qiymat modeli bashorat qilingan natijalarni tanlash va oʻrganish uchun baholaydi. Best-of-N rejalashtirish paytida, u bir nechta variantlarni tahlil qiladi, ularning kelajagini tasavvur qiladi va robot yana haqiqiy sahna kuzatishidan oldin eng yuqori qiymatga ega boʻlgan shoxobchini bajaradi.

Modelga asoslangan kuchaytirilgan oʻrganishdan soʻng, qiymat signali shu kabi siyosat yangilanishlariga aylantiriladi, bunda prognozlash va baholash vaznlari oʻrganilgan dinamikani oʻchirmaslik uchun muzlatiladi. Bundan tashqari, harakatga yoʻnaltirilgan maʼlumot maskasi siyosatga qaror qabul qilishdan oldin kelajakdagi video tokenlarga qarashga yoʻl qoʻymaydi — bu jamoa videoni va boshqaruvni birlashtiruvchi avvalgi soddalashtirilgan usullar bilan bogʻliq boʻlgan ishlamay qolishni oldini oladi.

Telefon joylashtirish va real robotlarda koʻp barmoqli operatsiyalar vazifalarini bajarishda asosiy siyosat taxminan 65% muvaffaqiyatga erishdi. Mustaqil rejalashtirish taxminan 67,5%; modelga asoslangan kuchaytirilgan oʻrganish — taxminan 72,5%; ikkala usulning kombinatsiyasi esa taxminan 75% darajasida muvaffaqiyatni taʼminladi. Asosiy xususiyatlarni qisqa bloklarni aniqlash uchun qayta ishlatadigan yengil taktiliy ekspert stakancha olish va qogʻozni yirtish muvaffaqiyatini taxminan 60% dan 72,5% gacha oshirdi.

Oʻquv maʼlumotlari insonga yoʻnaltirilgan piramida boʻlib, unda taxminan 130 000 soat egotsentrik yozuvlar monokulyar va sinxronlashtirilgan stereovideo, shuningdek 100 soatdan ortiq robot traektoriyalari va inson hamda robotning birgalikdagi holatlari mavjud. Stereobildirovkani 2 000 dan 20 000 soatgacha kengaytirish kechikgan testlarda harakatni bashorat qilish xatosini kamaytirishda davom etdi.

Uskunalar namoyishotlariga Sharpa Wave va Wuji Hand 2 kabi yuqori darajadagi erkinlik platformalari kiradi, ular chiroqlarni majlash, sahifalarni aylantirish va koʻrish ham, sezish ham tekshirilishi kerak boʻlgan koʻp barmoqli aloqa talab qiladigan boshqa ishlarda qoʻllaniladi.

Jamoa Motus2ni cheklangan vazifalar ichidagi dastlabki sikl rekurssiv oʻz-oʻzini takomillashtirish sifatida joylashtiradi — siyosatni tuzatish uchun simulyatsiya qilingan natijalardan foydalanadi, cheksiz muhitlardagi ochiq avtonom oʻrganish sifatida emas. Texnologiyalarni jasadlash bilan shugʻullanuvchi potentsial xaridorlar uchun asosiy signal WAM, AC-WM va qiymat modelining yopiq sikli, shuningdek, telefon va kontaktlar bilan boy koʻp barmoqli vazifalarda olingan oʻlchanadigan oʻsishdir. Shengshu bu siklni oʻzining umumiy global modelining L3 dan L4 darajasiga borishdagi taraqqiyot sifatida koʻradi, ammo hozirda ochiq dunyoda toʻliq avtonomlik haqida daʼvo qilmaydi.

Mashhur