AgiBot GE-Act 2.0 modelini maʼlumotlarni 100 baravar kengaytirish bilan taqdim etdi
Batafsil
Pandaily
pandaily.com

AgiBot GE-Act 2.0 modelini maʼlumotlarni 100 baravar kengaytirish bilan taqdim etdi

AgiBot kompaniyasi GE-Act 2.0 ni chiqarib berdi — bu jahon miqyosidagi tabiiy model boʻlib, u mavjud video generatoridan moslashtirilmagan, balki faqat jismoniy shakldagi manipulyatsiya maʼlumotlari asosida oʻqitilgan. Kompaniya ushbu nashr jahon miqyosidagi modelning oʻquv soatlari ikki gigantik darajada oshishi bilan — taxminan 300 soatdan 30 000 soatgacha — real robotlar uchun yangi koʻnikmalarni ochishi mumkinligini tizimli ravishda oʻrgangan birinchi tadqiqot ekanligini taʼkidlaydi. Bu jarayon aniq vazifaga moslashish yoki baholash paytida namuna kliplardan foydalanishni talab qilmaydi.

Mavjud tizimlarning har xilidan farqli oʻlaroq, ular harakat boshini muzlagan video modelga qoʻshsa, GE-Act 2.0 robot maʼlumotlari asosida koʻrish tasvirini, kelajakni bashorat qilishni va harakatlarni bashorat qilishni bir vaqtning oʻzida oʻrgatadi. Sinov paytida sahnalar, fonlar, yoritish va obʼekt nusxalari oʻquv jarayonidan chetda qoldiriladi. Ushbu nol-otishma protokoli 100 atomik vazifa va ikkita jismoniy shaklda taxminan 20 koʻnikma oilasini qamrab olgan holda, maʼlumot hajmi ortishi bilan muvaffaqiyat darajasining oshishini koʻrsatdi: G1-OP platformasida umumiy muvaffaqiyat 17,1% dan 44,1% gacha, G2-90D da esa 13,4% dan 31,1% gacha oshdi, bunda 5000 va 30 000 soatlar orasidagi darajalararo oʻsish sezilarli boʻlib qoldi.

Kompaniya nozik koʻnikmalar uchun «yonish» hodisasini taʼkidlaydi. Nol-nol muvaffaqiyat koʻrsatgan vazifalar G1-OP da 39 dan 76 ga, G2-90D da esa 24 dan 72 ga kengaydi. Kiyimni bukash, qogʻoz stakanlarni joylashtirish, ruchka qopqogʻini olib tashlash va almashtirish hamda yangi sahnalarda gullar bukash kabi harakatlar faqat eng katta maʼlumot darajasiga erishilgandan soʻng ishonchli namoyon boʻldi. Shuningdek, kesish-jismoniy oʻtkazish kuzatildi: G1-OP oʻquv maʼlumotlarining yarmidan ortigʻini taʼminlagan boʻlsa, G2-90D 2% dan kamini tashkil qilgan boʻlsa-da, kamroq uchraydigan tananing umumiy maʼlumotlar ortishi bilan taxminan 17,7 foiz pogʻonasi ustunlikka erishdi.

Arxitektura jihatidan, CoAE vizual kodlovchisi 256x384 oʻlchamli har bir kadrni 24 tokenga siqib, semantik, harakatlanuvchi va mahalliy tuzilmaviy ishoralarni saqlab qoladi. Bir bosqichli vizual rejalashtiruvchi kelajakning toʻliq fragmentini bashorat qiladi, va orqa dinamika modeli bashorat qilingan oʻzgarishni harakatlarga aylantiradi; AgiBot shuni taʼkidlaydi, bu RTX 5090 da har bir harakat blokiga taxminan 104 millisekundni oladi. Knowledge-Aligned Selective Optimization usuli bir nechta kelajak ssenariylarini tanlab oladi va yozilgan harakatlarga eng mos keladiganini saqlab qoladi, bu rejalashtirish va harakat oʻrtasidagi farqni kamaytiradi.

Maʼlumot retsepti toʻliq oqimlarni aralashtirishni oʻz ichiga oladi: global modelni oldindan oʻqitish uchun videoboshqaruv koʻrsatmalarining soatlari (harakat belgisiz egotsentrik kadrlar bilan), orqa dinamika uchun yoʻnalishlarning soatlari, ular buzilishlar va qayta ishlanishlarni oʻz ichiga oladi, va birgalikda oʻqitish uchun toʻliq juft videoboshqaruv koʻrsatmalar va harakatlar soatlari. AgiBotning GE stekida GE-Sim siyosatni baholash va muhitni qurishga qaratilgan boʻlsa, GE-Act bashorat qilingan kelajak holatlarini robot harakatiga aylantiradi. Keraksiz sozlashdan soʻng, AgiBot RoboTwin tashqarisidagi sinovlarda 60,52% va GenieSim koʻrsatmalarini bajarishda 0,770 natijasini bildirib, solishtiriladigan bir nechta bazaviy modellar ustunlikka erishdi. Loyiha materiallari ge-act-v2.github.io manzilida mavjud.

Mashhur