Faqat to'rtta oy oldin tashkil etilgan startap Muka Robotics kompaniyasi o'zining LJM Latent Joint-conditional Model modeli bilan jahon reytingi WorldArena da ikkinchi o'ringa chiqdi. Ushbu model faqat 32 ta Zhenwu 810E grafik protsessoridan foydalanib, 89.17 darajasida harakat sifati ko'rsatdi.
Arxitektura va sinov natijalari
LJM modeli LIBERO benchmarkida turli metrikalarda yuqori baholarni olib, 3D aniqlik bo'yicha 92.60 va Boshqariluvchanlik bo'yicha 85.93 ball yig'di. Bu natijalar unga 10-100 barobar ko'proq hisoblash quvvatidan foydalangan raqobatchilarni ortda qoldirish imkonini berdi. Model anonim ravishda SisyphusWorld nomi ostida taqdim etildi.
Jismoniy tushunishdagi yutuq
LJM fundamental muammoni hal qiladi: piksel darajasidagi optimallashtirish fizika tushunishiga salbiy ta'sir ko'rsatadi. Standart diffuziya modellarining aksariyati piksel teksturasiga (99%) ustuvorlik beradi va ushlagich va obyekt o'rtasidagi tanalpoyak kabi muhim jihatlarni e'tiborsiz qoldiradi (1%). LJM fikrlash jarayoni va renderlash jarayonini ajratadigan ikki ekspertli arxitekturani kiritadi.
Ikki ekspertning ishlash prinsipi
Qwen3-VL-2B asosidagi fikrlash eksperti uzluksiz latent fazada ishlaydi. U til ko'rsatmalari, vizual tarix va rejalashtirilgan harakat ketma-ketliklar asosida o'zaro ta'sirlashni simulyatsiya qiladi. Shu bilan birga, Wan2.2-TI2V-5B dan foydalanuvchi dunyo modellashtirish eksperti bu ma'noli o'zaro ta'sirlashni real videokadrallarga aylantiradi. Asosiy farq shundaki, fikrlash eksperti avvalo ushlagichni yopish va ob'ektni harakatlantirish natijasida nima sodir bo'lishini tushunishi kerak, keyin esa renderlash eksperti bu tushunilgan o'zaro ta'sirlashni vizuallashtiradi, shu tariqa 'avval generatsiya, keyin tushunish' standart yondashuvini inkor etadi.
Jismoniy cheklovlar va o'zaro ta'sir
LJM arxitekturasi har bir latent token uchun uchta jismoniy cheklov qo'yadi. Har bir fikrlash tokeni bir vaqtning o'zida uchta kelajak parametrni bashorat qilish majburiyatiga ega: uch o'lchovli fazodagi yakuniy effektorni joylashuvi (robot holati), sahna obyektlarining vizual holatidagi o'zgarishlar (vizual dinamika) va piksel darajasidagi harakat yo'nalishi (oldindan hisoblangan optik oqim). Bu cheklovlar bevosita haqiqiy o'quv ma'lumotlaridan olinadi va modellar tomonidan jismonan imkonsiz natijalarning yaratilishining oldini oladi, shu bilan birga yuqori vizual sifatni saqlab qoladi.
Ikki ekspert Mixture-of-Transformers asosidagi diqqat mexanizmi orqali ma'lumot almashadi, bunda fikrlash va video tokenlari Transformerning har bir qatlamida o'zaro ta'sir qiladi. Bu butun generatsiya jarayoni davomida ikki tomonlama ma'lumot oqimini ta'minlaydi, bu esa fikrlash natijani renderlashga faqat bir marta uzatadigan ketma-ket konveyer oqimini almashtiradi. Shunday qilib, vizual generatsiya doimiy ravishda jismoniy fikrlash bilan cheklanadi.
Hisoblash quvvati haqidagi xulosa
LJM dunyo modellashtirish qobiliyati ulkan hisoblash quvvatiga emas, balki to'g'ri arxitekturaga bog'liq ekanligini namoyish etadi. Arxitekturadaki innovatsiyalar Xitoy hisoblash resurslarining cheklovlarini qoplaydi. Oldingi usullar video modellarga fizikaniy bilimlarni o'rgatishga urinardi, bu strukturaning jihatidan imkonsiz edi. Fizikaga aniq maqsadlar bilan o'z ekspertini taqdim etish orqali LJM kompromislar qilish zarurati sezilmaydigan yuqori jismoniy aniqlik va vizual sifatga erishadi.

