AgiBot WITA-Omni Full-Modal modeli DailyOmni benchmarki doirasida 85.21 ball yuqori natija ko‘rsatdi. Shu bilan birga, model sakkizta ko‘rsatkichdan oltitasida ustunlikni namoyish etib, Alibaba Qwen, Google Gemini, ByteDance Doubao va NVIDIA kabi tizimlarni ortda qoldirdi.
Modelni sinovdan o‘tkazish va imkoniyatlari
Benchmark modelning real sharoitlarda audio va vizual signallarni bir vaqtning o‘zida qayta ishlash qobiliyatini baholaydi. Sinovdan o‘tkazilgan parametrlar orasida audio-vizual ma'lumotlarning uyg'unligi (86.13), voqealar haqida vaqtinchalik fikrlash (84.64), murakkab kross-modal fikrlash (85.06) hamda 30 va 60 soniyalik videolarni tushunish vazifalaridagi yuqori natijalar mavjud edi.
WITA-Omni arxitektura yangiligi
Universal multimodal modellar aksincha, raqamli kontent bilan o‘zaro aloqaga moslashtirilgan bo‘lsa, WITA-Omni dastlab jismoniy o‘zaro ta’sir uchun ishlab chiqilgan. Bu shuni anglatadiki, ushbu modeldan foydalanadigan robotlar real vaqt rejimida jismoniy muhitda tushunishi, reaksiyalari va harakat qilishi kerak.
Innovatsiya Thinker-Talker-Actor paradigmasida yotadi, u an'anaviy ketma-ket quvurni almashtiradi. Robotlar o‘zaro aloqaning standart jarayonlari nutqni tanish, semantik tushunish, javob yaratish, nutqni sintezlash va harakatni chiqarishni alohida, ketma-ket bosqichlar sifatida bajaradi, bu esa kechikishlarning to‘planishiga olib keladi. WITA-Omni esa ko‘pmodal fikrlash yadrosi Thinker, nutqni uzluksiz yaratish Talker va Actor harakat va ifodasi modullarini bitta vaqt chizig‘ida parallel ravishda ishga tushiradi.
Sinxronizatsiya mexanizmlari
Actor moduli faqat Thinkerning semantik holatini emas, balki Talkerdan keladigan audio latent o‘zgaruvchilarni ham qabul qiladi. Bu qo‘l harakatlari va mimikaning nutq ritmi, pauzalar, aksentlar va hissiy ohang bilan sinxronlashishiga imkon beradi, robot nima aytayotgani va qanday harakat qilayotgani o‘rtasidagi nomuvofiqlikni yo‘q qiladi. Arxitektura oldin suhbatdosh sun'iy intellekt uchun yaratilgan Thinker-Talker paradigmasini kengaytirib, Actor modulini nutq bilan birga to‘liq chiqish kanali sifatida qo‘shadi.
Thinker maxsus kodlovchilar va yengil proyeksion qatlamlar orqali matn, tasvir, audio va video kirishlarini birlashgan ifodalash fazosiga birlashtiradi, bu esa o‘zaro aloqa va kross-modal fikrlash to‘g‘risida qaror qabul qilish uchun xizmat qiladi. Talker Thinkerning yashirin holatlariga bog‘liq tabiiy nutqni yaratadi. Actor Thinkerning semantik holati va Talkerning audio xususiyatlaridan foydalanib, harakatlar boshlig‘i va ifoda boshlig‘ini boshqaradi. Oqimlar o‘rtasidagi sinxronizatsiya mexanizmi robot harakatlari nutq tezligidagi o‘zgarishlarga, ifoda o‘zgarishlariga javob berishini va jismoniy harakatlar verbal muloqot bilan vaqtinchalik uyg‘unligini saqlab turishini ta’minlaydi.
Sanoatdagi joylashuvi
Bu natija AgiBot world model Genie Envisioner-Sim 2.0 ning WorldArena da avval birinchi o‘rinni egallagan yutuqidan keyin keldi. Ushbu ikkita yutuq sun'iy intellekt imkoniyatlarining uchburchak tuzilishini hosil qiladi: WITA-Omni o‘zaro aloqa uchun, world model jismoniy dunyoni tushunish uchun va robot apparati unda harakat qilish uchun. Reytingdagi g‘alaba, jismoniy sun'iy intellekt bilan shug‘ullanuvchi kompaniyalar universal modellarni moslashtirish o‘rniga, real dunyo cheklovlariga optimallashtirilgan holda ustun umumiy imkoniyatlarga erishishi mumkinligini tasdiqlaydi.
Robotlar nazorat qilinadigan zavod muhitlaridan noaniq ijtimoiy maydonlarga o‘tish paytida, ko‘p sensorli oqimlarni sinxron qayta ishlash va muvofiqli verbal va jismoniy harakatlar bilan reaksiyalar berish qobiliyati asosiy farq bo‘lib qoladi. AgiBot sinxron ko‘pmodal o‘zaro aloqani jismoniy AI sanoatidagi yangi raqobatbardosh o‘lchov sifatida belgilaydi, bu umumiy AI sohasidagi model sifati bo‘yicha raqobatdan ajralib turadi.