TaichuAI fazoviy boʻlishi kerak boʻlgan makon tushunishi uchun ZDTaichu5.0-9B ochiq multimodal modelni chiqardi
Batafsil
Pandaily
pandaily.com

TaichuAI fazoviy boʻlishi kerak boʻlgan makon tushunishi uchun ZDTaichu5.0-9B ochiq multimodal modelni chiqardi

TaichuAI kompaniyasi ZDTaichu5.0-9B modelini jamoatchilikka ochiq qildi. Ushbu multimodal fundamental model taxminan 9 milliard parametrga ega va umumiy vizual tushunish, makoniy fikrlash, agent vositalaridan foydalanish va jasadlangan AI sohasidagi tadqiqotlar uchun moʻljallangan.

Model arxitekturasi Qwen3.5-9B tilli backbonini C-RADIOv4-H koʻrish kodlovchisi bilan birlashtiradi. Model matn, shuningdek, istalgan aniqlikdagi bitta yoki bir nechta tasvir va videoni qabul qiladi va 128 ming tokengacha kontekst uzunligini qoʻllab-quvvatlaydi. TMTPost tomonidan sentyabrning 15-ida umumlashtirilgan nashr real dunyodagi makonni idrok etish, turli koʻrinishlar oʻrtasida transformatsiyalar va jasadlangan tizimlar uchun vazifalarni rejalashtirishga qaratilgan edi.

Modelning jamoatchilikdagi kartasiga koʻra, TaichuAI keng koʻlamli vizual vazifalar boʻyicha taxminan 10 milliardli umumiy VLMlar orasida yuqori darajadagi natijalarni namoyish etadi, shuningdek, makoniy, jasadlangan va agent ssenariylarda imkoniyatlarini kengaytiradi. Makon va jasadlanish sohasidagi ajratib koʻrsatilgan koʻrsatkichlarga ViewSpatial 62.50, MMSI-Bench 47.20, MindCube-tiny 78.27, ERQA 48.00 va RoboSpatial 56.00 kiradi.

Agentlar va koʻrsatmalar toʻplamlari borasida, baholash kartasidagi izohlarida koʻrsatilganidek, TAU2-Bench 87.70 natijaga erishadi, Claw-Eval ning oʻrtacha koʻrsatkichi esa 71.40 ni tashkil etadi, shu bilan birga IFEval 93.70 ni koʻrsatadi. Entropiya-prioritetli adaptiv rekursiv fikrlash mexanizmi murakkabroq tokenlar uchun latent oʻzgaruvchilarni aniqlash qoʻshimcha bosqichlarni taʼkidlovchi mexanizm sifatida tavsiflanadi.

Model imkoniyatlari optik belgilarni tanish (OCR) va hujjatlarni tushunish, tasvirlardagi matematika, nozik ikki oʻlchovli bogʻliqliklar, bir nechta koʻrinishlarni assotsiatsiya qilish, uch oʻlchovli sahnalar va perspektivani idrok etish, shuningdek, uzoq kontekst oynasi doirasida koʻplab tasvir va videolarni kuzatish, jumladan, koʻp bosqichli vositalardan foydalanishni rejalashtirishni qamrab oladi. Shu bilan birga, vositalarni amalda bajarish host-ilova majburiyatida qoladi.

Kartada roʻyxat qilingan makoniy oʻrganish mavzulari nisbiy munosabatlar, zich hisoblash va ramkalar, kamera harakati va chuqurlikni tartiblash, egotsentrik va allotsentrik koʻrinishlar, shuningdek, VLA uslubida moslashish uchun yuqori darajali imkoniyatlarni aniqlash va harakatlarni rejalashtirishni oʻz ichiga oladi.

Model vaznlari Hugging Faceʼda TaichuAI/ZDTaichu5.0-9B manzilida NVIDIA Open Model License litsenziyasi ostida joylashtirilgan, shu bilan birga Qwen3.5 dan Apache-2.0 bildirishnomalarini saqlab qoladi. Xizmat koʻrsatish uchun maxsus vLLM 0.26.0 shakli va TaichuAI ning Docker tasviri OpenAI bilan mos keladigan oxirgi nuqtalarni taʼminlash uchun ishlatiladi, makoniy bogʻlanish va umumiy vazifalar uchun tavsiya etilgan namunaviy sozlamalar bilan.

Boshqa yetkazib beruvchilar tomonidan taqdim etilgan modellar kabi, tashqi laboratoriyalar benchmark natijalarini mustaqil qayta tiklash natijalari paydo boʻlguncha koʻrsatilgan promptlar va hakamlar bilan eʼlon qilingan deb hisoblab koʻrishi kerak. Biroq, oʻrta hajmdagi ochiq multimodal nazorat nuqtasi, makon va agentlarga urgʻu berilishi hamda tayyorlangan vLLM paketlashining birlashmasi tadqiqotchilarga baholash uchun aniq artefaktni taqdim etadi.

Mashhur