TaichuAI ने स्थानिक समझ के लिए ZDTaichu5.0-9B नामक एक ओपन मल्टीमॉडल मॉडल जारी किया
और पढ़ें
Pandaily
pandaily.com

TaichuAI ने स्थानिक समझ के लिए ZDTaichu5.0-9B नामक एक ओपन मल्टीमॉडल मॉडल जारी किया

TaichuAI कंपनी ने ZDTaichu5.0-9B मॉडल को सार्वजनिक रूप से उपलब्ध कराया है। यह मल्टीमॉडल फाउंडेशन मॉडल लगभग 9 अरब मापदंडों का है और सामान्य दृश्य समझ, स्थानिक तर्क, एजेंट टूल के उपयोग और एम्बोडीड एआई में अनुसंधान के लिए डिज़ाइन किया गया है।

मॉडल की वास्तुकला Qwen3.5-9B भाषा बैकबोन को C-RADIOv4-H दृष्टि एन्कोडर के साथ जोड़ती है। मॉडल पाठ के साथ-साथ किसी भी रिज़ॉल्यूशन की एक या अधिक छवियों और वीडियो को इनपुट के रूप में स्वीकार करता है, जो 128 हजार टोकन तक के संदर्भ की लंबाई का समर्थन करता है। TMTPost द्वारा 15 सितंबर को प्रकाशित इस प्रकाशन में वास्तविक दुनिया में स्थान की धारणा, विभिन्न दृश्यों के बीच रूपांतरण और एम्बोडीड सिस्टम के लिए कार्य योजना पर ध्यान केंद्रित किया गया था।

मॉडल के सार्वजनिक कार्ड के अनुसार, TaichuAI व्यापक दृश्य कार्यों की एक विस्तृत श्रृंखला में लगभग 10-बिलियन सामान्य VLM के बीच उत्कृष्ट परिणाम प्रदर्शित करता है, साथ ही स्थानिक, एम्बोडीड और एजेंट परिदृश्यों में अपनी क्षमताओं का विस्तार करता है। स्थान और एम्बोडमेंट के क्षेत्र में उल्लेखनीय मेट्रिक्स में ViewSpatial 62.50, MMSI-Bench 47.20, MindCube-tiny 78.27, ERQA 48.00 और RoboSpatial 56.00 शामिल हैं।

एजेंट और निर्देश सेटों के संबंध में, मूल्यांकन कार्ड पर नोट्स में बताए गए TAU2-Bench 87.70 का स्कोर प्राप्त करता है, जबकि Claw-Eval का औसत स्कोर 71.40 है, और IFEval 93.70 दिखाता है। एंट्रॉपी-प्राथमिकता वाले अनुकूली पुनरावर्ती तर्क तंत्र का वर्णन एक ऐसे तंत्र के रूप में किया जाता है जो अधिक जटिल टोकन के लिए लेटेंट वेरिएबल्स के अतिरिक्त परिशोधन चरणों को उजागर करता है।

मॉडल की क्षमताएं ऑप्टिकल कैरेक्टर रिकग्निशन (OCR) और दस्तावेज़ समझ, छवियों पर गणित, सूक्ष्म द्वि-आयामी संबंधों, कई दृश्यों के जुड़ाव, त्रि-आयामी दृश्यों और परिप्रेक्ष्य की धारणा, और लंबी संदर्भ विंडो के भीतर कई छवियों और वीडियो को ट्रैक करने, जिसमें बहु-चरणीय टूल उपयोग की योजना बनाना शामिल है, तक फैली हुई हैं। हालांकि, उपकरणों का वास्तविक निष्पादन होस्ट एप्लिकेशन की जिम्मेदारी बनी रहती है।

कार्ड पर सूचीबद्ध स्थानिक शिक्षण विषयों में सापेक्ष संबंध, सघन गणना और फ्रेम, कैमरा गति और गहराई का क्रमबद्धीकरण, ईगोसेंट्रिक बनाम एलोसेंट्रिक दृश्य, और VLA शैली में अनुकूलन के लिए उच्च-स्तरीय क्षमता निर्धारण और कार्रवाई योजना शामिल है।

मॉडल के वज़न Hugging Face पर TaichuAI/ZDTaichu5.0-9B पर NVIDIA ओपन मॉडल लाइसेंस के तहत रखे गए हैं, जबकि Qwen3.5 के Apache-2.0 नोटिस बरकरार रहते हैं। सेवा के लिए कस्टम vLLM 0.26.0 शाखा और OpenAI के साथ संगत एंडपॉइंट प्रदान करने के लिए TaichuAI का Docker इमेज उपयोग किया जाता है, जिसमें स्थानिक लगाव और सामान्य कार्यों के लिए अनुशंसित नमूनाकरण सेटिंग्स होती हैं।

अन्य विक्रेताओं द्वारा प्रस्तुत मॉडलों के समान, बाहरी प्रयोगशालाओं को बेंचमार्क मेट्रिक्स को स्वतंत्र पुनरुत्पादन के परिणामों के सामने निर्दिष्ट प्रॉम्प्ट और जजों के साथ घोषित माना जाना चाहिए। हालांकि, मध्यम आकार के ओपन मल्टीमॉडल चेकपॉइंट, स्थान और एजेंटों पर जोर, और तैयार vLLM पैकेजिंग का संयोजन शोधकर्ताओं को मूल्यांकन के लिए एक ठोस कलाकृति प्रदान करता है।

लोकप्रिय