Infinigence AI ने एज जेटसन थोर पर एम्बेडेड मॉडल के लिए इन्फेरेंस इंजन APXInf जारी किया
और पढ़ें
Pandaily
pandaily.com

Infinigence AI ने एज जेटसन थोर पर एम्बेडेड मॉडल के लिए इन्फेरेंस इंजन APXInf जारी किया

Infinigence AI ने Tsinghua University और Shanghai Jiao Tong University की टीमों के साथ मिलकर APXInf को सार्वजनिक रूप से जारी किया है। यह इंजन एज पर इन्फेरेंस के लिए डिज़ाइन किया गया है और एम्बेडेड मॉडलों के लिए बनाया गया है जिन्हें क्लाउड के बजाय सीधे रोबोट पर धारणा-निर्णय-कार्रवाई चक्र को बंद करना होता है।

सार्वजनिक पैकेज RLinf/APXinf-robo पर GitHub पर उपलब्ध है और इसमें Rust में एक रनटाइम शामिल है जिसमें Jetson क्लास और डेस्कटॉप जीपीयू पर केंद्रित Python बाइंडिंग हैं। कंपनी इस रिलीज़ को सक्षम विज़ुअल-लैंग्वेज-एक्शन मॉडल और रोबोट पर स्थिर नियंत्रण के बीच 'अंतिम मील' के रूप में प्रस्तुत करती है।

Infinigence और QbitAI की रिपोर्ट के अनुसार, NVIDIA Jetson Thor प्लेटफॉर्म पर PI 0.5 के साथ FP8 प्रारूप का उपयोग करने से एंड-टू-एंड इन्फेरेंस लगभग 278 मिलीसेकंड से घटकर 26 मिलीसेकंड से भी कम हो जाता है। यह लगभग 38.46 हर्ट्ज की आवृत्ति प्रदान करता है, जो वास्तविक समय में मल्टी-सीन परिदृश्य नियंत्रण के लिए पर्याप्त है। यह सुधार उनके द्वारा दिए गए गैर-अनुकूलित बेसलाइन की तुलना में लगभग दस गुना विलंबता में कमी का प्रतिनिधित्व करता है।

यह सफलता पाइपलाइन, ग्राफ, कोर और क्वांटाइजेशन पर काम करने के साथ-साथ एजेंट-सहायता प्राप्त CUDA कोर फ्यूजन (Agent4Kernel) के उपयोग के कारण संभव हुई।

प्रारंभिक मॉडल समर्थन में PI 0.5 और WALL-OSS शामिल हैं। लक्षित हार्डवेयर प्लेटफॉर्म में Jetson Orin, Jetson Thor और GeForce RTX 4090 शामिल हैं। वास्तुशिल्प समाधान चरम गति के साथ-साथ दीर्घकालिक स्थिरता पर भी जोर देते हैं: मेमोरी सुरक्षा सुनिश्चित करने के लिए Rust का न्यूनतम रनटाइम और डेवलपर्स के लिए Python की एर्गोनॉमिक्स का उपयोग किया जाता है। इसके अलावा, VLA/WAM के नए चेकपॉइंट्स को मैन्युअल रूप से प्रत्येक कोर पथ को लिखे बिना अनुकूलित करने के लिए एक एजेंट वर्कफ़्लो लागू किया गया है।

यह इंजन Infinigence के पिछले RLinf रीइन्फोर्समेंट लर्निंग प्रशिक्षण स्टैक के बाद एकीकृत होता है, जिससे पोस्ट-ट्रेनिंग से लेकर ओपनपीआई संगत रखरखाव क्षमताओं वाले रोबोट पर परिनियोजन तक समान खुली पारिस्थितिकी तंत्र का विस्तार होता है।

विकास योजनाओं में अधिक VLA/VLM और विश्व मॉडल के लिए पोर्ट शामिल हैं (Qwen और GR00T वर्गों के साथ काम पहले से ही निर्धारित है), nvfp4 का अनुकूलन, AMD के लिए बैकएंड का विकास, और इन्फेरेंस के लिए घरेलू चिप्स और घरेलू रोबोटों के लिए ऑपरेटिंग सिस्टम का समर्थन शामिल है। टीमों को अपने स्वयं के चेकपॉइंट्स और निर्दिष्ट ऊर्जा खपत मापदंडों के भीतर Thor/Orin के लिए विलंबता मेट्रिक्स को पुन: उत्पन्न करने की सलाह दी जाती है। 26 मिलीसेकंड से नीचे का यह FP8 मान एज पर एम्बेडेड सिस्टम इन्फेरेंस के लिए मानक स्थापित करता है, लेकिन यह प्रत्येक मॉडल या पैकेज के लिए गारंटी नहीं है।

समान कहानियाँ

OpenBMB ने डिवाइस पर चलने के लिए 4 बिलियन पैरामीटर से कम वजन का SOTA ओपन मॉडल MiniCPM5-2B जारी किया
और पढ़ें
pandaily.com

OpenBMB ने डिवाइस पर चलने के लिए 4 बिलियन पैरामीटर से कम वजन का SOTA ओपन मॉडल MiniCPM5-2B जारी किया

ओपनBMB, मॉडलबेस्ट से जुड़ा एक ओपन प्रोजेक्ट, ने सीधे डिवाइस पर चलने के लिए एक सघन भाषा मॉडल MiniCPM5-2B प्रस्तुत किया है। इस मॉडल में लगभग 2.52 बिलियन पैरामीटर हैं और यह Apache-2.0 लाइसेंस के तहत 131,072 टोकन की नेटिव कॉन्टेक्स्ट लंबाई का समर्थन करता है।

MiniCPM5-2B मिनीCPM5 श्रृंखला का दूसरा रिलीज़ है, जो MiniCPM5-1B के बाद आया है। यह LlamaForCausalLM की मानक संरचना का उपयोग करता है, जिसमें 42 परतें और ग्रुपेड-क्वेरी अटेंशन (grouped-query attention) शामिल है, जो 16 क्वेरी हेड्स और 2 की/वैल्यू हेड्स का उपयोग करता है। इसके कारण, मुख्य इंजन बिना कस्टम कर्नेल या मॉडल कोड फोर्क की आवश्यकता के मॉडल को लोड कर सकते हैं।

एम्बेडिंग के अलावा पैरामीटर लगभग 1.98 बिलियन हैं, जो मॉडल को 4 बिलियन पैरामीटर से कम वर्ग में रखने की अनुमति देता है, जो फोन, लैपटॉप और पेरिफेरल उपकरणों पर होस्टिंग के लिए उपयुक्त है।

34-बेंचमार्क डेटासेट पर तुलना करने पर, MiniCPM5-2B औसतन 53.9 स्कोर प्रदर्शित करता है, जो कई बड़े ओपन बेस मॉडलों से आगे निकल जाता है। इनमें Qwen3.5-4B ने 51.1 और granite-4.2-3B ने 42.7 स्कोर किया। वहीं, समान आकार के मॉडल जैसे LFM2.5-2.6B और Qwen3.5-2B पीछे रह जाते हैं।

मॉडल की ताकत कोडिंग एजेंटों, टूल उपयोग और लंबे संदर्भ से जानकारी निकालने के क्षेत्रों पर केंद्रित है। उदाहरण के लिए, LiveCodeBench v6 पर MiniCPM5-2B ने Qwen3.5-4B के 56.4 की तुलना में 69.1 स्कोर किया, और SWE-bench Verified पर 46.4 बनाम 33.6 स्कोर किया। उच्च परिणाम τ²-Bench Telecom (97.1), BFCL v4 (66.6) और NoLiMa (43.5 की तुलना में 68.1) पर भी प्राप्त किए गए।

गहन ज्ञान की आवश्यकता वाले कार्यों में, प्रदर्शन आकार की ऊपरी सीमा के करीब रहता है; उदाहरण के लिए, MMLU-Pro पर मॉडल ने 70.8 दिखाया, जबकि 4B आकार का बेंचमार्क मॉडल Qwen ने 78.0 हासिल किया। ओपनBMB विशेष रूप से आर्टिफिशियल एनालिसिस स्रोतों से प्राप्त पंक्तियों को चिह्नित करता है ताकि उपयोगकर्ता विक्रेता और तृतीय-पक्ष परिणामों के बीच अंतर कर सकें।

पोस्ट-ट्रेनिंग प्रक्रिया अल्ट्राडेटा स्तर के प्रबंधन का पालन करती थी: पहले लगभग 400 बिलियन टोकन का उपयोग करके गहन सोच के आधार पर सुपरवाइज्ड फाइन-ट्यूनिंग (supervised fine-tuning) की गई। फिर गणित, कोड, एजेंट और लेखन के लिए जस्टRL II एल्गोरिथम पर आधारित विशेष रीइन्फोर्समेंट-लर्निंग टीचर्स (reinforcement-learning teachers) लागू किए गए। अंतिम चरण ऑन-पॉलिसी डिस्टिलेशन (on-policy distillation) था, जिसने 16 RL विशेषज्ञों—जिनमें से पांच एजेंट थे—को एक अंतिम छात्र मॉडल में मिला दिया।

ओपनBMB तर्क और सामान्य सेटों में लगभग 10.96 अंकों की वृद्धि और एजेंट सेटों में 6.96 अंकों की वृद्धि को RL और डिस्टिलेशन चरण से जोड़ता है। प्रत्येक भाग के योगदान को सीधे मापने की क्षमता के लिए, कंपनी मध्यवर्ती नियंत्रण बिंदु जारी करती है: बेस, मिडट्रेन और SFT-केवल।

वजन के साथ, अल्ट्राडेटा कॉर्पोरेशन वेब, कोड, गणित, SFT और एजेंटों के लिए RL नमूनों को कवर करने वाले डेटासेट प्रकाशित करते हैं, जिससे परिणामों को पुन: उत्पन्न करना संभव हो जाता है। रनटाइम समर्थन में vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX, LiteRT और मल्टी-चिप FlagOS बिल्ड शामिल हैं। स्थानीय सहायकों के लिए GGUF, MLX और GPTQ पैकेज प्रदान किए जाते हैं, जिन्हें डेटा सेंटर जीपीयू का उपयोग किए बिना टूल कॉल करने और लंबे संदर्भ के साथ काम करने की आवश्यकता होती है।

डिवाइस पर काम करने पर ध्यान केंद्रित करने वाले डेवलपर्स के लिए, MiniCPM5-2B को सामान्य ज्ञान के विशालकाय के रूप में नहीं, बल्कि Apache लाइसेंस वाला एक कॉम्पैक्ट एजेंट और कोडिंग साथी के रूप में स्थापित किया गया है, जो प्रकाशित औसत स्कोर के आधार पर कुछ 4B क्लास के ओपन बेस मॉडलों से बेहतर प्रदर्शन करता है।

लोकप्रिय