Infinigence AI ने Tsinghua University और Shanghai Jiao Tong University की टीमों के साथ मिलकर APXInf को सार्वजनिक रूप से जारी किया है। यह इंजन एज पर इन्फेरेंस के लिए डिज़ाइन किया गया है और एम्बेडेड मॉडलों के लिए बनाया गया है जिन्हें क्लाउड के बजाय सीधे रोबोट पर धारणा-निर्णय-कार्रवाई चक्र को बंद करना होता है।
सार्वजनिक पैकेज RLinf/APXinf-robo पर GitHub पर उपलब्ध है और इसमें Rust में एक रनटाइम शामिल है जिसमें Jetson क्लास और डेस्कटॉप जीपीयू पर केंद्रित Python बाइंडिंग हैं। कंपनी इस रिलीज़ को सक्षम विज़ुअल-लैंग्वेज-एक्शन मॉडल और रोबोट पर स्थिर नियंत्रण के बीच 'अंतिम मील' के रूप में प्रस्तुत करती है।
Infinigence और QbitAI की रिपोर्ट के अनुसार, NVIDIA Jetson Thor प्लेटफॉर्म पर PI 0.5 के साथ FP8 प्रारूप का उपयोग करने से एंड-टू-एंड इन्फेरेंस लगभग 278 मिलीसेकंड से घटकर 26 मिलीसेकंड से भी कम हो जाता है। यह लगभग 38.46 हर्ट्ज की आवृत्ति प्रदान करता है, जो वास्तविक समय में मल्टी-सीन परिदृश्य नियंत्रण के लिए पर्याप्त है। यह सुधार उनके द्वारा दिए गए गैर-अनुकूलित बेसलाइन की तुलना में लगभग दस गुना विलंबता में कमी का प्रतिनिधित्व करता है।
यह सफलता पाइपलाइन, ग्राफ, कोर और क्वांटाइजेशन पर काम करने के साथ-साथ एजेंट-सहायता प्राप्त CUDA कोर फ्यूजन (Agent4Kernel) के उपयोग के कारण संभव हुई।
प्रारंभिक मॉडल समर्थन में PI 0.5 और WALL-OSS शामिल हैं। लक्षित हार्डवेयर प्लेटफॉर्म में Jetson Orin, Jetson Thor और GeForce RTX 4090 शामिल हैं। वास्तुशिल्प समाधान चरम गति के साथ-साथ दीर्घकालिक स्थिरता पर भी जोर देते हैं: मेमोरी सुरक्षा सुनिश्चित करने के लिए Rust का न्यूनतम रनटाइम और डेवलपर्स के लिए Python की एर्गोनॉमिक्स का उपयोग किया जाता है। इसके अलावा, VLA/WAM के नए चेकपॉइंट्स को मैन्युअल रूप से प्रत्येक कोर पथ को लिखे बिना अनुकूलित करने के लिए एक एजेंट वर्कफ़्लो लागू किया गया है।
यह इंजन Infinigence के पिछले RLinf रीइन्फोर्समेंट लर्निंग प्रशिक्षण स्टैक के बाद एकीकृत होता है, जिससे पोस्ट-ट्रेनिंग से लेकर ओपनपीआई संगत रखरखाव क्षमताओं वाले रोबोट पर परिनियोजन तक समान खुली पारिस्थितिकी तंत्र का विस्तार होता है।
विकास योजनाओं में अधिक VLA/VLM और विश्व मॉडल के लिए पोर्ट शामिल हैं (Qwen और GR00T वर्गों के साथ काम पहले से ही निर्धारित है), nvfp4 का अनुकूलन, AMD के लिए बैकएंड का विकास, और इन्फेरेंस के लिए घरेलू चिप्स और घरेलू रोबोटों के लिए ऑपरेटिंग सिस्टम का समर्थन शामिल है। टीमों को अपने स्वयं के चेकपॉइंट्स और निर्दिष्ट ऊर्जा खपत मापदंडों के भीतर Thor/Orin के लिए विलंबता मेट्रिक्स को पुन: उत्पन्न करने की सलाह दी जाती है। 26 मिलीसेकंड से नीचे का यह FP8 मान एज पर एम्बेडेड सिस्टम इन्फेरेंस के लिए मानक स्थापित करता है, लेकिन यह प्रत्येक मॉडल या पैकेज के लिए गारंटी नहीं है।

