Компания Infinigence AI совместно с командами из Университета Цинхуа и Шанхайского университета Цзяо Тунг выпустила в открытый доступ APXInf. Этот движок предназначен для инференса на периферии и создан для воплощенных моделей, которые должны замыкать цикл восприятие–решение–действие непосредственно на роботе, а не в облаке.
Публичный пакет доступен на GitHub по адресу RLinf/APXinf-robo и включает среду выполнения на Rust с привязками на Python, ориентированными на устройства класса Jetson и настольные графические процессоры. Компания позиционирует этот релиз как «последнюю милю» между способными моделями типа визуал-язык-действие и стабильным управлением на самом роботе.
Согласно данным Infinigence и освещению от QbitAI, на платформе NVIDIA Jetson Thor, использование формата FP8 с PI 0.5 позволяет сократить сквозной инференс с приблизительных 278 мс до менее чем 26 мс. Это обеспечивает частоту около 38.46 Гц, что достаточно для многосценарийного управления в реальном времени. Данное улучшение представляет собой примерно десятикратное снижение задержки по сравнению с неоптимизированной базовой линией, которую они приводят.
Этот прорыв стал возможен благодаря работе над конвейером, графом, ядром и квантованием, а также благодаря использованию агенто-ассистированного слияния ядер CUDA (Agent4Kernel).
Первоначальная поддержка моделей включает PI 0.5 и WALL-OSS. Целевые аппаратные платформы включают Jetson Orin, Jetson Thor и GeForce RTX 4090. Архитектурные решения акцентируют внимание на долгосрочной стабильности, наряду с пиковой скоростью: используется минимальная среда выполнения на Rust для обеспечения безопасности памяти и эргономика Python для разработчиков. Кроме того, внедрен агентский рабочий процесс для адаптации новых контрольных точек VLA/WAM без необходимости ручного написания каждого пути ядра.
Этот движок интегрируется после более раннего стека обучения с подкреплением RLinf от Infinigence, расширяя ту же открытую экосистему от пост-тренинга до развертывания на роботе с возможностями обслуживания, совместимыми с OpenPI.
В планах развития находятся порты для большего числа моделей VLA/VLM и мировых моделей (уже запланирована работа с классами Qwen и GR00T), оптимизация nvfp4, разработка бэкендов для AMD, а также поддержка отечественных чипов для инференса и операционных систем для отечественных роботов. Командам рекомендуется самостоятельно воспроизвести показатели задержки для Thor/Orin на собственных контрольных точках и в рамках заданных параметров энергопотребления. Указанное значение FP8 ниже 26 мс устанавливает стандарт для инференса воплощенных систем на периферии, но не является гарантией для каждой модели или формы пакета.

