A Infinigence AI, em colaboração com equipes da Universidade Tsinghua e da Universidade de Jiaotong de Xangai, lançou o APXInf em código aberto. Este motor é destinado à inferência na periferia e foi criado para modelos incorporados que devem fechar o ciclo de percepção-decisão-ação diretamente no robô, e não na nuvem.
O pacote público está disponível no GitHub em RLinf/APXinf-robo e inclui um ambiente de execução em Rust com bindings para Python, voltado para dispositivos da classe Jetson e GPUs de desktop. A empresa posiciona este lançamento como a 'última milha' entre modelos capazes, como visão-linguagem-ação, e controle estável no próprio robô.
De acordo com dados da Infinigence e cobertura da QbitAI, na plataforma NVIDIA Jetson Thor, o uso do formato FP8 com PI 0.5 permite reduzir a inferência ponta a ponta de aproximadamente 278 ms para menos de 26 ms. Isso garante uma frequência de cerca de 38,46 Hz, o que é suficiente para controle multiscenário em tempo real. Essa melhoria representa uma redução de latência de aproximadamente dez vezes em comparação com a linha de base não otimizada que eles apresentam.
Este avanço foi possível graças ao trabalho no pipeline, grafo, kernel e quantização, bem como ao uso de fusão de kernels CUDA assistida por agente (Agent4Kernel).
O suporte inicial a modelos inclui PI 0.5 e WALL-OSS. As plataformas de hardware alvo incluem Jetson Orin, Jetson Thor e GeForce RTX 4090. As decisões arquitetônicas enfatizam a estabilidade de longo prazo, juntamente com a velocidade máxima: utiliza-se um ambiente de execução mínimo em Rust para garantir a segurança de memória e ergonomia em Python para os desenvolvedores. Além disso, um fluxo de trabalho baseado em agente foi implementado para adaptar novos pontos de controle VLA/WAM sem a necessidade de escrever manualmente cada caminho de kernel.
Este motor se integra após o stack anterior de aprendizado por reforço RLinf da Infinigence, expandindo o mesmo ecossistema aberto desde o pós-treinamento até a implantação no robô com capacidades de manutenção compatíveis com OpenPI.
Os planos de desenvolvimento incluem ports para um maior número de modelos VLA/VLM e modelos globais (já está planejado o trabalho com as classes Qwen e GR00T), otimização nvfp4, desenvolvimento de backends para AMD, bem como suporte a chips domésticos para inferência e sistemas operacionais para robôs nacionais. Recomenda-se às equipes reproduzir independentemente os valores de latência para Thor/Orin em seus próprios pontos de controle e dentro dos parâmetros de consumo de energia definidos. O valor FP8 abaixo de 26 ms estabelece um padrão para a inferência de sistemas incorporados na periferia, mas não é uma garantia para cada modelo ou forma de pacote.
