Infinigence AI открыла APXInf — движок для инференса воплощенных моделей на периферии Jetson Thor
Подробнее
Pandaily
pandaily.com

Infinigence AI открыла APXInf — движок для инференса воплощенных моделей на периферии Jetson Thor

Компания Infinigence AI совместно с командами из Университета Цинхуа и Шанхайского университета Цзяо Тунг выпустила в открытый доступ APXInf. Этот движок предназначен для инференса на периферии и создан для воплощенных моделей, которые должны замыкать цикл восприятие–решение–действие непосредственно на роботе, а не в облаке.

Публичный пакет доступен на GitHub по адресу RLinf/APXinf-robo и включает среду выполнения на Rust с привязками на Python, ориентированными на устройства класса Jetson и настольные графические процессоры. Компания позиционирует этот релиз как «последнюю милю» между способными моделями типа визуал-язык-действие и стабильным управлением на самом роботе.

Согласно данным Infinigence и освещению от QbitAI, на платформе NVIDIA Jetson Thor, использование формата FP8 с PI 0.5 позволяет сократить сквозной инференс с приблизительных 278 мс до менее чем 26 мс. Это обеспечивает частоту около 38.46 Гц, что достаточно для многосценарийного управления в реальном времени. Данное улучшение представляет собой примерно десятикратное снижение задержки по сравнению с неоптимизированной базовой линией, которую они приводят.

Этот прорыв стал возможен благодаря работе над конвейером, графом, ядром и квантованием, а также благодаря использованию агенто-ассистированного слияния ядер CUDA (Agent4Kernel).

Первоначальная поддержка моделей включает PI 0.5 и WALL-OSS. Целевые аппаратные платформы включают Jetson Orin, Jetson Thor и GeForce RTX 4090. Архитектурные решения акцентируют внимание на долгосрочной стабильности, наряду с пиковой скоростью: используется минимальная среда выполнения на Rust для обеспечения безопасности памяти и эргономика Python для разработчиков. Кроме того, внедрен агентский рабочий процесс для адаптации новых контрольных точек VLA/WAM без необходимости ручного написания каждого пути ядра.

Этот движок интегрируется после более раннего стека обучения с подкреплением RLinf от Infinigence, расширяя ту же открытую экосистему от пост-тренинга до развертывания на роботе с возможностями обслуживания, совместимыми с OpenPI.

В планах развития находятся порты для большего числа моделей VLA/VLM и мировых моделей (уже запланирована работа с классами Qwen и GR00T), оптимизация nvfp4, разработка бэкендов для AMD, а также поддержка отечественных чипов для инференса и операционных систем для отечественных роботов. Командам рекомендуется самостоятельно воспроизвести показатели задержки для Thor/Orin на собственных контрольных точках и в рамках заданных параметров энергопотребления. Указанное значение FP8 ниже 26 мс устанавливает стандарт для инференса воплощенных систем на периферии, но не является гарантией для каждой модели или формы пакета.

Похожие сюжеты

OpenBMB выпустила MiniCPM5-2B как открытую модель SOTA для работы на устройстве весом менее 4 млрд параметров
Подробнее
pandaily.com

OpenBMB выпустила MiniCPM5-2B как открытую модель SOTA для работы на устройстве весом менее 4 млрд параметров

OpenBMB, открытый проект, связанный с ModelBest, представил MiniCPM5-2B — плотную языковую модель для работы непосредственно на устройстве. Эта модель имеет приблизительно 2,52 миллиарда параметров и поддерживает нативную контекстную длину в 131 072 токена, распространяясь под лицензией Apache-2.0.

MiniCPM5-2B является вторым релизом серии MiniCPM5 после MiniCPM5-1B. Он использует стандартную компоновку LlamaForCausalLM, которая включает 42 слоя с групповым вниманием (grouped-query attention), использующим 16 голов запросов и 2 головы ключа/значения. Благодаря этому, основные движки могут загружать модель без необходимости в кастомных ядрах или форках кода модели.

Параметры, не являющиеся эмбеддингами, составляют около 1,98 миллиарда, что позволяет разместить модель в классе менее 4 миллиардов параметров, подходящем для хостинга на телефонах, ноутбуках и периферийных устройствах.

При сравнении на наборе данных 34-бенчмарк OpenBMB, MiniCPM5-2B демонстрирует средний показатель 53,9, опережая ряд более крупных открытых базовых моделей. Среди них Qwen3.5-4B показал 51,1, а granite-4.2-3B — 42,7. При этом аналогичные по размеру модели, такие как LFM2.5-2.6B и Qwen3.5-2B, отстают.

Сильные стороны модели сосредоточены в областях кодирующих агентов, использования инструментов и извлечения информации из длинного контекста. Например, на LiveCodeBench v6 MiniCPM5-2B показал 69,1 против 56,4 у Qwen3.5-4B, а на SWE-bench Verified — 46,4 против 33,6. Также высокие результаты достигнуты на τ²-Bench Telecom (97,1), BFCL v4 (66,6) и NoLiMa (68,1 против 43,5).

В задачах, требующих глубоких знаний, показатели остаются ближе к верхней границе размера; например, на MMLU-Pro модель показала 70,8, в то время как эталонная модель Qwen размером 4B набрала 78,0. OpenBMB отдельно отмечает строки, полученные из источников Artificial Analysis, чтобы пользователи могли различать данные от вендоров и сторонние результаты.

Послетренировочный процесс следовал управлению уровня UltraData: сначала проводилось тонкое дообучение с учителем (supervised fine-tuning) на основе глубокого мышления с использованием примерно 400 миллиардов токенов. Затем применялись специализированные учителя обучения с подкреплением (reinforcement-learning teachers) для математики, кода, агентов и письма с помощью алгоритма JustRL II, основанного на критике. Завершающим этапом стала дистилляция по политике (on-policy distillation), которая объединила 16 экспертов RL — пятеро из которых были агентными — в одну конечную модель-студента.

OpenBMB связывает средний прирост около 10,96 баллов в задачах рассуждения и общих наборах, а также 6,96 баллов в агентных наборах, с этапом RL и дистилляции. Для возможности прямого измерения вклада каждой части, компания выпускает промежуточные контрольные точки: Base, Midtrain и SFT-only.

Вместе с весами, корпорации UltraData публикуют корпуса данных, охватывающие веб, код, математику, образцы SFT и RL для агентов, что позволяет проводить воспроизведение результатов. Поддержка времени выполнения включает vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX, LiteRT и многочиповые сборки FlagOS. Предоставляются пакеты GGUF, MLX и GPTQ, предназначенные для локальных помощников, которым необходимо выполнять вызовы инструментов и работать с длинным контекстом без использования графического процессора дата-центра.

Для разработчиков, ориентированных на работу на устройстве, MiniCPM5-2B позиционируется не столько как гигант общего знания, сколько как компактный агент с лицензией Apache и компаньон для кодирования, который уже превосходит некоторые открытые базовые модели класса 4B по опубликованному среднему показателю.

Популярное