Компания DeepCybo представила PhysBrain 1.5, физическую базовую модель, которая объединяет понимание воплощенного мира, генерацию действий и прогнозирование будущих состояний в едином авторегрессивном ядре. Эта модель построена на базе Qwen3-VL и была расширена с помощью токенов для действий и визуального состояния.
Конкретно, 8-миллиардный контрольный образец демонстрирует общий балл 72.5 по 28 публичным бенчмаркам, связанным с воплощенным миром. Это заявлено как первый результат среди моделей с открытым исходным кодом и находится примерно в одном пункте от ведущих проприетарных систем, таких как GPT-6 Astra (73.3) и Gemini 3.6 Flash (73.0), согласно опубликованной таблице проекта.
Согласно отчету DeepCybo, версия PhysBrain 1.5-8B занимает первое место в 14 из 28 бенчмарков и второе место в 10 среди моделей с открытым исходным кодом. Эти задачи охватывают визуально-пространственное восприятие, многоракурсное рассуждение, планирование воплощенного мира, закрепление возможностей и задачи визуального следа.
Более легкая версия, PhysBrain 1.5-2B, показала результат 66.6 на том же наборе тестов, выступая в роли совместимого инструмента для развертывания, а не основного претендента в рейтинге. Веса обеих версий, технический отчет и набор для оценки доступны на платформах Hugging Face и GitHub в рамках проекта DeepCybo / PhysBrain 1.5.
Процесс обучения реализован через замкнутый физический цикл: наблюдение, рассуждение и закрепление, выполнение действия, а затем прогнозирование изменений в мире. Языковые ответы, пространственные структуры, траектории конечного эффектора через токены ActionPiece, а также согласованные кадры будущего RGB, глубины и маски робота используют одну общую цель — следующий токен, без использования отдельных голов задач.
Предварительное обучение опиралось на видеозаписи человеческого взаимодействия (в эгоцентрическом, эго-экзоцентрическом и панорамном режимах). Дополнительная тонкая настройка проводилась путем смешивания демонстраций человека, траекторий реальных роботов и симуляции с использованием моста действий Human-as-Humanoid от DeepCybo.
В сравнении с другими китайскими открытыми линиями, такими как Intern W0, Motus2 или Cog-WM, PhysBrain 1.5 представляет собой выпуск базовой модели с заявленным лидерством по множеству бенчмарков, а не просто демонстрацию политики для одного робота. Командам, использующим эту модель, рекомендуется повторно запустить пакет оценки, изучить передачу ActionPiece на собственных манипуляторах и рассматривать агрегированный показатель 72.5 как отправную точку для сравнения, а не приравнивать близость к проприетарным системам к возможности немедленного применения.
