A DeepCybo apresentou o PhysBrain 1.5, um modelo base físico que integra a compreensão do mundo encarnado, a geração de ações e a previsão de estados futuros em um núcleo autorregressivo unificado. Este modelo é construído sobre o Qwen3-VL e foi expandido com tokens para ações e estado visual.
Especificamente, o modelo de referência de 8 bilhões de parâmetros demonstra uma pontuação geral de 72,5 em 28 benchmarks públicos relacionados ao mundo encarnado. Isso é declarado como o primeiro resultado entre modelos de código aberto e está aproximadamente um ponto atrás de sistemas proprietários líderes, como GPT-6 Astra (73,3) e Gemini 3.6 Flash (73,0), de acordo com a tabela publicada do projeto.
De acordo com o relatório da DeepCybo, a versão PhysBrain 1.5-8B ocupa o primeiro lugar em 14 dos 28 benchmarks e o segundo lugar em 10 entre os modelos de código aberto. Essas tarefas abrangem percepção visoespacial, raciocínio multivisão, planejamento do mundo encarnado, fixação de capacidades e tarefas de rastro visual.
Uma versão mais leve, PhysBrain 1.5-2B, obteve um resultado de 66,6 no mesmo conjunto de testes, servindo como uma ferramenta compatível para implantação, em vez de ser um concorrente principal no ranking. Os pesos de ambas as versões, o relatório técnico e o conjunto de avaliação estão disponíveis nas plataformas Hugging Face e GitHub sob o projeto DeepCybo / PhysBrain 1.5.
O processo de treinamento foi implementado através de um ciclo físico fechado: observação, raciocínio e fixação, execução de ação e, em seguida, previsão de mudanças no mundo. Respostas linguísticas, estruturas espaciais, trajetórias do efetor final através de tokens ActionPiece, bem como quadros futuros RGB, profundidade e máscara do robô alinhados, utilizam um único objetivo comum — o próximo token, sem o uso de cabeças de tarefa separadas.
O pré-treinamento se baseou em vídeos de interação humana (em modos egocêntrico, ego-exocêntrico e panorâmico). O ajuste fino adicional foi realizado misturando demonstrações humanas, trajetórias de robôs reais e simulação usando a ponte de ações Human-as-Humanoid da DeepCybo.
Em comparação com outras linhas abertas chinesas, como Intern W0, Motus2 ou Cog-WM, o PhysBrain 1.5 representa o lançamento de um modelo base com liderança declarada em vários benchmarks, e não apenas uma demonstração de política para um único robô. Recomenda-se às equipes que utilizam este modelo que executem novamente o pacote de avaliação, estudem a transferência de ActionPiece em seus próprios manipuladores e considerem a pontuação agregada de 72,5 como um ponto de partida para comparação, em vez de equiparar a proximidade com sistemas proprietários à capacidade de aplicação imediata.
