A Unitree apresentou em 10 de setembro o UnifoLM-WLA-1.0, que é um modelo fundamental generativo para robôs humanoides de nova geração, com aproximadamente 6 bilhões de parâmetros. De acordo com a empresa, um único arquivo de controle, treinado com dados de um robô real por cerca de 2500 horas, é capaz de coordenar 64 tarefas, abrangendo 10 manipulações de corpo inteiro e 54 manipulações na mesa, além de operar tanto com garras de dois dedos quanto com várias mãos ágeis de cinco dedos.
Este lançamento difere da demonstração anterior do Unitree UnifoLM-X2 sparring; o UnifoLM-WLA-1.0 representa um conjunto mais amplo de 'visão-linguagem-ação' para realizar tarefas domésticas e de mesa cotidianas, em vez de uma demonstração focada em combate.
Arquitetonicamente, o UnifoLM-WLA-1.0 baseia-se em modelagem de mundo orientada à interação, complementada pelo especialista de ação MMDiT. Esta fase de raciocínio encarnado, denominada UnifoLM-ER-1, é construída sobre o Qwen3-VL-4B e foi treinada com mais de 5 milhões de exemplos encarnados. Esses exemplos cobrem aspectos como previsão de pontos, detecção de objetos, raciocínio multiimagem, trajetórias 2D, detecção 3D e respostas a perguntas espaciais, o que aprimora a percepção espacial, ao mesmo tempo que aprende conjuntamente com dados gerais de imagem e texto para manter amplas habilidades de 'visão-linguagem'.
Em seguida, a previsão de regiões dinâmicas utiliza fluxo óptico para extrair mudanças futuras na cena, comprime-as usando VQ-VAE em tokens de comprimento fixo e treina o modelo 'visão-linguagem' para prever quais regiões começarão a se mover após o início da interação. O treinamento discreto de ações através de quantização residual de vetores divide o espaço de ação unificado em posturas de efeitos finais, juntas dos braços e juntas da parte inferior do corpo, alinha esses tokens em passos temporais comuns e os alimenta no UnifoLM-ER-Flow. O modelo WLA, que eles lançaram, inclui o especialista MMDiT para decodificar as ações contínuas do robô a partir deste arcabouço multimodal.
Nos testes de raciocínio espacial e encarnado, realizados em 16 conjuntos de dados multimodais, a Unitree relata que o UnifoLM-ER-1-4B supera modelos abertos em sete testes. Além disso, em conjuntos de dados espaciais sobrepostos, ele supera o proprietário local GPT-6 Astra em métricas como Where2Place, subtarefas BLINK spatial, CV-Bench e EmbSpatial. O treinamento se baseia nos Unitree Open Datasets e BitRobot-HIW-500, bem como em outras fontes de dados de robôs reais. Avaliações em vídeo são demonstradas no equipamento Unitree G1 para executar tarefas como dobrar toalhas, embalar telefones, arrumar camas, classificar sapatos e limpar banheiros — tarefas que exigem movimento coordenado de braços, efeitos finais e parte inferior do corpo dentro de uma única política.
É importante notar que a página do projeto está disponível para desenvolvedores, mas o código, os modelos e os conjuntos de dados ainda estão marcados como 'Em Breve'. A Unitree anunciou sua intenção de tornar o projeto de código aberto e publicou a documentação da arquitetura e da matriz de tarefas, mas os pesos e os corpos de dados ainda não estão disponíveis para download. Até que esses recursos estejam disponíveis, o sinal prático para pesquisadores e integradores é o roteiro divulgado da base humanoide geral e a tabela de benchmarks, e não um arquivo de controle pronto para uso por terceiros.

