Unitree apresenta o modelo UnifoLM-WLA-1.0 — um modelo fundamental para robôs humanoides
Leia mais
Pandaily
pandaily.com

Unitree apresenta o modelo UnifoLM-WLA-1.0 — um modelo fundamental para robôs humanoides

A Unitree apresentou em 10 de setembro o UnifoLM-WLA-1.0, que é um modelo fundamental generativo para robôs humanoides de nova geração, com aproximadamente 6 bilhões de parâmetros. De acordo com a empresa, um único arquivo de controle, treinado com dados de um robô real por cerca de 2500 horas, é capaz de coordenar 64 tarefas, abrangendo 10 manipulações de corpo inteiro e 54 manipulações na mesa, além de operar tanto com garras de dois dedos quanto com várias mãos ágeis de cinco dedos.

Este lançamento difere da demonstração anterior do Unitree UnifoLM-X2 sparring; o UnifoLM-WLA-1.0 representa um conjunto mais amplo de 'visão-linguagem-ação' para realizar tarefas domésticas e de mesa cotidianas, em vez de uma demonstração focada em combate.

Arquitetonicamente, o UnifoLM-WLA-1.0 baseia-se em modelagem de mundo orientada à interação, complementada pelo especialista de ação MMDiT. Esta fase de raciocínio encarnado, denominada UnifoLM-ER-1, é construída sobre o Qwen3-VL-4B e foi treinada com mais de 5 milhões de exemplos encarnados. Esses exemplos cobrem aspectos como previsão de pontos, detecção de objetos, raciocínio multiimagem, trajetórias 2D, detecção 3D e respostas a perguntas espaciais, o que aprimora a percepção espacial, ao mesmo tempo que aprende conjuntamente com dados gerais de imagem e texto para manter amplas habilidades de 'visão-linguagem'.

Em seguida, a previsão de regiões dinâmicas utiliza fluxo óptico para extrair mudanças futuras na cena, comprime-as usando VQ-VAE em tokens de comprimento fixo e treina o modelo 'visão-linguagem' para prever quais regiões começarão a se mover após o início da interação. O treinamento discreto de ações através de quantização residual de vetores divide o espaço de ação unificado em posturas de efeitos finais, juntas dos braços e juntas da parte inferior do corpo, alinha esses tokens em passos temporais comuns e os alimenta no UnifoLM-ER-Flow. O modelo WLA, que eles lançaram, inclui o especialista MMDiT para decodificar as ações contínuas do robô a partir deste arcabouço multimodal.

Nos testes de raciocínio espacial e encarnado, realizados em 16 conjuntos de dados multimodais, a Unitree relata que o UnifoLM-ER-1-4B supera modelos abertos em sete testes. Além disso, em conjuntos de dados espaciais sobrepostos, ele supera o proprietário local GPT-6 Astra em métricas como Where2Place, subtarefas BLINK spatial, CV-Bench e EmbSpatial. O treinamento se baseia nos Unitree Open Datasets e BitRobot-HIW-500, bem como em outras fontes de dados de robôs reais. Avaliações em vídeo são demonstradas no equipamento Unitree G1 para executar tarefas como dobrar toalhas, embalar telefones, arrumar camas, classificar sapatos e limpar banheiros — tarefas que exigem movimento coordenado de braços, efeitos finais e parte inferior do corpo dentro de uma única política.

É importante notar que a página do projeto está disponível para desenvolvedores, mas o código, os modelos e os conjuntos de dados ainda estão marcados como 'Em Breve'. A Unitree anunciou sua intenção de tornar o projeto de código aberto e publicou a documentação da arquitetura e da matriz de tarefas, mas os pesos e os corpos de dados ainda não estão disponíveis para download. Até que esses recursos estejam disponíveis, o sinal prático para pesquisadores e integradores é o roteiro divulgado da base humanoide geral e a tabela de benchmarks, e não um arquivo de controle pronto para uso por terceiros.

Histórias semelhantes

Demonstração do Unitree G1 Sparring usando o modelo de mundo UnifoLM-X2-1.0 sem telecontrole
Leia mais
pandaily.com

Demonstração do Unitree G1 Sparring usando o modelo de mundo UnifoLM-X2-1.0 sem telecontrole

A Unitree Robotics demonstrou as capacidades de seu robô humanoide G1 em um sparring com um ser humano treinador equipado com protetores, utilizando o modelo de mundo UnifoLM-X2-1.0. Este modelo, segundo a empresa, é um modelo fundamental de mundo e ação, capaz de prever o estado físico no futuro próximo e planejar movimentos em tempo real sem a necessidade de telecontrole ou coreografia pré-escrita.

Em um breve clipe de vídeo, publicado por volta de 7 de setembro de 2026, é mostrado como o G1 desvia de golpes, corrige o movimento das pernas e também desfere socos com os braços e pernas contra o corpo. A Unitree explica que este sistema resolve problemas típicos de modelos de mundo e ação, como planejamento em escala de milissegundos, tomada de decisões táticas contra um oponente em movimento e implementação de um ciclo fechado com entrada contínua de forças.

Ao contrário das demonstrações que traduzem comandos de um controlador de RV ou gamepad para posições alvo das articulações, o UnifoLM-X2-1.0 é apresentado como um ciclo de percepção preditiva para ação. Ele antecipa mudanças prováveis na cena e no comportamento do adversário e, em seguida, seleciona e modifica dinamicamente as ações, mantendo o equilíbrio e a postura dentro do plano.

Este lançamento se baseia no trabalho anterior da Unitree, especificamente no UnifoLM-WMA-0, um modelo de mundo baseado em difusão de vídeo com cabeça para ações, que a empresa lançou em 2025. O modelo X2-1.0 é posicionado como uma versão mais madura, focada na interação de alta dinâmica, e não apenas na manipulação estática. No entanto, a Unitree ainda não publicou um artigo científico, pesos do modelo, métricas de latência ou benchmarks independentes para esta versão, nem confirmou se o novo modelo será aberto, como seu predecessor, deixando laboratórios independentes sem uma linha de base reproduzível.

Portanto, analistas independentes abordam o que um único vídeo editado pode provar com cautela. O adversário é um ser humano treinado com escudos de proteção, e não um oponente que tenta derrubar o robô. Além disso, não há telemetria pública mostrando o número de tentativas ou se a inferência foi executada inteiramente no próprio robô ou em um servidor externo conectado à plataforma. No entanto, o sparring com contato intenso representa um teste de latência mais rigoroso do que o processo estático de captura e posicionamento: reações lentas levam imediatamente a falhas quando socos e chutes chegam em movimento contínuo, e as janelas de recuperação são reduzidas a frações de segundo.

A Unitree afirma que esta demonstração ajuda a confirmar a viabilidade do controle humanoide baseado em modelo em uma escala de implementação maior — é uma declaração de engenharia sobre previsão e planejamento em tempo real durante a interação física. Até que testes repetidos e detalhes técnicos sejam publicados, este clipe de sparring deve ser visto mais como um sinal de viabilidade de controle autônomo baseado em modelo de corpo inteiro, e não como uma especificação de produto pronto ou uma declaração de autonomia geral de fábrica.

Popular