A Tencent Robotics apresentou três modelos fundamentais incorporados durante o evento WAIC 2026. Esses modelos incluem VLM para compreensão de cenas, o modelo cognitivo RxBrain para planejamento com estados visuais e VLA para ações contínuas em frequência de 500–1000 Hz.
Arquitetura de Três Camadas
O pesquisador principal, Dr. Zhang Zhenyou, apresentou essa arquitetura como uma solução para um problema fundamental que as abordagens atuais de VLA não abordam adequadamente. Ele observou que diferentes tipos de inteligência robótica devem operar em frequências distintas, visto que o próprio mundo físico opera em múltiplas escalas de tempo.
A compreensão desse problema surgiu após um experimento malsucedido de transferência de capacidades do robô no OpenClaw, que causou um atraso de dezenas de segundos, inaceitável para robôs físicos, onde mesmo um atraso cognitivo de 2 a 3 segundos é problemático.
Princípio da Separação de Frequências
A arquitetura de três camadas resolve esse problema separando as frequências. O modelo Hy-Embodied-VLM é responsável pela compreensão espacial em uma frequência mais baixa, interpretando cenas visuais e relações entre objetos. O Hy-Embodied-RxBrain representa uma inovação significativa na arquitetura cognitiva: ele não apenas gera passos de tarefa em linguagem, mas também visualiza como o mundo físico deve parecer após a conclusão de cada subtarefa, utilizando representações de estado visual em vez de descrições textuais.
Isso elimina a limitação principal dos sistemas de planejamento baseados apenas em linguagem, pois descrições textuais não conseguem transmitir eficientemente relações espaciais e restrições físicas que podem ser transmitidas instantaneamente através da visão. O modelo Hy-Embodied-VLA opera na frequência mais alta, traduzindo objetivos de alto nível em comandos de ação contínuos de baixo nível com velocidade suficiente para interagir com o mundo físico em tempo real.
Testes Industriais e Vantagens
A Tencent informou que o Hy-Embodied-VLA passou por testes de produção em uma fábrica química. O modelo lida com linhas de montagem intensivas em SKUs, de baixo volume e altamente misturadas, garantindo um tempo de ciclo de peça inferior a 6 segundos. Além disso, o modelo é capaz de se adaptar a novos SKUs em apenas 8 horas de coleta e ajuste fino de dados.
As condições de teste diferem significativamente das demonstrações laboratoriais: os objetos são dispostos aleatoriamente, a iluminação muda, ocorrem interrupções na produção, e o robô deve atingir um nível de falha quase nulo. O Dr. Zhang enfatizou que uma demonstração que alcançou 80–90 pontos sem implementação real não tem valor prático, e os testes de fábrica refletem o compromisso com o desempenho industrial mensurável, e não com métricas de benchmark.
Melhoria da Lógica e Ecossistema
O modelo cognitivo RxBrain resolve o segundo desafio complexo: o gargalo linguístico no raciocínio robótico. Sistemas anteriores da Tairos dependiam de texto para comunicação intercerebral, mas a descrição de relações espaciais de objetos em palavras pode ser prolixa e ambígua. Ao incorporar a representação visual do estado no ciclo de planejamento, o RxBrain garante uma maior taxa de transferência de informações entre percepção e ação.
O modelo é descrito como um modelo de mundo cognitivo incorporado, e não como um modelo completo do mundo, pois ainda não há uma arquitetura consensual de modelo de mundo único nesta área. Juntos, os três modelos e a plataforma Tairos formam um stack completo de inteligência incorporada da Tencent, disponível para qualquer desenvolvedor ou fabricante utilizar. Assim, a comunidade de robótica agora pode construir sobre a mesma arquitetura sensível à frequência desenvolvida pela Tencent graças a falhas reais e melhoria iterativa.