Modelo VPP2 da Robotera conquista o primeiro lugar no RoboDojo e alcança 58,5% de sucesso em tarefas com manipuladores reais ALOHA
Leia mais
Pandaily
pandaily.com

Modelo VPP2 da Robotera conquista o primeiro lugar no RoboDojo e alcança 58,5% de sucesso em tarefas com manipuladores reais ALOHA

A Robotera, que conta com o apoio da Universidade Tsinghua, anunciou que seu modelo de ponta mundial, VPP2, agora ocupa o primeiro lugar no RoboDojo. Este benchmark de simulação é supervisionado pelo MMLab da Universidade de Hong Kong e envolve quase 20 instituições acadêmicas.

De acordo com dados da QbitAI, o VPP2 demonstrou uma taxa média de sucesso de 32,26% e uma pontuação média de 39,26 em 42 tarefas com dois manipuladores RoboDojo. Essas tarefas testam aspectos como generalização, manipulação precisa, tarefas de longo horizonte, memória e instruções de vocabulário aberto. O modelo também ficou em primeiro lugar nas categorias de generalização, precisão e memória.

A Robotera enfatiza que o alcance desses resultados foi realizado sem o uso de dados de treinamento adicionais ou *add-ons*, como autoaperfeiçoamento recursivo baseado em agentes, utilizando exclusivamente o conjunto de dados padrão. O modelo de controle mais forte mencionado em sua pesquisa — GPT-6-Astra após treinamento adicional — obteve resultados de 22,48% e 28,97. A classificação corresponde aos números apresentados no artigo científico. Anteriormente, a empresa Simate havia anunciado seu sucesso com o sistema Simate-beta no RoboDojo.

O modelo VPP2 visa resolver uma fraqueza conhecida dos modelos de ponta mundial: se a previsão de vídeo estiver incorreta, a ação segue essa previsão. O processo de treinamento na Robotera é dividido em três etapas. A primeira etapa é o pré-treinamento de vídeo em nível de eventos, baseado na fonte aberta Wan2.1-I2V-14B da Alibaba. Ele treina o modelo para prever todo o processo de manipulação do início ao fim, usando clipes detalhadamente anotados de robôs, pessoas e materiais de vídeo gerais.

Em seguida, a previsão é reduzida a segmentos fixos de oito segundos e destilada em um único passo que leva cerca de 0,12 segundos. A terceira etapa envolve o uso do Action DiT com 0,9 bilhões de parâmetros, que aprende a traduzir previsões em movimento, enquanto o modelo de vídeo permanece congelado e se adapta apenas através de LoRA. A latência total para o bloco de ação é de aproximadamente 0,22 segundos.

Ao ser testado em um robô real de dois manipuladores ALOHA, o VPP2 mostrou uma média de 58,5% em 10 tipos de tarefas sem pré-treinamento, incluindo pegar, colocar, empilhar, dobrar e despejar. Isso é superior aos 40% do pi0.5 da Physical Intelligence, e o modelo foi o melhor em nove dessas tarefas. Ele obteve 45,0% no LIBERO-Pro e 63,9% no LIBERO-OOD. A adição de um modelo de visão e linguagem como planejador de alto nível aumentou os resultados das tarefas selecionadas de longo horizonte do RoboDojo de 27,6% para 57,6%.

A Robotera já utiliza robôs em mais de 10 centros logísticos em cinco províncias e cidades em parceria com empresas como China Post e SF Express, embora isso não signifique uma implementação completa do VPP2. O código do modelo está disponível publicamente no GitHub.

Histórias semelhantes

Plataforma de teste VA-Bench da Universidade de Tecnologia de Dalian mostra que os melhores modelos multimodais completam apenas metade das tarefas de robótica
Leia mais
pandaily.com

Plataforma de teste VA-Bench da Universidade de Tecnologia de Dalian mostra que os melhores modelos multimodais completam apenas metade das tarefas de robótica

Um grupo de pesquisa da Universidade de Tecnologia de Dalian apresentou o VA-Bench, um novo benchmark projetado para testar a capacidade de grandes modelos de linguagem multimodais universais de converter informações visuais em ações bem-sucedidas de um braço robótico.

Entre as doze configurações testadas, o melhor modelo, Qwen3.8-max da Alibaba, conseguiu completar em média 53,93% das tarefas. Isso indica que os modelos capazes de 'entender' a cena ainda enfrentam dificuldades na execução confiável das ações correspondentes.

A descrição do benchmark foi publicada em um artigo no arXiv (2609.19554) e na publicação chinesa Sina Tech. O VA-Bench avalia o ciclo completo do processo: observação, raciocínio, ação e correção. Antes de cada teste, o modelo visualiza um vídeo de demonstração bem-sucedida, mas não recebe coordenadas de objetos, trajetórias de especialistas ou parâmetros de ação precisos.

Durante o teste, o modelo pode mudar os ângulos da câmera autonomamente, o que aumenta o número de passos de interação, e deve fornecer comandos específicos: deslocamentos em milímetros em cada eixo, ângulos de rotação e instruções para abrir ou fechar a garra. Um controlador fixo executa estritamente as instruções fornecidas pelo modelo.

Escopo e Estrutura do Teste

O benchmark abrange 14 tipos de tarefas de manipulação, incluindo 11 tarefas com um braço e três tarefas com dois braços. Cada tarefa inclui 20 cenas fisicamente verificadas em simulação de física, totalizando 280 cenas base. Além disso, foram adicionadas variações de geometria e layout, bem como um percurso com cinco objetos que exige uma execução prolongada. Cada configuração de modelo foi executada três vezes.

Os principais modelos alcançaram 100% de precisão na localização de alvos e 99,6%–100% na compreensão da manipulação necessária, mas o sucesso geral da tarefa permaneceu em cerca de metade. Os modelos Opus-5 e GPT-5.6-sol, apresentados no exterior, seguiram o Qwen3.8-max, mostrando resultados de 52,86% e 51,55%, respectivamente. Os autores observam que os três líderes estão dentro de 2,38 pontos percentuais e não fazem declarações sobre classificação confiável. A porcentagem de conclusão das subtarefas variou de 65,9% a 68,6%, indicando que muitos falhos ocorrem após progresso parcial. Todas as outras condições apresentaram um resultado de 23,10% ou inferior.

Principais Problemas Identificados

Foram identificadas duas lacunas principais. O Qwen3.8-max conseguiu detectar erros em 73,6% dos casos, mas corrigiu-os online apenas em 46,7% dos casos. Sua eficácia foi de 65,61% em tarefas de um braço, mas apenas 11,11% em tarefas de dois braços, que exigem a distribuição de objetos entre cada braço e a coordenação de sua disposição mútua.

A observação ativa mostrou ser um fator mais significativo do que a presença de câmeras adicionais. Em uma análise comparativa, o Qwen3.8-max obteve sucesso em 57,50% das 280 cenas quando escolhia os pontos de vista, em comparação com 27,86% quando lhe eram fornecidos cinco pontos de vista fixos. Além disso, todos os quatro modelos testados recusaram-se a participar do teste sem observação ativa.

A alteração na forma de objetos, contêineres ou no layout, mantendo a mesma tarefa, reduziu o sucesso de um dos modelos de referência em mais de 30 pontos — de 80,00% para 47,86%. Ao mesmo tempo, o Qwen3.8-max reduziu seu índice de 77,86% para 67,86%. No percurso de execução prolongada, o Qwen3.8-max posicionou 61 de 100 objetos, mas nenhum modelo concluiu um episódio rigoroso.

Este benchmark difere da classificação 'embodied brain' SuperCLUE, publicada esta semana, porque o VA-Bench mede se os julgamentos de percepção, raciocínio e planejamento levam a uma ação física bem-sucedida, ao contrário do SuperCLUE, que avalia esses aspectos em si.

SemiDrive e Radxa apresentam controlador de movimento para robô RoboX D9M baseado em D9-Max
Leia mais
pandaily.com

SemiDrive e Radxa apresentam controlador de movimento para robô RoboX D9M baseado em D9-Max

A SemiDrive, fabricante de chips automotivos, e a Radxa, fabricante de hardware de código aberto, assinaram um acordo de cooperação estratégica em 29 de setembro e lançaram o RoboX D9M, um controlador de cérebro pronto para uso para robôs. No campo da robótica, o cérebro representa um nível de controle de movimento em tempo real que está sob a inteligência artificial de nível superior do robô.

Esta placa funciona com o System on Chip (SoC) D9-Max da SemiDrive. Ambas as empresas declararam que, graças a esta solução, os fabricantes de robôs são dispensados de desenvolver suas próprias placas de suporte, permitindo que as equipes se concentrem nos algoritmos de movimento e na definição do produto.

O chip D9-Max integra uma CPU de 12 núcleos com NPU de 8 TOPS e três pares de núcleos de clock Cortex-R5/R5F para operação em modo de execução síncrona. Ele suporta memória LPDDR4X de 4.266 MB/s e armazenamento eMMC 5.1, além de atender ao nível de segurança funcional ISO 26262 ASIL-B. A página do produto da SemiDrive indica que o isolamento de hardware permite que um único chip execute dois sistemas, separando o controle de movimento da interação, percepção, exibição e comunicação.

Os núcleos de clock de 800 MHz fornecem um tempo de resposta de interrupção de 25 nanossegundos e podem atuar como mestre EtherCAT, enquanto dois DSPs aceleram a resolução da cinemática inversa. O chip também é equipado com 12 canais CAN FD, Ethernet TSN dual gigabit, módulo de segurança de hardware e projetado para operar em temperaturas de -40 a 105 graus Celsius. A SemiDrive apresentou o D9-Max em maio de 2025 e informa que seus chips D9 estão em produção em massa com principais desenvolvedores de robôs humanoides.

O RoboX D9M integra este chip em uma placa de 100 x 100 mm, que possui EtherCAT integrado, vários canais CAN-FD e interfaces de barramento industrial RS485. A placa é fornecida com sistemas operacionais pré-instalados Linux 6.12.31, Ubuntu 26.04 LTS e ROS 2 Lyrical, e é destinada à conexão direta com robôs humanoides, máquinas quadrúpedes e manipuladores colaborativos. Este é o primeiro controlador de movimento especializado para IA incorporada da Radxa, vendido como um kit completo 'placa-SDK' para fabricantes de robôs humanoides e com rodas.

Além do próprio produto, os parceiros planejam trabalhar em conjunto em designs de referência de hardware, pilha de software de código aberto e comunidade global de desenvolvedores. A Radxa, fundada em 2012 e sediada em Shenzhen, fabrica computadores de placa única, módulos de sistema e plataformas de computação de borda. A SemiDrive afirma ter fornecido mais de 14 milhões de chips automotivos para mais de 70 marcas de automóveis e 170 modelos de veículos, e vê a robótica como parte de sua estratégia de transição de chips automotivos para inteligência incorporada. Qiu Yujing, fundadora e presidente da SemiDrive, observou que essa parceria une o poder computacional de classe automotiva com soluções de engenharia de código aberto da Radxa. Tang Liang, fundador da Radxa, afirmou que hoje o maior problema para os desenvolvedores de robôs não é o poder computacional, mas a lacuna de confiabilidade entre protótipos e produção em série. Informações sobre preços e disponibilidade ainda não foram divulgadas.

Popular