A Robotera, que conta com o apoio da Universidade Tsinghua, anunciou que seu modelo de ponta mundial, VPP2, agora ocupa o primeiro lugar no RoboDojo. Este benchmark de simulação é supervisionado pelo MMLab da Universidade de Hong Kong e envolve quase 20 instituições acadêmicas.
De acordo com dados da QbitAI, o VPP2 demonstrou uma taxa média de sucesso de 32,26% e uma pontuação média de 39,26 em 42 tarefas com dois manipuladores RoboDojo. Essas tarefas testam aspectos como generalização, manipulação precisa, tarefas de longo horizonte, memória e instruções de vocabulário aberto. O modelo também ficou em primeiro lugar nas categorias de generalização, precisão e memória.
A Robotera enfatiza que o alcance desses resultados foi realizado sem o uso de dados de treinamento adicionais ou *add-ons*, como autoaperfeiçoamento recursivo baseado em agentes, utilizando exclusivamente o conjunto de dados padrão. O modelo de controle mais forte mencionado em sua pesquisa — GPT-6-Astra após treinamento adicional — obteve resultados de 22,48% e 28,97. A classificação corresponde aos números apresentados no artigo científico. Anteriormente, a empresa Simate havia anunciado seu sucesso com o sistema Simate-beta no RoboDojo.
O modelo VPP2 visa resolver uma fraqueza conhecida dos modelos de ponta mundial: se a previsão de vídeo estiver incorreta, a ação segue essa previsão. O processo de treinamento na Robotera é dividido em três etapas. A primeira etapa é o pré-treinamento de vídeo em nível de eventos, baseado na fonte aberta Wan2.1-I2V-14B da Alibaba. Ele treina o modelo para prever todo o processo de manipulação do início ao fim, usando clipes detalhadamente anotados de robôs, pessoas e materiais de vídeo gerais.
Em seguida, a previsão é reduzida a segmentos fixos de oito segundos e destilada em um único passo que leva cerca de 0,12 segundos. A terceira etapa envolve o uso do Action DiT com 0,9 bilhões de parâmetros, que aprende a traduzir previsões em movimento, enquanto o modelo de vídeo permanece congelado e se adapta apenas através de LoRA. A latência total para o bloco de ação é de aproximadamente 0,22 segundos.
Ao ser testado em um robô real de dois manipuladores ALOHA, o VPP2 mostrou uma média de 58,5% em 10 tipos de tarefas sem pré-treinamento, incluindo pegar, colocar, empilhar, dobrar e despejar. Isso é superior aos 40% do pi0.5 da Physical Intelligence, e o modelo foi o melhor em nove dessas tarefas. Ele obteve 45,0% no LIBERO-Pro e 63,9% no LIBERO-OOD. A adição de um modelo de visão e linguagem como planejador de alto nível aumentou os resultados das tarefas selecionadas de longo horizonte do RoboDojo de 27,6% para 57,6%.
A Robotera já utiliza robôs em mais de 10 centros logísticos em cinco províncias e cidades em parceria com empresas como China Post e SF Express, embora isso não signifique uma implementação completa do VPP2. O código do modelo está disponível publicamente no GitHub.


