XPeng atualiza modelo VLA de segunda geração, adicionando compreensão temporal e migrando para modelo de espaço-tempo 4D
Leia mais
Pandaily
pandaily.com

XPeng atualiza modelo VLA de segunda geração, adicionando compreensão temporal e migrando para modelo de espaço-tempo 4D

A XPeng apresentou a atualização mais significativa de seu modelo Vision-Language-Action (VLA) de segunda geração, sendo a mudança chave a capacidade da inteligência artificial de compreender aspectos temporais. Em uma apresentação sobre IA física com o tema 'TEMPO', a empresa anunciou que seu modelo base evoluiu de uma percepção espacial tridimensional estática para uma compreensão dinâmica quadridimensional do espaço-tempo com o lançamento do novo software XOS 6.3.0 no veículo G9L.

Este avanço é baseado em três tecnologias. Primeiro, o Infini-VLA, uma arquitetura de grande horizonte, é capaz de memorizar uma cena de tráfego por até 30 segundos, unindo eventos contínuos de condução em uma única compreensão temporal. Segundo, a tecnologia Streaming Inference transforma o funcionamento do modelo de raciocínio discreto para processamento paralelo contínuo, reduzindo a latência de ponta a ponta em 300%. Terceiro, o modelo de previsão de mundo X-Foresight antecipa o comportamento dos participantes do tráfego ao redor por até seis segundos, melhorando assim a reação a mudanças bruscas de faixa e frenagens repentinas.

Os parâmetros operando diretamente no dispositivo aumentaram 3,5 vezes — mais de 15 vezes mais do que nos modelos VLA principais, e a segurança multidimensional integrada melhorou 20 vezes. Além disso, a XPeng apresentou o Master Agent — um 'cérebro' universal que não está vinculado a um veículo específico e é construído sobre o modelo multimodal Omni. Este agente combina a percepção VLA com a cabine VLM, desvendando automaticamente as intenções do usuário e coordenando os sistemas de direção autônoma, chassi e cabine.

Novas funções ativadas por voz, como solicitar uma parada, efetivamente levam as capacidades de nível L4, inerentes aos táxis autônomos, para a produção em massa. Esta atualização ocorre enquanto a XPeng intensifica seu foco em IA física. Recentemente, sua divisão de robótica fechou sua primeira rodada de financiamento privado de mais de 900 milhões de dólares com uma avaliação superior a 6,3 bilhões de dólares — um recorde para uma única rodada no setor de inteligência incorporada na China. Os investidores foram IDG, Gaorong, Tencent e Alibaba.

Para a XPeng, o objetivo final é criar um modelo unificado do mundo físico que trate a condução, robôs e inteligência da cabine como uma única tarefa de raciocínio contínuo que considera o tempo, em vez de tarefas isoladas separadas. Ao incorporar o tempo no modelo, a empresa aposta que o próximo estágio do desenvolvimento da autonomia será menos parecido com simples percepção e mais com a compreensão do mundo em seu processo de desenvolvimento.

Popular