A empresa TaichuAI tornou o modelo ZDTaichu5.0-9B público. Este modelo fundamental multimodal possui aproximadamente 9 bilhões de parâmetros e é projetado para compreensão visual geral, raciocínio espacial, uso de ferramentas de agente e pesquisa em IA incorporada.
A arquitetura do modelo combina o backbone de linguagem Qwen3.5-9B com o codificador de visão C-RADIOv4-H. O modelo aceita texto, bem como uma ou mais imagens e vídeos de qualquer resolução, suportando um comprimento de contexto de até 128 mil tokens. A publicação, resumida pela TMTPost em 15 de setembro, concentrou-se na percepção do espaço no mundo real, transformações entre diferentes vistas e planejamento de tarefas para sistemas incorporados.
De acordo com o cartão público do modelo, a TaichuAI demonstra resultados de primeira linha entre os VLMs gerais de cerca de 10 bilhões, em uma ampla gama de tarefas visuais, além de expandir suas capacidades em cenários espaciais, incorporados e de agentes. Entre as métricas destacadas em espaço e incorporação estão ViewSpatial 62.50, MMSI-Bench 47.20, MindCube-tiny 78.27, ERQA 48.00 e RoboSpatial 56.00.
Em relação aos conjuntos de agentes e instruções mencionados nas notas de avaliação no cartão, o TAU2-Bench atinge 87.70, e a pontuação média do Claw-Eval é de 71.40, enquanto o IFEval mostra 93.70. O mecanismo de raciocínio adaptativo recursivo priorizado por entropia é descrito como um mecanismo que destaca etapas adicionais de refinamento de variáveis latentes para tokens mais complexos.
As capacidades do modelo abrangem reconhecimento óptico de caracteres (OCR) e compreensão de documentos, matemática em imagens, relações bidimensionais sutis, associação de múltiplas vistas, percepção de cenas tridimensionais e perspectiva, bem como rastreamento de múltiplas imagens e vídeos dentro de uma longa janela de contexto, incluindo planejamento de uso de ferramentas em várias etapas. No entanto, a execução real das ferramentas permanece responsabilidade da aplicação hospedeira.
Os tópicos de aprendizado espacial listados no cartão incluem relações relativas, contagem densa e quadros, movimento de câmera e ordenação de profundidade, vistas egocêntricas versus alocêntricas, bem como definição de alto nível de capacidades e planejamento de ações para adaptação no estilo VLA.
Os pesos do modelo estão disponíveis no Hugging Face em TaichuAI/ZDTaichu5.0-9B sob a licença NVIDIA Open Model License, mantendo os avisos Apache-2.0 do Qwen3.5. Para serviço, é usada uma branch customizada vLLM 0.26.0 e uma imagem Docker da TaichuAI para fornecer endpoints compatíveis com a OpenAI, com configurações de amostragem recomendadas para fixação espacial e tarefas gerais.
Assim como no caso de outros modelos apresentados por fornecedores, laboratórios externos devem considerar as pontuações dos benchmarks como declaradas com os prompts e juízes especificados até que os resultados de reprodução independente apareçam. No entanto, a combinação de um ponto de controle multimodal aberto de tamanho médio, foco em espaço e agentes, e um pacote vLLM pronto fornece aos pesquisadores um artefato concreto para avaliação.
