A Ant Group apresentou e disponibilizou ao público o modelo Ling-3.0-flash-VL, que é o primeiro modelo nativo multimodal na linha Ling. O lançamento ocorreu através da organização inclusionAI nas plataformas Hugging Face e ModelScope.
O modelo é construído com base no backbone Ling-3.0-flash do tipo mixture-of-experts e possui um tamanho total de 124 bilhões de parâmetros, ativando cerca de 5,5 bilhões de parâmetros para cada token. Ele é capaz de aceitar como entrada imagens, texto e vídeo, e a empresa indica uma janela de contexto de 256 mil tokens para processar documentos longos e materiais de vídeo. Os pesos nos formatos BF16 e FP8 foram publicados em 9 de setembro, e versões nos formatos FP4 e INT4 estão planejadas em breve.
Uma decisão de design chave foi a implementação de um ciclo de feedback baseado em visão. Este ciclo considera a percepção não como uma etapa única de geração de legendas, mas como parte integrante de um fluxo de trabalho contínuo. O modelo é instruído a observar, agir, verificar e corrigir seus resultados com base em dados visualmente exibidos ou gerados.
A Ant Group posiciona este modelo para automação de interfaces gráficas de usuário (GUI), geração de código frontend e análise de relatórios médicos. Em testes relacionados à conversão de imagens em páginas web, o modelo demonstrou capacidade de restaurar as relações entre componentes e layout, após o que revisava o código gerado, comparando-o com os resultados de renderização. Sob o pseudônimo linthium na Image-to-WebDev Arena, a Ant Group relatou que seu desempenho superou o do GPT-5.4.
Como agente GUI, o modelo sabe analisar a estrutura da interface e correlacionar ações entre diferentes ferramentas. Em cenários de relatórios clínicos, ele destina-se a consolidar informações de diferentes documentos e identificar riscos, e não apenas resumir o conteúdo de uma página.
De acordo com a Ant Group, o treinamento conjunto usando dados multimodais nativos melhorou tanto as capacidades textuais quanto as habilidades visuais do modelo. De acordo com o índice Artificial Analysis Intelligence Index v4.1.1, o Ling-3.0-flash-VL recebeu uma pontuação de 42, quatro pontos acima da versão textual Ling-3.0-flash.
Os materiais do Hugging Face estruturam a avaliação em três áreas: compreensão, raciocínio e ação. Essas áreas incluem o trabalho com layouts e documentos complexos, verificações multifásicas baseadas em evidências e a execução de tarefas controladas por interface. Essa abordagem está alinhada com o objetivo estratégico da empresa de que os pesos multimodais abertos devem ajudar os agentes a fechar ciclos nos fluxos de trabalho de software e clínicos, e não apenas responder a perguntas visuais estáticas.
A arquitetura do modelo combina um codificador de visão de resolução arbitrária e um projetor de duas camadas com codificação temporal VideoRoPE, seguido por um tronco linguístico híbrido de 42 camadas. Este tronco alterna blocos KDA e gated MLA na proporção de 5:1. Graças ao MoE esparso, a carga computacional permanece baixa mesmo durante sessões longas de chat visual e histórico de ações do agente.
Demonstrações estão disponíveis no Ling Studio. Além dos pesos, foram documentadas receitas para SGLang e um fork do vLLM configurado para Ling, incluindo parsers para raciocínio e chamada de ferramentas, adaptados ao template de chat Ling-3.
Para desenvolvedores, este lançamento aberto representa não apenas mais um gerador de legendas, mas um stack multimodal Ling aberto inicial que integra a visão nos processos de planejamento e verificação para tarefas de agentes. É também o primeiro lançamento aberto do Ling a incluir um caminho multimodal nativo com um ciclo de feedback visual explícito, e não apenas um pacote de funções visuais anexado.
