No dia em que Jensen Huang, CEO da NVIDIA, apoiou os modelos abertos de inteligência artificial em sua primeira postagem no X junto com 25 assinantes da indústria, a divisão Ant Group Bailing apresentou o modelo Ling-3.0-flash. Este modelo é um modelo de execução com um total de 124 bilhões de parâmetros, mas ativa apenas 5,1 bilhões de parâmetros, demonstrando uma densidade de inteligência superior à de seu modelo principal de trilhão de parâmetros.
Resultados dos Testes do Modelo
O Ling-3.0-flash obteve altos resultados em 34 áreas de avaliação, ficando em primeiro lugar em 15 casos e segundo em 19. A pontuação média foi de 67,6, equiparando-o ao DeepSeek V4 Flash. Além disso, o modelo superou seu próprio modelo de trilhão de parâmetros, o Ring-2.6-1T, em quase 8 pontos. O modelo atinge uma densidade de inteligência de 0,5 e um coeficiente de eficiência de 13,2, os mais altos entre modelos comparáveis, provando que o design direcionado de um modelo de execução pode superar a escalabilidade geral ao lidar com tarefas específicas.
Aplicação e Desempenho
O modelo foi desenvolvido como uma aposta estratégica na paradigma de modelos de execução, diferente dos modelos de raciocínio. O Ling-3.0-flash foca em velocidade e eficiência para tarefas de agentes em tempo real, codificação e chamada de funções. Por exemplo, no teste SWE-Bench Pro para correção de erros em repositórios de código, ele obteve 56,6% em primeiro lugar. No ArtifactsBench, projetado para criar componentes interativos completos em uma única passagem, ele alcançou 77,0%, superando o segundo lugar em mais de 10 pontos. No MiniAppBench, que exige a geração completa de um aplicativo a partir de uma única instrução, ele atingiu 25,3% contra uma média de 17% em 16 modelos.
Capacidades e Comparações
A precisão de chamada de função do BFCL-v4 atingiu 73,0%, igualando-se ao Claude-Sonnet-4.6 em primeiro lugar. Na avaliação de agente end-to-end GDPVal v2-AA, o modelo obteve 1107 pontos, o mais alto entre os modelos testados. O modelo suporta nativamente janelas de contexto de 256K, onde o MRCR_256K registrou 81,1%. O seguimento multi-turn de instruções Multi-IF atingiu 87,7% em segundo lugar. No teste LIFEBench sobre memória de longo prazo de instruções, ele ficou em primeiro lugar com um resultado de 77,3%. A capacidade de busca de agente WideSearch atingiu 73,6% em terceiro lugar, e no modo de colaboração multiagente, BrowseComp alcançou 82,0%, quase empatando com o Claude-Sonnet-4.6 (82,1%).
Significado Estratégico do Lançamento
O conjunto completo de avaliações orientadas a agentes posiciona o Ling-3.0-flash como otimizado para a paradigma de execução autônoma de tarefas, onde os modelos utilizam ferramentas, navegam por interfaces e executam objetivos multifásicos, em vez de gerar longas cadeias de raciocínio. A Ant Bailing tornou o modelo aberto, e os pesos estarão disponíveis após o término do período de teste gratuito da API em agosto. O lançamento do modelo simultaneamente com uma carta apoiada pela NVIDIA sinaliza que as empresas chinesas de IA continuam a adotar código aberto, apesar das discussões no Vale do Silício sobre seus riscos. O Ling-3.0-flash enfatiza a eficiência como característica distintiva: em vez de competir pelo número total de parâmetros, o modelo demonstra que, para cargas de trabalho de execução de agentes, um modelo de execução compacto bem projetado com treinamento direcionado pode superar modelos oito vezes maiores. Isso está alinhado com as tendências da indústria em direção a modelos específicos para tarefas, já que a economia de implantação de inferência se torna a principal limitação. O ranking semanal no OpenRouter subiu de 9º para 6º lugar em cinco dias, enquanto o volume de tráfego em julho foi apenas 0,5% menor do que o do DeepSeek V4 Pro, confirmando a demanda de mercado por modelos de execução eficientes.