Alibaba lança modelo Qwen3.8-27B de código aberto com alto desempenho em codificação e agentes
Leia mais
Pandaily
pandaily.com

Alibaba lança modelo Qwen3.8-27B de código aberto com alto desempenho em codificação e agentes

A equipe da Alibaba apresentou o modelo Qwen3.8-27B de código aberto. Em dois dias, o modelo liderou a tendência global na plataforma Hugging Face, ultrapassando um milhão de downloads, incluindo a versão FP8; a versão quantizada Unsloth se aproximou de três milhões. Os desenvolvedores que realizaram os testes apelidaram-no de 'Opus Local 4.6', pois este modelo com menos de 30 bilhões de parâmetros supera todos os modelos lançados há quatro meses, incluindo o Opus 4.6, que era comparado com DeepSeek V4-Pro e GPT 5.6 Luna, tornando-se o primeiro modelo local a atingir o nível de desenvolvimento avançado. Na forma quantizada, ele funciona usando 17 GB de memória RAM.

O modelo é um modelo denso nativamente multimodal, capaz de entender imagens e vídeos. Ele possui um contexto nativo de 262K, que se expande para 1 milhão, e é distribuído sob a licença Apache 2.0, permitindo seu uso comercial.

Ao avaliar as habilidades de codificação e de agente, o Qwen3.8-27B obteve um resultado de 61.7 no SWE-bench Pro contra 53.4 do Opus 4.6 Max. No teste DeepSWE 1.1, ele alcançou 42.2, cerca de três vezes superior ao seu antecessor de 13.3. Os resultados em tarefas de escritório e de agente também são altos: o CoWorkBench mostrou 70.7 em comparação com 68.2 do Opus 4.6 Max, e o JobBench registrou 33.4. A pontuação Pass@1 para exames de agentes foi de 20.4, quase o dobro da versão anterior (10.6). Além disso, o IFBench recebeu 79.5, e o LiveCodeBench v6 alcançou 90.3, o maior resultado da tabela.

A multimodalidade é implementada nativamente na arquitetura, permitindo processar imagens e vídeos, desde gráficos STEM até vídeos de uma hora. Ao ser testado em operações de computador pelo padrão OSWorld, o modelo obteve 84.3, 11.6 pontos acima do Opus 4.6 Max. As operações de telefone no AndroidWorld são avaliadas em 81.9, e as operações de navegador, testadas no WebArena, atingiram 64.8, 9.5 pontos acima do seu antecessor. Na área de raciocínio visual sem ferramentas, o MathVision mostrou 90.0 contra 65.5, BabyVision — 65.7 contra 12.6, e a análise de gráficos CharXiv — 83.7 contra 66.0. A combinação da capacidade de ler capturas de tela, clicar em botões, preencher formulários, controlar navegadores e telefones, juntamente com habilidades de codificação, forma um ciclo completo de agente para executar operações de computador.

O tamanho de 27B é o mais procurado pela comunidade, pois permite hospedar o modelo em notebooks após a quantização usando GPUs de consumo. A versão Unsloth funciona com 17 GB de RAM, e a compressão Atomic Dynamic GGUF reduz o volume de 28.9 GB no formato de 8 bits para 8.5 GB no formato de 1 bit. No mesmo dia, surgiram ferramentas como SGLang, Ollama e vLLM. Os desenvolvedores destacam a incrível possibilidade de ter dispositivos superinteligentes ilimitados e gratuitos diretamente nas mesas de trabalho: com apenas uma RTX 5090, é possível obter inteligência equivalente ao Opus 4.8. Simon Williamson compartilhou que há muito tempo não sentia tal prazer ao trabalhar com um modelo local. Ele observou que o modo de pensamento padrão está ativado e pode ser desativado mediante solicitação, e o ajuste da profundidade de raciocínio (reasoning_effort) permite regular esse processo; Williamson descobriu que o valor xhigh faz o modelo pensar demais e aconselhou começar com um nível baixo ou nulo de raciocínio.

Assim, o Qwen3.8-27B eleva os indicadores em codificação e agentes ao nível do Opus, fornecendo controle sobre pesos, profundidade de pensamento e segurança de dados.

Popular