Modelo Qwen3.8-27B estabelece um novo padrão de desempenho para execução local em hardware de consumo
Leia mais
Pandaily
pandaily.com

Modelo Qwen3.8-27B estabelece um novo padrão de desempenho para execução local em hardware de consumo

Desenvolvedores que trabalham com modelos abertos frequentemente criam memes, e um dos conceitos populares dos últimos meses é o 'kill line' — um termo de jogos que designa o momento em que uma partida está efetivamente encerrada. Aplicado a modelos, este termo foi usado anteriormente para descrever o DeepSeek: um novo modelo era comparado ao DeepSeek em termos de capacidades e preço; se o desempenho não correspondesse e o preço não diminuísse, o modelo era considerado sem valor de discussão. No entanto, essa linha está mudando agora.

Em 14 de agosto, o Qwen3.8-27B foi lançado, e em apenas dois dias acumulou um milhão de downloads, liderando a lista global de tendências no Hugging Face. Entre os desenvolvedores do agente de código Cline, tornou-se o modelo local mais procurado em quatro dias. A Artificial Analysis atribuiu-lhe uma pontuação de 52, a mesma de GPT-5.6 Luna e DeepSeek V4 Flash, e os desenvolvedores apelidaram-no de Opus 4.6 local. Este modelo está em constante desenvolvimento e lida particularmente bem com raciocínio, gerando significativamente mais tokens de raciocínio do que seus concorrentes. Simon Wilson descobriu que, por padrão, seu nível exigiu 21 minutos para gerar uma imagem de um pelicano de bicicleta no formato SVG.

É importante notar, no entanto, que o modelo possui apenas 27 bilhões de parâmetros. Capacidades que exigiam centenas de bilhões há poucos meses agora cabem em um tamanho que pode ser contido em hardware de consumo. Após a quantização para 4 bits, os pesos são reduzidos para cerca de 17 GB, o que é acessível para uma placa de vídeo de 24 GB ou um dispositivo Apple Silicon com grande quantidade de memória. O antigo dilema era que ou o modelo funcional não era inteligente o suficiente, ou o modelo inteligente não conseguia ser executado; o Qwen3.8-27B permite que essas duas condições coincidam em um tamanho prático.

Qualquer novo modelo será avaliado agora em comparação com o Qwen3.8-27B. A antiga 'kill line' do DeepSeek baseava-se na relação custo-benefício, mas isso ainda exigia recursos de nuvem. Um agente de código pode consumir centenas de milhares de tokens, e em meados de agosto, o DeepSeek aumentou seu preço, estabelecendo o custo máximo de saída do V4-Pro de 6 para 27 yuans por milhão de tokens. Os últimos dois anos foram dedicados à questão: cujos tokens são mais baratos com o mesmo nível de inteligência? O Qwen3.8-27B vai além, levantando a questão: quão grande deve ser o modelo? Um modelo de 27 bilhões de parâmetros, realizando a maior parte do trabalho de um modelo de ponta, muda os limites físicos de implantação.

Este avanço também tem raízes técnicas. O caminho industrial para a redução de custos foi baseado por muito tempo no MoE (Mixture of Experts), que aumenta a capacidade ativando apenas uma parte dos especialistas. No entanto, o MoE tem um problema invisível na nuvem, mas doloroso em dispositivos: os especialistas inativos ainda existem, portanto, os pesos gerais devem ser armazenados. Assim, o MoE é adequado para data centers, enquanto PCs, robôs e dispositivos periféricos se preocupam se o modelo caberá. O Qwen3.8-27B é um modelo denso, portanto, a eficiência é alcançada através da arquitetura: ele usa uma abordagem híbrida com 48 de 64 camadas, aplicando atenção linear e atenção completa às restantes, o que impede que o cache KV de longo contexto se expanda proporcionalmente ao comprimento da sequência.

Popular