Alibaba lança pesos abertos do modelo Qwen3.8-2.4T-A95B como o primeiro modelo da classe Qwen-Max MoE
Leia mais
Pandaily
pandaily.com

Alibaba lança pesos abertos do modelo Qwen3.8-2.4T-A95B como o primeiro modelo da classe Qwen-Max MoE

A equipe da Alibaba Qwen publicou os pesos abertos para o modelo Qwen3.8-2.4T-A95B, apresentando-o como o primeiro modelo da classe Qwen-Max disponível para download, e não apenas via API. Este modelo esparso com especialistas (sparse mixture-of-experts checkpoint) contém cerca de 2,4 trilhões de parâmetros compartilhados e ativa aproximadamente 95 bilhões de parâmetros por token entre 512 especialistas, utilizando 10 especialistas roteados mais um especialista comum em cada etapa.

O lançamento deste modelo difere dos lançamentos abertos anteriores do Qwen, como Qwen-Drive e os checkpoints menores do Qwen3.8. Ele posiciona o MoE textual em larga escala para uso em ambientes próprios para tarefas de agente e raciocínio, e não como um modelo especializado para percepção ou codificação.

A arquitetura do modelo é baseada em um sistema de atenção híbrido que alterna camadas lineares com gating e atenção completa ao longo de 92 camadas. A maioria das camadas utiliza estado recorrente limitado em vez de cache de chave-valor crescente, enquanto uma pequena parte mantém a atenção par completa para interações de alta precisão. Essa abordagem visa manter os custos computacionais e o consumo de memória gerenciáveis à medida que a janela de contexto é escalada de um tamanho nativo de cerca de 262 mil tokens para aproximadamente um milhão com expansão. O comprimento máximo do texto de saída é de até 128 mil tokens.

Mecanismos integrados de controle de raciocínio permitem que os desenvolvedores ajustem o esforço para cada solicitação, trocando latência por rastreamentos multietapas mais profundos em tarefas de codificação, pesquisa, análise de documentos longos e fluxos de trabalho com ferramentas que acumulam prompts de sistema, resultados de ferramentas e planos intermediários.

Serviços de implantação foram rapidamente lançados junto com os pesos. A Amazon Web Services publicou um guia do SageMaker HyperPod demonstrando a implantação do modelo usando vLLM em instâncias ml.p6-b300. Este guia aborda a configuração do cluster, quantização NVFP4, permitindo o alojamento dos pesos em um nó de oito GPUs, chamada de ferramentas e decodificação especulativa com previsão multi-token, funcionando através de um endpoint compatível com OpenAI.

A NVIDIA também forneceu receitas para SGLang, vLLM e Dynamo no hardware GB300 NVL72, relatando velocidades superiores a 4000 tokens por segundo por GPU e mais de 350 tokens por segundo por usuário ao usar o formato FP8 em testes internos. Caminhos NeMo AutoModel estão disponíveis para treinamento supervisionado subsequente ou LoRA nos checkpoints do Hugging Face. Além disso, alguns provedores de inferência oferecem opções de hospedagem.

O checkpoint aberto está disponível apenas em formato de texto sob a licença Qwen3.8-Max com termos comerciais para operadores de serviços de grandes modelos. No entanto, o produto Qwen3.8-Max fornecido na nuvem pode diferir em termos de configurações visuais e modais. De acordo com os benchmarks apresentados pelo fornecedor, o modelo demonstra pontos fortes em pesquisa e seguimento de instruções, com potencial de melhoria em tarefas de repositório mais complexas.

Para equipes que necessitam de poder de classe Max dentro de sua própria infraestrutura, a notícia prática é a combinação de pesos baixáveis e receitas prontas para hospedagem em nuvem e aberta, disponíveis no mesmo período. Assim, o MoE de 2,4T agora pode ser executado onde os operadores já utilizam soluções padronizadas como vLLM e clusters de GPU gerenciados.

Popular