Cambricon adaptou o modelo DeepSeek-V4.1-Flash na pilha vLLM
Leia mais
Pandaily
pandaily.com

Cambricon adaptou o modelo DeepSeek-V4.1-Flash na pilha vLLM

A Cambricon anunciou a conclusão bem-sucedida da adaptação do modelo DeepSeek-V4.1-Flash no âmbito do programa Day-0, utilizando a pilha de inferência open-source vLLM. Isso significa que o modelo recém-lançado pode operar de forma estável nos aceleradores Cambricon no mesmo dia em que o DeepSeek publicou o checkpoint.

Este anúncio destaca a sinergia entre chip e software: disponibilidade simultânea do modelo e do chip, bem como a maturidade da abordagem da Cambricon, que combina NeuWare e vLLM. Não se trata de repetir informações sobre a disponibilidade geral do próprio modelo.

O DeepSeek-V4.1-Flash representa a versão mais leve da nova linha arquitetônica DeepSeek. É um modelo do tipo mixture-of-experts com 552 bilhões de parâmetros, que ativa cerca de 8 bilhões de parâmetros no lado de entrada e 16 bilhões no lado de saída, além de possuir compreensão integrada de visão multimodal. O DeepSeek destaca o uso da estrutura Causal-Encoder-Decoder e a compressão agressiva do cache KV, o que reduz a necessidade de HBM em aproximadamente um quarto e de SSD em um oitavo em comparação com a geração anterior, enquanto o tamanho do cache é centenas de vezes menor do que na primeira versão.

Essas economias de memória são criticamente importantes para os fabricantes de aceleradores que buscam controlar a latência de inferência, o volume de DRAM e os níveis de armazenamento em servidores densos que já estão sob pressão orçamentária de HBM.

Por sua vez, os engenheiros da Cambricon utilizaram a biblioteca de operadores unificados Torch-MLU-Ops para acelerar estruturas como Engram e Compressor, e escreveram kernels otimizados em BangC para pontos quentes de atenção esparsa e comprimida. Dentro do vLLM, a Cambricon declara suporte a paralelismo misto de cinco dimensões, abrangendo paralelismo tensorial, pipeline, sequencial, batch e especialista, com sobreposição de comunicação e computação, quantização de baixa precisão e separação de prefixo e decodificação para aumentar o throughput de ponta a ponta. Esta pilha opera na NeuWare, plataforma de software de longo prazo da empresa.

Alguns dias antes, a Cambricon juntou-se à PyTorch Foundation como membro platina, ocupando um assento no conselho de administração ao lado de outros grandes desenvolvedores de hardware e serviços em nuvem, sinalizando investimentos mais profundos no ecossistema de aprendizado e inferência abertos.

Agora, a Cambricon suporta inferência Day-0 para cinco principais linhas de modelos chineses: GLM, DeepSeek, Qwen, Kimi e MiniMax, representando Zhipu AI, DeepSeek, Alibaba, Moonshot AI e MiniMax, respectivamente. A publicação Caixin Global destacou especificamente a capacidade de incluir a Cambricon no mesmo dia como um sinal de redução dos ciclos internos de desenvolvimento de modelos e chips na China — uma transição de portos fechados de vários meses para prontidão em frameworks públicos que já são padronizados pelos operadores.

Para os operadores de cluster, a implicação prática é a disponibilidade conjunta: quando um modelo aberto avançado é lançado, os clientes da Cambricon podem usar a receita documentada do vLLM em vez de esperar por um fork fechado. O próximo teste para o ecossistema de software será a questão de saber se este esquema Day-0 se aplica às versões maiores do DeepSeek e às misturas de serviços multimodais.

Popular