A empresa DeepSeek lançou em 30 de setembro um conjunto de componentes de infraestrutura para a plataforma de computação Ascend da Huawei. Esses componentes abrangem o suporte ao núcleo de programação TileLang para Ascend, bibliotecas de núcleos de computação e uma biblioteca de comunicação distribuída.
A DeepSeek declarou que cada um desses componentes corresponde às bibliotecas que a empresa havia lançado anteriormente para as GPUs NVIDIA, permitindo que os desenvolvedores utilizem as mesmas ferramentas em ambas as plataformas. Este lançamento vai além da simples adaptação de modelos, afetando o software subjacente aos próprios processos de treinamento e inferência da DeepSeek.
TileLang em destaque
O TileLang é um elemento chave. A DeepSeek afirma que esta linguagem simplifica a escrita de código em comparação com CUDA, mantendo a capacidade de utilizar os recursos do chip. A maioria dos operadores necessários para treinar a série V4 já foi implementada. A versão para Ascend encapsula instruções de baixo nível do Ascend C, e agora cada operador TileLang usado pela DeepSeek no treinamento possui uma implementação de alto desempenho para Ascend. A empresa espera que este port serve de modelo para softwares ecossistêmicos em diferentes chips de inteligência artificial.
Para multiplicação de matrizes, foi apresentado o DeepGEMM-Ascend, que é compatível com a API do DeepGEMM original e suporta os formatos BF16, FP8 e FP4 nos dispositivos Ascend 950. O TileKernels fornece uma interface única em Python tanto para GPU quanto para NPU da Huawei, e o FlashMLA lida com atenção esparsa, enquanto o DeepSelect garante a amostragem top-k para indexação e amostragem de atenção. O DeepEP-Ascend é responsável pela comunicação interprocesso tipo all-to-all para modelos de misturas de especialistas (mixture-of-experts) nos dispositivos NPU Ascend 950DT.
Na página do GitHub para NPU Ascend 950DT, a largura de banda de despacho FP8 é indicada na faixa de 373 a 375 GB/s e a largura de banda combinada de 345 a 347 GB/s com EP8, o que, segundo a DeepSeek, se aproxima dos limites de hardware. Esses indicadores foram obtidos usando um pacote de teste de firmware; a DeepSeek direciona os usuários para o lançamento comercial da Huawei, programado para cerca de 15 de outubro.
Suporte da Huawei e resultados de testes
A Huawei, à qual a DeepSeek expressou gratidão pelo apoio ilimitado, informou que forneceu o nó super SuperPoD Flex, definido em conjunto, bem como o esquema de interação de rede UBL128. Este esquema fornece uma rede de nível único escalável para 128 placas com largura de banda de 3,2 Tb/s e uma rede de escalonamento de dois níveis até 256 mil placas, além da biblioteca ASC-COMM para operadores de comunicação personalizados. A Huawei publicou um trabalho conjunto em sua comunidade CANN na forma de receitas, destacando a inferência de baixa latência com muitos especialistas, implantação em uma placa e um nó, treinamento em grande escala, pooling de cache KV de longo contexto e aprendizado por reforço baseado em agentes.
Em testes offline com configuração EP32 e contexto de 128 mil tokens, a Huawei relatou que o DeepSeek-V4.1-Flash atingiu uma velocidade de 2469 tokens de saída por segundo por placa com 5 ms por token de saída, e também 5102 tokens por segundo com 10 ms, excluindo o balanceamento de carga do framework e o agendamento de serviço. O anúncio não especificou se o V4 concluiu o treinamento em escala no Ascend.


