DeepSeek lança versões TileLang, DeepGEMM e DeepEP para a plataforma Ascend da Huawei, apresentando SuperPoD Flex
Leia mais
Pandaily
pandaily.com

DeepSeek lança versões TileLang, DeepGEMM e DeepEP para a plataforma Ascend da Huawei, apresentando SuperPoD Flex

A empresa DeepSeek lançou em 30 de setembro um conjunto de componentes de infraestrutura para a plataforma de computação Ascend da Huawei. Esses componentes abrangem o suporte ao núcleo de programação TileLang para Ascend, bibliotecas de núcleos de computação e uma biblioteca de comunicação distribuída.

A DeepSeek declarou que cada um desses componentes corresponde às bibliotecas que a empresa havia lançado anteriormente para as GPUs NVIDIA, permitindo que os desenvolvedores utilizem as mesmas ferramentas em ambas as plataformas. Este lançamento vai além da simples adaptação de modelos, afetando o software subjacente aos próprios processos de treinamento e inferência da DeepSeek.

TileLang em destaque

O TileLang é um elemento chave. A DeepSeek afirma que esta linguagem simplifica a escrita de código em comparação com CUDA, mantendo a capacidade de utilizar os recursos do chip. A maioria dos operadores necessários para treinar a série V4 já foi implementada. A versão para Ascend encapsula instruções de baixo nível do Ascend C, e agora cada operador TileLang usado pela DeepSeek no treinamento possui uma implementação de alto desempenho para Ascend. A empresa espera que este port serve de modelo para softwares ecossistêmicos em diferentes chips de inteligência artificial.

Para multiplicação de matrizes, foi apresentado o DeepGEMM-Ascend, que é compatível com a API do DeepGEMM original e suporta os formatos BF16, FP8 e FP4 nos dispositivos Ascend 950. O TileKernels fornece uma interface única em Python tanto para GPU quanto para NPU da Huawei, e o FlashMLA lida com atenção esparsa, enquanto o DeepSelect garante a amostragem top-k para indexação e amostragem de atenção. O DeepEP-Ascend é responsável pela comunicação interprocesso tipo all-to-all para modelos de misturas de especialistas (mixture-of-experts) nos dispositivos NPU Ascend 950DT.

Na página do GitHub para NPU Ascend 950DT, a largura de banda de despacho FP8 é indicada na faixa de 373 a 375 GB/s e a largura de banda combinada de 345 a 347 GB/s com EP8, o que, segundo a DeepSeek, se aproxima dos limites de hardware. Esses indicadores foram obtidos usando um pacote de teste de firmware; a DeepSeek direciona os usuários para o lançamento comercial da Huawei, programado para cerca de 15 de outubro.

Suporte da Huawei e resultados de testes

A Huawei, à qual a DeepSeek expressou gratidão pelo apoio ilimitado, informou que forneceu o nó super SuperPoD Flex, definido em conjunto, bem como o esquema de interação de rede UBL128. Este esquema fornece uma rede de nível único escalável para 128 placas com largura de banda de 3,2 Tb/s e uma rede de escalonamento de dois níveis até 256 mil placas, além da biblioteca ASC-COMM para operadores de comunicação personalizados. A Huawei publicou um trabalho conjunto em sua comunidade CANN na forma de receitas, destacando a inferência de baixa latência com muitos especialistas, implantação em uma placa e um nó, treinamento em grande escala, pooling de cache KV de longo contexto e aprendizado por reforço baseado em agentes.

Em testes offline com configuração EP32 e contexto de 128 mil tokens, a Huawei relatou que o DeepSeek-V4.1-Flash atingiu uma velocidade de 2469 tokens de saída por segundo por placa com 5 ms por token de saída, e também 5102 tokens por segundo com 10 ms, excluindo o balanceamento de carga do framework e o agendamento de serviço. O anúncio não especificou se o V4 concluiu o treinamento em escala no Ascend.

Histórias semelhantes

DeepSeek lança a versão preliminar do Harness v0.2 com instaladores de desktop, gerenciador de plugins e automações planejadas
Leia mais
pandaily.com

DeepSeek lança a versão preliminar do Harness v0.2 com instaladores de desktop, gerenciador de plugins e automações planejadas

A DeepSeek lançou em 29 de setembro a versão preliminar do seu agente de código aberto, DeepSeek Harness, versão v0.2. Pela primeira vez, os usuários podem obter instaladores de desktop prontos para uso para os sistemas operacionais macOS com processadores Apple silicon e Windows de 64 bits através do site oficial do Harness.

Mais cedo esta semana, a publicação Pandaily relatou o surgimento de compilações preliminares do Electron, distribuídas pelo servidor de atualizações da DeepSeek, antes mesmo do anúncio oficial. A versão 0.2 representa um lançamento de desktop oficial e inclui vários recursos que vão além de um simples empacotador.

Inicialmente, o Harness surgiu como uma versão preliminar para desenvolvedores de código aberto, v0.1, em 13 de agosto. A adição mais significativa foi a seção de gerenciamento de plugins. Como o Harness é construído sob o princípio de que tudo é um plugin, a instalação de um plugin agora não requer o uso da linha de comando: os usuários inserem o nome do pacote de plugin npm em um campo especial e também podem desativar ou excluir plugins visualizando sua descrição e fonte em um só lugar.

No modo experimental de criação, os usuários podem descrever o plugin desejado em formato de diálogo, e o Harness gera ou modifica-o automaticamente; o novo plugin é ativado, salvo e exibido no gerenciador imediatamente. A DeepSeek observa que cerca de 60% dos usuários do Harness, incluindo usuários da API oficial do modelo, já utilizam plugins de terceiros. A empresa planeja criar um marketplace oficial de plugins e garantir uma API de plugins mais estável com menos mudanças que violem a compatibilidade.

A versão v0.0 também inclui um plugin integrado para tarefas de automação, que os usuários ativam através da página de plugins. Esta ferramenta permite transformar operações rotineiras em tarefas agendadas, fornecendo histórico de execução, capacidade de configurar a frequência e edição de instruções. Em uma análise prática, o recurso tecnológico ifanr descobriu que as tarefas agendadas continuam funcionando mesmo após o fechamento do aplicativo. Além disso, a página de plugins lista quatro recursos experimentais: comandos de agentes, verificação automática de autorização, tarefas de automação e entrada de voz, que carrega um pacote local de reconhecimento de fala de cerca de 1 GB.

A atualização também alterou a forma como os arquivos são exibidos, as pré-visualizações de conteúdo e as alterações de código. Os usuários podem fornecer ao Harness documentos, planilhas ou arquivos PDF para sistematizar materiais, analisar dados, gerar gráficos ou criar apresentações, ou pedir que ele faça alterações no projeto e execute o código. Os arquivos gerados e cada etapa das alterações de código são registrados no diálogo; um painel lateral mostra os arquivos e as diferenças (diffs), e os resultados podem ser abertos em aplicativos locais. Os usuários também têm a opção de ajustar o nível de detalhe do fluxo de trabalho do agente.

A DeepSeek afirma que o Harness se tornou o agente de código mais popular entre os usuários de sua API oficial, de acordo com as métricas de usuários ativos diários e sessões, ressaltando, no entanto, que o produto ainda está em estágio inicial de desenvolvimento. Os planos da empresa incluem fortalecer a areia de testes e a segurança, melhorar os comandos de agentes, memória de longo prazo personalizada, automação de navegador e interface gráfica, uso remoto e em dispositivos móveis, bem como compartilhamento de sessões e colaboração multiusuário. A empresa também pretende otimizar futuros modelos para aumentar o desempenho dentro do Harness.

Xiaomi libera pesos e recursos para os modelos MiMo-V2.6 Pro e MiMo-V2.6 Flash usando pilha RL
Leia mais
pandaily.com

Xiaomi libera pesos e recursos para os modelos MiMo-V2.6 Pro e MiMo-V2.6 Flash usando pilha RL

A Xiaomi disponibilizou publicamente pesos, documentação técnica e recursos de aprendizado por reforço (reinforcement learning) para sua série MiMo-V2.6. De acordo com notas em inglês da Xiaomi de 22 de setembro, os repositórios MiMo-V2.6-Pro e MiMo-V2.6-Flash foram publicados na plataforma Hugging Face juntamente com o código RL e mais de 7000 ambientes de teste.

Este lançamento consiste no fornecimento de pesos e código, o que difere da cobertura anterior do processo de treinamento RL através de transmissão ao vivo. A marca permanece inalterada: Xiaomi / MiMo.

Os modelos Pro e Flash são posicionados como modelos multimodais nativos, com uma janela de contexto declarada de um milhão de tokens. Os cartões dos modelos e relatórios adicionais em inglês indicam que o modelo Pro possui uma arquitetura de mistura esparsa de especialistas (sparse mixture-of-experts) com um total de parâmetros de cerca de 1,02 trilhão, utilizando ativamente aproximadamente 42 bilhões de parâmetros. O modelo Flash é avaliado em 309 bilhões de parâmetros totais com uma atividade de cerca de 15 bilhões.

A Xiaomi informa que cada modelo passou por 30 etapas de RL em aproximadamente 750.000 trajetórias em menos de seis dias. O processo utilizou uma mistura de tarefas, incluindo codificação, trabalho de agente geral, tarefas visuais e cibersegurança. Em cada atualização, foram utilizados cerca de 1568 solicitações e 16 execuções, e o volume de dados por etapa foi de 3,5 a 3,7 bilhões de tokens.

De acordo com a empresa, houve um aumento de desempenho nas tarefas de treinamento de cerca de 25% para o Flash e de 12% para o Pro. Além disso, foram observadas melhorias no DeepSWE v1.1: de 48,8 para cerca de 65,7 para o Flash e de 58,4 para cerca de 72,6 para o Pro, embora esses indicadores sejam dados fornecidos pelo fornecedor e exijam confirmação por terceiros.

Os ativos disponíveis vão além de simples checkpoints. A Xiaomi forneceu um framework RL abrangente, construído sobre verl e mecanismos de agentes relacionados, mais de 7000 ambientes classificados cobrindo desenvolvimento de software, reprodução de vulnerabilidades, trabalho intelectual e design web. Também estão disponíveis o ponto de partida Distill-Qwen-9B para experimentos da comunidade em RL e componentes leves para treinamento multicanal. O custo da API para as versões Pro e Flash hospedadas é declarado como correspondente ao MiMo-V2.5, enquanto o nível UltraSpeed promete uma largura de banda até 20 vezes maior que o Pro padrão mantendo a qualidade.

No entanto, os engenheiros ainda enfrentam custos elevados de manutenção de grandes MoE, e as declarações da Xiaomi sobre análise artificial e benchmarks de agentes necessitam de reprodução externa. A principal notícia é o pacote completo MiMo-V2.6 com pesos abertos, código RL e ambientes que os laboratórios podem estudar, em vez de apenas uma representação gráfica em transmissão ao vivo.

Popular