Durante o evento Huawei Connect 2026, David Wang, diretor presidente, apresentou o sistema de armazenamento de inteligência artificial OceanStor M900, projetado para clusters SuperPoDs usados para inferência em sistemas hiperescalares. Este produto visa resolver o problema da 'parede de memória', que surge quando as janelas de contexto atingem um milhão de tokens e as cargas de trabalho de agentes com múltiplas iterações aumentam o volume do cache KV além das capacidades de HBM e DRAM.
A Huawei posiciona o M900 como um espaço de memória comum de classe petabyte, permitindo que a infraestrutura de IA passe de um design orientado a computação para um projeto colaborativo de recursos de computação, rede e armazenamento. Na plataforma Lingqu OceanStor M900, o cache KV é agregado e distribuído, possibilitando expandir a memória do SuperPoD da memória de acesso rápido do dispositivo para unidades de estado sólido (SSD).
A empresa afirma que um único cluster pode atingir uma capacidade de 64 petabytes, convertendo o cache KV acessível de gigabytes para terabytes em um único NPU e aumentando a taxa de acerto de cache para reutilização de contexto longo. Essa abordagem considera o armazenamento como um complemento à memória de inferência, e não como um nível tradicional de backup ou objeto.
As principais declarações de desempenho estão relacionadas à arquitetura 'três em um', que inclui CPU, rede e controlador de disco, com suporte nativo à semântica KV. A Huawei afirma que os NPUs podem acessar SSDs em um único passo sem a necessidade de tradução de protocolo ou retransmissão através da CPU, reduzindo a latência de acesso de milissegundos para cerca de 60 microssegundos — uma redução de aproximadamente 90%. Além disso, o sistema fornece uma largura de banda agregada do cluster de cerca de 40 TB/s, cerca de 1,5 vezes maior do que nas soluções industriais anteriores. Em um cenário típico de codificação de IA, a Huawei afirma que a largura de banda de tokens pode dobrar e o tempo até o primeiro token pode ser reduzido pela metade.
O controle de custos é alcançado por meio de planejamento adaptativo consciente de KV, que prevê o valor e o ciclo de vida dos dados do cache KV em diferentes mídias. A Huawei declara a possibilidade de atingir até 24 DWPD e aumentar a vida útil das mídias SSD em cerca de 16 vezes, mantendo uma operação estável por três anos com menos substituições de discos. No entanto, operadores independentes precisarão verificar por conta própria as métricas de latência, largura de banda e durabilidade em seus SuperPoDs, mas o M900 é claramente posicionado como infraestrutura de memória para agentes e contexto longo, complementando, e não substituindo, soluções baseadas em chips Ascend ou interconexões NPO.
