A China Mobile Cloud apresentou um sistema híbrido doméstico para inferência mista de grandes modelos de linguagem (LLM), que combina unidades de processamento gráfico (GPU) e tecnologias neuromórficas. Este sistema foi demonstrado pela primeira vez na Conferência de Capacidade Computacional em Langfang, província de Hebei, em 2026.
O desenvolvimento desta pilha envolveu a China Mobile Cloud, juntamente com o Instituto de Pesquisa de Tecnologia Eletrônica da China Nanhu (China Electronics Technology Nanhu Research Institute), Lynxi, Iluvatar CoreX, Tsinghua University e Universidade de Pequim. Yu Jian, diretor técnico do laboratório neuromórfico e óptico da China Mobile Cloud, enfatizou que as capacidades neuromórficas visam acelerar os parques de GPU existentes, e não exigir sua substituição completa.
O conceito principal reside na clara divisão do trabalho do Transformer entre diferentes tipos de chips. Os cálculos de atenção permanecem nas GPUs domésticas da Iluvatar CoreX, utilizando sua largura de banda comum. Os blocos de rede de propagação direta (feed-forward network blocks), incluindo especialistas com mecanismo de mistura de especialistas (mixture-of-experts), que são críticos para a latência, são transferidos para o silício neuromórfico Lynxi. Este silício é otimizado para computação em memória e grande volume de SRAM no chip, o que ajuda a reduzir a pressão criada pela 'parede de memória' e 'parede de potência' em clusters em uma única arquitetura de GPU ao servir tokens com alta competitividade.
Para garantir a sincronização dessas duas estruturas, é usado um compilador de modelos desenvolvido internamente, um protocolo de interconexão de alta velocidade e um mecanismo de inferência unificado, que são responsáveis pela decomposição das tarefas, agendamento conjunto e agregação de resultados.
DeepSeek V4 Flash foi escolhido como carga de teste. A China Mobile Cloud afirma que, em comparação com outros clusters de GPU domésticos, esta pilha híbrida mais do que dobra o rendimento de inferência e a eficiência energética, além de reduzir os custos operacionais do negócio em mais de 40%. Os parceiros explicam esses indicadores pelo aumento devido à arquitetura baseada em processos domésticos maduros, focando no software do sistema e no posicionamento das cargas de trabalho, e não apenas na corrida de processos e nós. Eles também acreditam que este modelo pode ser replicado por outros operadores que já utilizam GPUs domésticas.
Os materiais da conferência também indicam que os próximos objetivos de implementação para essa divisão PD e Attention-FFN são fábricas de tokens, codificação de IA, conversão de texto em vídeo, interação multiagente, manufatura inteligente, bem como segurança financeira e de comunicações.
O consórcio declarou planos de continuar a aprimorar o motor heterogêneo e gradualmente abrir partes da estrutura principal para fabricantes domésticos de GPU, chips neuromórficos e operadores de computação. Para compradores de serviços de nuvem orientados ao custo por token, a estreia representa não tanto a coroação de um acelerador, mas sim um teste de se o agendamento Attention-on-GPU mais MoE FFN-on-neuromórfico pode manter a latência, o rendimento e a utilização depois que o tráfego sair do estande da conferência. No momento do lançamento, não foram publicados benchmarks independentes de clusters de terceiros, diferentes das configurações do DeepSeek V4 Flash dos parceiros; até que esses dados apareçam, a estreia na Conferência de Capacidade Computacional documenta principalmente uma receita reprodutível de software e silício, e não um SKU de capacidade pronto.
