Em Hangzhou, a operadora chinesa China Telecom, a empresa ZTE e a Zhonghao Xinying realizaram a implantação do primeiro cluster TPU do país, composto por 1024 chips e fornecendo um desempenho de 400 PFLOPS.
Em Hangzhou, a operadora chinesa China Telecom, a empresa ZTE e a Zhonghao Xinying realizaram a implantação do primeiro cluster TPU do país, composto por 1024 chips e fornecendo um desempenho de 400 PFLOPS.
A primeira versão do TPU, desenvolvida pela Zhonghao Xinying Chana TPU, está sendo usada na fase inicial de implementação. Planeja-se expandir o sistema para 10 mil PFLOPS usando a segunda geração de TPU Xuyu. Este novo chip é capaz de entregar 896 TFLOPS, o que é três vezes superior ao desempenho do Chana TPU com 50% menos consumo de energia.
As empresas de telecomunicações estão se tornando importantes campos de teste para chips de IA domésticos. Diferentemente dos provedores de nuvem, que podem otimizar o funcionamento para modelos específicos de GPU, as operadoras de telecomunicações atendem a diversos clientes corporativos que exigem ampla compatibilidade de modelos. De acordo com um relatório da Hangzhou Telecom, após o lançamento do cluster, a eficiência de saída de tokens aumentou mais de dez vezes, e o custo de um milhão de tokens caiu de aproximadamente 100 yuans para menos de 10 yuans.
O alcance dessas melhorias foi possível graças ao uso do agendamento com divisão Prefill-Decode. Este método separa o processamento de dados de entrada e a geração de saída, permitindo otimizar o uso do hardware para diferentes tipos de cargas de trabalho. A arquitetura TPU suporta nativamente a divisão PD, enquanto alcançar desempenho equivalente em GPUs requer modificações de software significativas.
Yang Gongyifan, CEO da Zhonghao Xinying, que anteriormente trabalhou na equipe do Google TPU, posiciona sua empresa como uma das poucas na China dedicada à arquitetura TPU. A arquitetura TPU, baseada em matrizes estilísticas e blocos de multiplicação de matriz em grande escala, é naturalmente otimizada para a lógica computacional das camadas de transformador, que é o padrão dominante em grandes modelos de linguagem. O segundo chip Xuyu suporta o agendamento nativo de divisão PD, o que reduz significativamente os custos de adaptação de software.
Ao implantar o cluster, um único nó super pode conectar diretamente até 2048 chips, resolvendo o problema de gargalo na comunicação interchip, que se torna crítico ao escalar para milhares de placas, onde os requisitos de largura de banda atingem níveis terabit. Os chips domésticos enfrentam a necessidade de adaptação no nível 100, enquanto os estrangeiros exigem apenas o nível 10, pois modelos e chips são atualizados simultaneamente em ritmo de sprint. A China Telecom fornece espaço real de data center, cargas de trabalho reais e faturamento real para levar os chips do estado de 'capazes de funcionar' para o estado de 'funcionam bem'. A parceria Zhonghao Xinying-ZTE-China Telecom forma uma cadeia de suprimentos nacional verticalmente integrada de sistemas de computação, e a expansão planejada para 10 mil PFLOPS destina-se ao treinamento de modelos ultragrandes.
Modelos de inteligência artificial chineses ocuparam 63,5% das consultas mundiais a grandes modelos de linguagem (LLMs), superando os EUA, que mantêm 35,5% do mercado até julho de 2026. O Xiaomi MiMo-V2.5 tornou-se o líder em volume de chamadas globais na plataforma OpenRouter, processando 10,5 trilhões de tokens por semana e 31,2 trilhões por mês.
De acordo com os dados, no período encerrado em 26 de julho, os modelos chineses demonstraram um aumento significativo em sua participação de mercado em comparação com o início de 2025, quando os modelos americanos dominavam as cargas de trabalho de IA global. Essa mudança é atribuída tanto à rápida melhoria na qualidade dos modelos chineses quanto às estratégias de preços agressivas que os tornam mais acessíveis para desenvolvedores em todo o mundo.
O crescimento da popularidade do Xiaomi MiMo-V2.5 foi particularmente notável. Desde o lançamento da versão beta pública em 23 de abril de 2026, o volume semanal de tokens aumentou de 1,46 trilhão em maio para 10,46 trilhões em julho, representando um aumento de 616% em dois meses. Este modelo é posicionado como um modelo base universal, projetado para a era dos agentes, suportando janelas de contexto de nível de milhões e compreensão completa de todas as modalidades: texto, imagens, vídeo, áudio e fala.
O modelo MiMo-V2.5 rapidamente ganhou reconhecimento entre os desenvolvedores devido ao preço competitivo e ao desempenho confiável em tarefas orientadas a agentes. Os dados têm várias implicações importantes para a indústria global de IA. Em primeiro lugar, o volume de inferência tornou-se um indicador mais revelador da adoção real de IA do que os benchmarks de qualidade tradicionais. Em segundo lugar, a escala de inferência indica que a luta pela fatia do mercado de IA mudou das capacidades de treinamento para a economia de inferência — a capacidade de atender bilhões de tokens com um custo unitário sustentável.
A concorrência interna chinesa contribui para a redução de preços e o aumento da qualidade, criando um ciclo positivo. As APIs chinesas tornaram-se o padrão para tarefas sensíveis a custos. Embora a Xiaomi tenha entrado no mercado mais tarde do que as empresas originalmente focadas em IA, ela conseguiu escalar mais rapidamente graças à integração de hardware e software e seu ecossistema de desenvolvedores.