A Zhipu AI anunciou oficialmente que o modelo anônimo Ox Alpha, conhecido nos círculos de desenvolvedores chineses como 'Niu Lai', é o recém-lançado modelo GLM-5.3-Flash. Antes do seu lançamento oficial, o modelo estava disponível gratuitamente para testes anônimos nas plataformas OpenRouter e OpenCode. Em cinco dias, os testes atraíram mais de 50 trilhões de tokens de tráfego, estabelecendo recordes de crescimento em ambas as plataformas. Além disso, o uso deste modelo excedeu os números do DeepSeek em mais de duas vezes.
A atenção do mercado foi atraída por um esclarecimento adicional da Zhipu: todo esse tráfego foi atendido usando chips domésticos. Na documentação técnica, a empresa indicou que seu serviço de inferência opera em um cluster composto por mais de 100.000 chips domésticos. A Zhipu declarou que 'a eficiência do hardware e o custo por token atingiram um nível comparável às principais GPUs da Nvidia'.
A firma de pesquisa em semicondutores SemiAnalysis comentou no X que atender cada solicitação usando silício doméstico com eficiência comparável à da Nvidia 'novamente coloca em teste o mar de CUDA', especialmente após o anúncio da OpenAI sobre seu próprio chip de inferência Jalapeño. A LatePost informou que esses chips podem ser produzidos pela Huawei, Moore Threads e Hygon, mas a Zhipu se recusou a confirmar fornecedores ou modelos específicos.
Para escalar até uma janela de contexto de um milhão de tokens, a Zhipu desenvolveu um motor de inferência especializado baseado em SGLang. Este motor utiliza quantização W8A8, quantização mista de cache INT8/FP8/BF16 e paralelismo de tensores em nível de nó. Além disso, foi implementada uma arquitetura que separa a codificação, o pré-processamento do prompt e a decodificação token por token, permitindo o planejamento independente de vários pools.
A empresa afirma que o desempenho do serviço ponta a ponta melhorou três vezes em comparação com a linha de base inicial no mesmo hardware. O modelo GLM-5.3-Flash possui um total de 320 bilhões de parâmetros, dos quais 18 bilhões estão ativados, o que corresponde aproximadamente ao DeepSeek V4 Flash. Ele alcança 57 pontos no Índice de Análise de Inteligência Artificial, comparável ao Claude Opus 4.8 e superior ao DeepSeek V4 Pro. O custo do modelo é de cerca de um décimo do preço do GLM-5.3 e um centésimo do preço do Claude Opus 4.8, tornando-o uma opção acessível em meio ao aumento geral dos preços dos modelos chineses.
