Apesar do custo por token aparentemente mais baixo, os grandes modelos de linguagem (LLMs) chineses domésticos mostram-se muito caros para usuários pesados em cenários de desenvolvimento, quando o volume diário de consumo atinge dezenas de bilhões de tokens.
Diferença nos Custos Reais
Usuários chineses que realizam codificação intensiva com IA gastam 300 yuans por semana no Codex, enquanto o uso de modelos locais, como o GLM-5.2, custa-lhes 7800 yuans diariamente. O custo real não é determinado pela precificação por token, mas sim pelo fato de que os modelos estrangeiros oferecem assinaturas em pacotes que limitam os gastos dos usuários mais ativos.
Ao consumir dezenas de bilhões de tokens diariamente, o uso da API do GLM-5.2 custa cerca de 7800 yuans por dia, o que equivale a 1084 dólares americanos. Uma carga semelhante através da assinatura GPT Codex Pro custa aproximadamente 300 yuans por semana. Este paradoxo surge porque os modelos estrangeiros incluem o consumo de tokens em assinaturas mensais fixas, limitando efetivamente os custos para os usuários mais exigentes, enquanto os modelos chineses cobram estritamente por cada token sem ofertas de tarifas fixas.
Comparação das Ofertas de Preços
Em termos de preço por token, o GLM-5.2 demonstra uma taxa mais baixa (1,4/4,4 dólares americanos por milhão de tokens de entrada/saída) em comparação com o GPT-5.6 Sol (5/30 dólares americanos). No entanto, com um consumo diário de bilhões de tokens, a vantagem da tarifa em pacote muda completamente o quadro comparativo. Por exemplo, o Codex Plus custa 20 dólares americanos por mês, e o Pro começa em 100 dólares americanos por mês com uma cota 5 ou 20 vezes maior, mais o pagamento excedente via API. O Claude Code oferece Pro por 20 dólares americanos por mês e planos Max de 100 a 200 dólares americanos por mês.
A situação com o Alibaba Qoder CN também apresenta problemas: os planos individuais custam 59–169 yuans por mês por 2000–6000 créditos, que os usuários pesados consomem em poucos dias. Relata-se que cerca de 20–30 clientes corporativos interromperam a renovação após a reestruturação de preços. A versão corporativa do Qoder custa 199 yuans por assento por mês e é consumida em 3 dias com uso moderado ou em 1 dia com uso intenso.
Disponibilidade e Barreiras Técnicas
O acesso à assinatura do GLM-5.2 tornou-se extremamente difícil. O limite diário, lançado às 10h, é esgotado em poucos minutos, e o volume disponível desde janeiro de 2026 foi reduzido em 20% do original devido a restrições de capacidade computacional. Em horários de pico, é aplicada uma cobrança tripla de tokens, o que um desenvolvedor comparou a jogar roleta. De forma semelhante, o Kimi Code oferece tarifas de 49 a 699 yuans por mês com atualização semanal, mas também não possui um plano em pacote que torne as assinaturas estrangeiras vantajosas para usuários pesados.
Os fornecedores de modelos chineses explicam essa barreira pelos altos custos de computação durante a inferência. Diferentemente dos serviços de nuvem para inferência otimizados para processamento em lote com cache, os provedores chineses enfrentam custos de manutenção mais altos por token devido a janelas de contexto de cache menores e ineficiência insuficiente de agrupamento entre usuários em escala. Além disso, a realidade econômica é que os planos em pacote exigem alocação excessiva de capacidade computacional, algo que as empresas chinesas não podem arcar nas condições atuais de recursos computacionais limitados.
Segmentação de Mercado e Futuro
Esta estratégia de preços leva à segmentação do mercado: usuários leves se beneficiam do preço por token mais baixo na China, mas o segmento de desenvolvedores mais valioso é efetivamente subsidiado em favor dos modelos estrangeiros graças à vantagem do pacote de assinatura. Os modelos chineses ocupam 63,5% do volume mundial de inferência por meio de usuários leves e aplicativos sensíveis ao preço, enquanto os fluxos de codificação de IA de alta intensidade são direcionados para as assinaturas GPT e Claude. Para capturar a fatia de desenvolvedores, é necessário um plano de codificação com tarifa fixa correspondente ao custo semanal do Codex, mas isso exigirá poder computacional que atualmente está limitado para as empresas de IA.