O modelo DeepSeek V4-Flash tornou-se líder no ranking semanal do OpenRouter, processando 7,1 trilhões de tokens. Além disso, nove modelos chineses entraram no grupo dos dez líderes mundiais.
O modelo DeepSeek V4-Flash tornou-se líder no ranking semanal do OpenRouter, processando 7,1 trilhões de tokens. Além disso, nove modelos chineses entraram no grupo dos dez líderes mundiais.
De acordo com dados do OpenRouter, o DeepSeek V4-Flash alcançou o primeiro lugar em volume de chamadas de modelos apenas quatro dias após o lançamento da versão beta da API pública em 31 de julho. Na semana de 28 de julho a 3 de agosto, o modelo processou 7,1 trilhões de tokens. Os lugares de segundo a quinto também foram ocupados por produtos chineses: Xiaomi MiMo-V2.5 com 5,4 trilhões de tokens, Tencent Hy3 com 4,89 trilhões, DeepSeek V4-Pro com 3,1 trilhões e Zhipu GLM-5.2 com 2,87 trilhões. O modelo DeepSeek V4-Flash 0731 subiu sozinho para a oitava posição, processando 2,33 trilhões de tokens. Somente em 3 de agosto, a versão 0731 registrou 1,02 trilhão de tokens, superando a versão 0423 que dominava anteriormente.
O volume global semanal de chamadas de modelos de IA atingiu 56,8 trilhões de tokens. O volume semanal de chamadas de modelos chineses foi de 28,13 trilhões, superando os volumes dos EUA pela décima quarta semana consecutiva. Modelos chineses ocupam nove dos dez melhores lugares. A versão oficial V4-Flash utiliza a mesma arquitetura da versão preliminar: MoE, 284 bilhões de parâmetros compartilhados, dos quais 13 bilhões são ativados, com um contexto de 1 milhão de tokens. As mudanças se limitaram ao pós-treinamento: a versão oficial V4-Flash recebeu uma pontuação de 25,2 no teste Agent ultimate, aproximando-se do nível de 25,7 do Claude Opus-4.8, significativamente superior ao da versão preliminar V4-Pro, que obteve 15,8.
A precificação é praticamente inigualável: US$ 0,14 por milhão de tokens de entrada e US$ 0,28 por milhão de tokens de saída. Em testes ponderados por tarefas, o V4-Flash custa 3 centavos por tarefa, Kimi K3 custa 86 centavos, GPT-5.6 Sol custa US$ 1,86, e Claude Fable 5 custa US$ 3,15. Os custos operacionais representam menos de um por cento do produto principal Anthropic Claude Fable 5. Na rede social X, desenvolvedores escreveram que Musk deveria testar pessoalmente o V4 Flash, comparando-o com mágica. Os usuários então notaram que Elon Musk realmente seguiu a conta oficial do DeepSeek. Quase metade do tráfego do DeepSeek vem de desenvolvedores dos EUA e Europa, e muitos projetos de automação de agentes mudaram seus modelos padrão para o DeepSeek. Fundadores de vários startups estrangeiros de IA observaram publicamente que, após a migração completa para o DeepSeek, os custos mensais de inferência diminuíram em 60% a 85%.
Análises do setor indicam que o DeepSeek estabeleceu uma fronteira clara no mercado global de desenvolvedores. Essa fronteira não é apenas um limiar de desempenho, mas um equilíbrio entre preço e qualidade. Modelos que oferecem um nível de capacidade semelhante, mas com um preço significativamente mais alto, perderão constantemente desenvolvedores de médio porte; produtos mais fracos que o DeepSeek em desempenho, mas mais caros, enfrentarão um rápido estreitamento de seu espaço de sobrevivência. A OpenAI também sentiu a pressão: o GPT-5.6 Luna reduziu os preços em 80% em três semanas após o lançamento. Do beta público da API em 31 de julho até entrar no top de volume global de chamadas em 3 de agosto, o DeepSeek V4-Flash levou menos de uma semana.
O modelo DeepSeek V4 Flash demonstrou uma demanda colossal, consumindo 8 trilhões de tokens em apenas um dia na ferramenta OpenCode. Este volume excedeu a média diária da plataforma OpenRouter, que é de cerca de 6,6 trilhões de tokens. Este aumento no uso reflete uma mudança fundamental nos métodos de trabalho com IA: se antes a tarefa era concluída com uma simples pergunta e resposta, agora os agentes executam operações mais complexas, como leitura de arquivos, modificação de código, execução de programas e tentativas repetidas após erros, o que aumenta drasticamente o consumo de tokens.
Um exemplo dessa interação complexa foi mostrado por um usuário que criou um projeto de jogo 3D de página única usando o Claude Opus 5. Esse processo resultou em um único arquivo HTML que exigiu 690 milhões de tokens e custou quase 3000 yuans.
Com o surgimento de tarefas executadas por agentes, o critério de avaliação dos modelos mudou da qualidade de uma resposta individual para o custo de execução de uma tarefa longa. Por exemplo, um milhão de tokens de saída custou 2 yuans no DeepSeek, enquanto no Claude Opus 4.8 a mesma operação custou US$ 25, o que equivale a aproximadamente 170 yuans, demonstrando uma diferença de preço de 85 vezes. Embora no índice Artificial Analysis Intelligence Index v4.1 o modelo V4 Flash Max tenha obtido 50 pontos contra 56 do Opus Max, o custo para passar neste teste foi de US$ 72,02 para o V4 Flash contra US$ 3752,55 para o Opus, sendo que o Opus recebeu 6 pontos adicionais com um aumento de custo de cerca de 52 vezes.
O V4 Flash ainda não pode provar superioridade absoluta, mas se ambos os modelos estiverem na mesma lista de candidatos, a diferença de preço de 85 vezes pode mudar o padrão de escolha. Quando um modelo que supera o concorrente por apenas alguns pontos percentuais custa dezenas de vezes mais caro, a matemática da escolha deixa de favorecer a opção mais cara.
Os primeiros a sentir o impacto dessa tendência não são os modelos mais fracos, pois os pequenos modelos continuam adequados para roteamento, e os modelos de ponta continuam lidando com as tarefas mais complexas. Os modelos de nível médio são os mais vulneráveis — eles são mais fortes que o V4 Flash, mas custam dezenas de vezes mais e não são poderosos o suficiente para resolver as tarefas que o V4 Flash resolve. É isso que representa a 'linha de abate' do DeepSeek: os modelos não precisam ser os mais fortes, basta serem bons o suficiente para realizar a maioria das tarefas, utilizando a diferença de preço de quase duas ordens de magnitude para substituir opções mais caras da lista padrão.
No contexto de precificação, o Opus custa US$ 25 por milhão de tokens de saída, o Fable 5 custa US$ 50, e os modelos chineses incluem Qwen 3.8 Max por 36 yuans, Kimi K3 por 100 yuans e GLM 5.2 por 28 yuans.
A capacidade de vender o Mutai a preços de água mineral é determinada pelo custo direto de inferência por token, que depende dos parâmetros ativados, precisão, atenção, cache KV, comprimento da saída, uso de hardware e paralelismo. O V4 Flash possui 284 bilhões de parâmetros totais, mas ativa cerca de 13 bilhões para cada token, usando atenção híbrida, pesos de baixa precisão e otimização de cache. Em um contexto de um milhão de tokens, a carga computacional de inferência é de cerca de 10% do V3.2, e o tamanho do cache KV é de cerca de 7%. A série V4 reformulou o mecanismo de atenção, implementando mecanismos CSA compress-then-focus e HCA full-browse, além de usar o roteamento DeepSeekMoE, direcionando cada token para um pequeno subgrupo de especialistas. A precificação comercial e os custos de serviço seguem essas características técnicas. Assim, a 'linha de abate' redefine a fronteira do desenvolvimento: o fator decisivo torna-se a combinação de desempenho e preço, onde o custo de execução da tarefa é a métrica determinante.