A partir de 17 de agosto, a DeepSeek começou a aplicar uma nova estrutura de preços para sua API. Os modelos de ponta DeepSeek-V4-Flash e DeepSeek-V4-Pro utilizam pela primeira vez tarifas diferenciadas, baseadas em horários de pico e fora de pico, sendo que as taxas em horários fora de pico são estabelecidas em metade das taxas de pico.
A nova estrutura tarifária prevê os seguintes preços para o DeepSeek-V4-Flash: 0,1 yuan por milhão de tokens na entrada com acerto em cache, 3 yuans na entrada sem acerto em cache e 9 yuans na saída. Em horários fora de pico, esses preços caem para 0,05, 1,5 e 4,5 yuans, respectivamente. O modelo mais avançado, DeepSeek-V4-Pro, custa 0,3, 9 e 27 yuans durante os horários de pico, e seu custo cai para 0,15, 4,5 e 13,5 yuans em horários fora de pico.
Os períodos de alta demanda são das 9:00 às 12:00 e das 14:00 às 18:00, horário de Pequim, diariamente, totalizando sete horas. As restantes dezessete horas são consideradas fora de pico. Tarefas que podem tolerar uma resposta mais lenta, como processamento em lote de dados, geração de código e avaliação de modelos, são recomendadas para serem transferidas para horários fora de pico para economizar custos.
Em comparação com a precificação anterior, as mudanças não se limitam a um simples dobramento. Para o V4-Pro, os preços antigos para entrada com acerto em cache, entrada sem acerto em cache e saída eram de 0,025, 3 e 6 yuans; agora, os preços de pico aumentaram em 1100%, 200% e 350%, respectivamente, enquanto os fora de pico aumentaram em 500%, 50% e 125%. O modelo V4-Flash também demonstrou um aumento notável: os preços anteriores eram de 0,02, 1 e 2 yuans, e os de pico mostram um aumento de 400%, 200% e 350%, com um aumento nos horários fora de pico de 150%, 50% e 125%. Assim, o aumento geral varia de 50% a 1100%, dependendo da combinação de modelo, tipo de token e horário de chamada.
A DeepSeek anunciou os novos preços em 13 de agosto, no mesmo dia em que lançou o DeepSeek-V4-Pro oficial. Este modelo, identificado como DeepSeek-V4-Pro-0813, suporta modos de raciocínio e sem ele, possui uma janela de contexto de 1 milhão de tokens e pode gerar até 384.000 tokens de saída, além de suportar nativamente chamadas de ferramentas, Responses API e Anthropic API. Os limites de requisições simultâneas são de 500 para o V4-Pro e 2.500 para o V4-Flash.
Este passo marca a transição das APIs de linguagem grande de uma precificação unificada para um planejamento detalhado de recursos computacionais. Os cálculos dos modelos consomem recursos de IA continuamente: as solicitações se concentram durante o horário de trabalho, enquanto o uso fora de pico diminui. Ao usar a alavanca de preços para estimular o uso distribuído, a DeepSeek pode aumentar a utilização de seus clusters de computação inteligentes e reduzir a carga nos horários de pico. Para os desenvolvedores, o planejamento de tarefas afeta diretamente as contas de tokens: conversas em tempo real e agentes online dificilmente evitarão os preços de pico, enquanto análises offline, tradução em lote, limpeza de dados e avaliação noturna têm mais oportunidades de serem adiadas.


