A empresa DeepSeek tornou seu modelo V4 Pro público, apresentando o lançamento chamado DeepSeek-V4-Pro-0813 em sua página de preços. O modelo de nível principal é equipado com uma janela de contexto de 1 milhão de tokens e uma saída máxima de 384 mil tokens, utilizando por padrão o modo de raciocínio, mas também fornecendo um endpoint sem modo de raciocínio para solicitações sensíveis à latência.
A combinação de entrada de 1 milhão de tokens e saída de 384 mil tokens permite processar e gerar um volume significativamente maior de material em uma única chamada em comparação com a geração anterior, o que é especialmente relevante para trabalhar com grandes bases de código, extensos corpos de documentos e agentes multifásicos.
A DeepSeek também integrou recursos que a maioria dos desenvolvedores de agentes espera: saída estruturada em formato JSON, suporte a chamadas de ferramentas, Responses API e compatibilidade com Anthropic-API. Além disso, foi implementado o suporte beta para continuação com prefixo de conversa e conclusão FIM, sendo o FIM limitado ao modo sem raciocínio.
No nível de serviço, são oferecidos endpoints compatíveis tanto com OpenAI quanto com Anthropic, dando às equipes que já utilizam qualquer um desses padrões a possibilidade de mudar sem a necessidade de reestruturar sua infraestrutura.
A precificação reflete a divisão intencional dos níveis. O modelo Pro custa 0,025 yuans por milhão de tokens ao atingir o cache, 3 yuans por falhas de cache na entrada e 6 yuans na saída. Em contraste, o modelo Flash tem um preço de 0,02, 1 e 2 yuans, respectivamente, tornando o Pro cerca de três vezes mais caro que o Flash em falhas de cache na entrada e saída.
As diferenças também são destacadas pelas limitações de paralelismo: o Flash suporta 2500 solicitações simultâneas, enquanto o Pro é limitado a 500. Essa proporção indica uma estrutura de produto mais clara para a família V4. O Flash é voltado para tráfego de alta frequência com alta largura de banda, onde o custo domina, enquanto o Pro concentra o poder em tarefas de raciocínio mais pesadas, codificação com contexto longo e fluxos de trabalho de agentes, onde o modelo tem maior reserva de desempenho para uso.
No entanto, o preço absoluto do Pro permanece moderado nos padrões de modelos avançados, permitindo que a DeepSeek compense os custos após o recente anúncio de aumento de preços, permanecendo ainda mais barato do que a maioria dos concorrentes estrangeiros. Assim, a linha V4 representa uma oferta de dois caminhos: um nível Flash de baixo custo com alta largura de banda para escalabilidade e um nível Pro mais poderoso, focado em tarefas de codificação e uso de agentes.

