A situação, que começou como fan art, ganhou um caráter sério depois que uma foto do fundador da DeepSeek, Liang Wenfen, foi editada em um meme no estilo 'cara legal' nas redes sociais chinesas. Este meme serviu como catalisador para o lançamento do modelo DeepSeek V4 Flash.
O DeepSeek V4 Flash rapidamente conquistou popularidade, atingindo uma pontuação de 7,1 trilhões de tokens no ranking semanal global do OpenRouter e tornando-se instantaneamente o modelo mais usado no planeta. Graças a isso, a DeepSeek ocupou dois lugares no top cinco mundial, onde quatro posições são ocupadas por modelos chineses, e o GPT-5.6 Luna caiu para a sexta posição.
Os indicadores econômicos demonstram uma vantagem significativa. Um dia antes do lançamento do V4 Flash, a OpenAI reduziu o custo do GPT-5.6 Luna em 80%, estabelecendo o preço em US$ 0,2 por milhão de tokens de entrada e US$ 1,2 por milhão de tokens de saída. O DeepSeek V4 Flash estava disponível por cerca de US$ 0,14 por entrada e US$ 0,28 por saída, oferecendo um desconto de cache de 98% em comparação com os 90% padrão da indústria. O avaliador independente Artificial Analysis determinou o custo do V4 Flash para uma tarefa típica de agente em cerca de 60% inferior ao de Luna.
Além disso, o OpenCode registrou uma taxa de cache de 96%, o que reduziu o custo médio da sessão para US$ 0,06.
A diferença de desempenho não é mais significativa. Testes internos da DeepSeek mostram que o V4 Flash supera o V4 Pro Preview e o GLM 5.2, ficando atrás apenas do Opus-4.8. No entanto, a Artificial Analysis atribuiu a ele uma pontuação de 50 no índice de inteligência, enquanto Luna recebeu 51. No benchmark VulcanBench, o diretor técnico da Bold Metrics, Morgan Linton, descreveu o V4 Flash como 'excepcionalmente estável sob esforço moderado', destacando sua superioridade sobre Claude Fable e GPT-4.5.
Cerca de metade do tráfego do OpenRouter direcionado à DeepSeek agora vem de desenvolvedores dos EUA e Europa, indicando que este fenômeno vai além do mercado interno. O desenvolvimento de agentes é intencional: a arquitetura V4 Flash Preview é reutilizada, e após o treinamento, o foco é nas capacidades do agente. Um membro da equipe, Cui Tianyi, está contratando publicamente engenheiros para um novo grupo chamado Harness, que envolve o modelo com contexto, ferramentas, estado da tarefa e feedback, usando projetos abertos do GitHub como filtro de seleção.
Em maio, o agente DeepSeek-TUI, desenvolvido pelo desenvolvedor americano independente Hunter Boone, acumulou mais de 11.000 estrelas no GitHub em apenas alguns dias. A carta aberta de Boone, intitulada 'whale bros, I'm the American who builds DeepSeek-TUI', tornou-se um evento cultural que alcançou o Pacífico. Como os desenvolvedores estrangeiros apoiam esses modelos com suas escolhas, os LLMs abertos da China deixaram de ser apenas uma curiosidade; eles se tornaram um nível básico de relação custo-benefício que agora todos os outros devem superar.