A DeepSeek lançou uma versão beta interna limitada do modelo DeepSeek V4.1 Flash. Este ponto de controle intermediário é construído sobre uma nova arquitetura que suporta nativamente a multimodalidade.
A DeepSeek posiciona este lançamento como mais rápido, poderoso e econômico em comparação com as versões Flash anteriores. No entanto, durante um período de teste estritamente limitado, a precificação do nível Flash é mantida. O acesso está disponível até o vencimento do identificador do modelo.
Os desenvolvedores podem usar a pré-visualização sem alterar a URL base da sua API existente. O identificador do modelo é deepseek-v4.1-flash-expires-on-0910. Os pagamentos durante o teste beta correspondem ao DeepSeek V4 Flash, mas cada conta é limitada a 20 solicitações simultâneas, o que é significativamente inferior à capacidade de produção do Flash. Assim, este período é claramente destinado à avaliação, e não ao tráfego ativo.
A data indicada no nome do modelo sinaliza que este identificador deixará de funcionar por volta de 10 de setembro de 2026, deixando cerca de dois dias de acesso a partir do lançamento em 8 de setembro.
Do ponto de vista arquitetônico, o V4.1 Flash difere do experimento inicial V4 Flash Vision, que anexava um pacote de extensão separado para processamento de imagens ao modelo de texto. A DeepSeek afirma que a entrada multimodal agora é parte integrante da arquitetura redesenhada. Isso significa que texto e imagens, bem como outras modalidades relacionadas, são processados dentro de um único stack, em vez de passar por um caminho externo de codificador seguido pela inserção de dados.
Para a linha de produtos otimizada para latência, essa mudança tem menor importância como declaração de desempenho visual de pico, e mais como uma tentativa de evitar o atraso adicional que a visão estilo plugin frequentemente adiciona quando as imagens precisam ser convertidas antes de entrar na sequência de linguagem.
Relatórios iniciais de desenvolvedores obtidos durante os testes beta indicam geração estável em uma faixa de aproximadamente 300 a 500 tokens por segundo com baixa paralelização. A geração é descrita como relativamente estável para ciclos de codificação iterativa e prototipagem de interface do usuário, onde tentativas repetidas frequentes são mais importantes do que uma única sequência longa concluída. Deve-se notar que esses números são observações da comunidade, e não benchmarks oficiais; a DeepSeek não publicou o número de parâmetros, o comprimento do contexto ou tabelas de avaliação formais para esta compilação intermediária.
Um questionário de feedback anexado ao teste pergunta se os usuários acreditam que o modelo pode substituir o DeepSeek V4 Pro em ambientes online. Isso indica que a empresa está explorando a possibilidade de alcançar utilidade de nível Pro com a velocidade e o preço do Flash, sem abrir mão da estrutura de custos do Flash.
No geral, o identificador de tempo limitado, o limite de paralelismo e a pesquisa sobre a substituição do Pro representam o V4.1 Flash como uma pré-visualização multimodal temporária de nível Flash de uma nova arquitetura, e não um SKU permanente. Desenvolvedores que necessitam dessa funcionalidade devem testar o modelo antes que seu identificador expire; aqueles que planejam cargas de trabalho precisarão de um lançamento subsequente com maior paralelismo, limitações documentadas e um nome imutável antes de considerar a nova arquitetura como infraestrutura padrão.
