A DeepSeek apresentou o modelo DeepSeek-V4.1-Flash, que é um modelo multimodal do tipo Mixture-of-Experts (MoE) com 552 bilhões de parâmetros. Este modelo é construído com base na arquitetura Causal Encoder–Decoder e suporta uma janela de contexto de um milhão de tokens. A empresa o posiciona como o menor membro da nova linha arquitetônica, voltada para aumentar as capacidades, acelerar a decodificação e aumentar o throughput durante a implantação, disponibilizando acesso via API chamada deepseek-flash.
O stack Causal Encoder–Decoder utiliza um transformador de 40 camadas, dividido em um codificador causal de 20 camadas e um decodificador de 20 camadas. Ao ativar o prefixo, cerca de 8 bilhões de parâmetros são ativados por token, e cerca de 16 bilhões durante a decodificação, permitindo que cargas de trabalho intensivas em entrada consumam menos recursos em comparação com designs MoE simétricos de tamanho semelhante.
Para otimização, são utilizados os métodos Compressed Sparse Attention 2 (CSA2), que distribui os modos Full, Reindex ou Reuse entre as camadas, e o cache KV FP4 principal, que reduz o volume total de KV para aproximadamente 890 bytes por token — o que representa cerca de um quarto do volume do DeepSeek-V4-Flash. Além disso, o SWA Bounded Replay reduz a demanda constante de KV no SSD para cerca de um oitavo.
O treinamento foi realizado com aproximadamente 45 trilhões de tokens multimodais, incluindo atenção esparsa em sequências de 64K, e a expansão do contexto para 1 milhão ocorreu posteriormente no processo de pré-treinamento. Isso foi seguido por ajuste fino supervisionado, aprendizado por reforço e destilação de política, acompanhados por intensa síntese automatizada de tarefas de agentes.
Em benchmarks para instruções de agentes, sob esforço máximo de raciocínio, a DeepSeek relata os seguintes resultados: Terminal-Bench 2.1 atinge 90.6, DeepSWE v1.1 — 74.2, e AutomationBench — 54.8. O modelo também possui suporte nativo à visão graças ao encoder DeepSeek-ViT, criado do zero.
Os pesos e receitas de inferência foram publicados no Hugging Face sob licença MIT, e a DeepSeek declara suporte a adaptadores de inferência de código aberto para implementações em larga escala. Os antigos pseudônimos V4 Flash estão sendo temporariamente redirecionados para V4.1-Flash; a DeepSeek também planeja abandonar o roteamento V4 Pro em favor do novo SKU Flash. O foco principal está na arquitetura e na inferência econômica com longo contexto, baseada em compressão KV e ativação assimétrica, tornando a manutenção de sessões de agentes com um milhão de tokens mais barata.


