DeepSeek lançou o modelo DeepSeek-V4.1-Flash com arquitetura MoE, contexto de 1 milhão de tokens e compressão KV
Leia mais
Pandaily
pandaily.com

DeepSeek lançou o modelo DeepSeek-V4.1-Flash com arquitetura MoE, contexto de 1 milhão de tokens e compressão KV

A DeepSeek apresentou o modelo DeepSeek-V4.1-Flash, que é um modelo multimodal do tipo Mixture-of-Experts (MoE) com 552 bilhões de parâmetros. Este modelo é construído com base na arquitetura Causal Encoder–Decoder e suporta uma janela de contexto de um milhão de tokens. A empresa o posiciona como o menor membro da nova linha arquitetônica, voltada para aumentar as capacidades, acelerar a decodificação e aumentar o throughput durante a implantação, disponibilizando acesso via API chamada deepseek-flash.

O stack Causal Encoder–Decoder utiliza um transformador de 40 camadas, dividido em um codificador causal de 20 camadas e um decodificador de 20 camadas. Ao ativar o prefixo, cerca de 8 bilhões de parâmetros são ativados por token, e cerca de 16 bilhões durante a decodificação, permitindo que cargas de trabalho intensivas em entrada consumam menos recursos em comparação com designs MoE simétricos de tamanho semelhante.

Para otimização, são utilizados os métodos Compressed Sparse Attention 2 (CSA2), que distribui os modos Full, Reindex ou Reuse entre as camadas, e o cache KV FP4 principal, que reduz o volume total de KV para aproximadamente 890 bytes por token — o que representa cerca de um quarto do volume do DeepSeek-V4-Flash. Além disso, o SWA Bounded Replay reduz a demanda constante de KV no SSD para cerca de um oitavo.

O treinamento foi realizado com aproximadamente 45 trilhões de tokens multimodais, incluindo atenção esparsa em sequências de 64K, e a expansão do contexto para 1 milhão ocorreu posteriormente no processo de pré-treinamento. Isso foi seguido por ajuste fino supervisionado, aprendizado por reforço e destilação de política, acompanhados por intensa síntese automatizada de tarefas de agentes.

Em benchmarks para instruções de agentes, sob esforço máximo de raciocínio, a DeepSeek relata os seguintes resultados: Terminal-Bench 2.1 atinge 90.6, DeepSWE v1.1 — 74.2, e AutomationBench — 54.8. O modelo também possui suporte nativo à visão graças ao encoder DeepSeek-ViT, criado do zero.

Os pesos e receitas de inferência foram publicados no Hugging Face sob licença MIT, e a DeepSeek declara suporte a adaptadores de inferência de código aberto para implementações em larga escala. Os antigos pseudônimos V4 Flash estão sendo temporariamente redirecionados para V4.1-Flash; a DeepSeek também planeja abandonar o roteamento V4 Pro em favor do novo SKU Flash. O foco principal está na arquitetura e na inferência econômica com longo contexto, baseada em compressão KV e ativação assimétrica, tornando a manutenção de sessões de agentes com um milhão de tokens mais barata.

Histórias semelhantes

OpenBMB lança MiniCPM5-2B como modelo SOTA aberto para execução em dispositivo com menos de 4 bilhões de parâmetros
Leia mais
pandaily.com

OpenBMB lança MiniCPM5-2B como modelo SOTA aberto para execução em dispositivo com menos de 4 bilhões de parâmetros

A OpenBMB, um projeto de código aberto associado à ModelBest, apresentou o MiniCPM5-2B, um modelo de linguagem denso projetado para rodar diretamente em dispositivos. Este modelo possui aproximadamente 2,52 bilhões de parâmetros e suporta um comprimento de contexto nativo de 131.072 tokens, sendo distribuído sob a licença Apache-2.0.

O MiniCPM5-2B é o segundo lançamento da série MiniCPM5, sucedendo o MiniCPM5-1B. Ele utiliza a arquitetura padrão LlamaForCausalLM, que inclui 42 camadas com atenção agrupada (grouped-query attention), empregando 16 cabeças de consulta e 2 cabeças de chave/valor. Isso permite que os motores principais carreguem o modelo sem a necessidade de kernels personalizados ou forks do código do modelo.

Os parâmetros que não são embeddings somam cerca de 1,98 bilhões, permitindo que o modelo se enquadre na classe de menos de 4 bilhões de parâmetros, adequada para hospedagem em telefones, notebooks e dispositivos periféricos.

Em comparação com o conjunto de dados 34-benchmark da OpenBMB, o MiniCPM5-2B demonstra uma pontuação média de 53,9, superando várias modelos base abertas maiores. Entre elas, o Qwen3.5-4B obteve 51,1, e o granite-4.2-3B alcançou 42,7. Modelos de tamanho semelhante, como LFM2.5-2.6B e Qwen3.5-2B, ficaram atrás.

Os pontos fortes do modelo estão concentrados nas áreas de agentes codificadores, uso de ferramentas e extração de informações de contexto longo. Por exemplo, no LiveCodeBench v6, o MiniCPM5-2B obteve 69,1 contra 56,4 do Qwen3.5-4B, e no SWE-bench Verified, 46,4 contra 33,6. Resultados elevados também foram alcançados no τ²-Bench Telecom (97,1), BFCL v4 (66,6) e NoLiMa (68,1 contra 43,5).

Em tarefas que exigem conhecimento profundo, os resultados permanecem mais próximos do limite superior de tamanho; por exemplo, no MMLU-Pro, o modelo atingiu 70,8, enquanto o modelo de referência Qwen de 4B obteve 78,0. A OpenBMB destaca separadamente as linhas obtidas de fontes da Artificial Analysis para que os usuários possam distinguir dados de fornecedores de resultados de terceiros.

O processo pós-treinamento seguiu o gerenciamento de nível UltraData: inicialmente, foi realizado um ajuste fino supervisionado (supervised fine-tuning) baseado em raciocínio profundo usando cerca de 400 bilhões de tokens. Em seguida, foram aplicados professores especializados de aprendizado por reforço (reinforcement-learning teachers) para matemática, código, agentes e escrita usando o algoritmo JustRL II, baseado em crítica. A etapa final foi a destilação on-policy (on-policy distillation), que uniu 16 especialistas em RL — cinco deles agentes — em um único modelo aluno final.

A OpenBMB atribui o ganho médio de cerca de 10,96 pontos em tarefas de raciocínio e conjuntos gerais, bem como 6,96 pontos em conjuntos de agentes, à fase de RL e destilação. Para permitir a medição direta da contribuição de cada parte, a empresa lança checkpoints intermediários: Base, Midtrain e SFT-only.

Juntamente com os pesos, a UltraData publica os corpora de dados, abrangendo web, código, matemática, amostras SFT e RL para agentes, permitindo a reprodução dos resultados. O suporte de tempo de execução inclui vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX, LiteRT e compilações multi-chip FlagOS. Pacotes GGUF, MLX e GPTQ são fornecidos para assistentes locais que precisam executar chamadas de ferramentas e trabalhar com contexto longo sem usar uma GPU de data center.

Para desenvolvedores focados em execução em dispositivo, o MiniCPM5-2B é posicionado não tanto como um gigante de conhecimento geral, mas sim como um agente compacto com licença Apache e companheiro de codificação que já supera algumas modelos base abertas de classe 4B na pontuação média publicada.

DeepSeek lançou o V4.1-Flash, um novo modelo de IA mais rápido e com custos reduzidos
Leia mais
olhardigital.com.br

DeepSeek lançou o V4.1-Flash, um novo modelo de IA mais rápido e com custos reduzidos

A DeepSeek, empresa chinesa, introduziu o V4.1-Flash, seu mais recente modelo de inteligência artificial. Esta nova tecnologia foi apresentada como o menor dentro da sua família de modelos e promete oferecer respostas mais ágeis, maior capacidade de processamento e custos operacionais inferiores.

Este lançamento ocorre enquanto a DeepSeek se prepara para uma Oferta Pública Inicial (IPO) no mercado STAR, localizado em Xangai, conforme noticiado pela Reuters. Além disso, a companhia está implementando o V4.1-Flash, substituindo versões anteriores dos seus modelos.

Apesar de ser o modelo de menor porte na nova linha, o V4.1-Flash possui 552 bilhões de parâmetros, que são os componentes utilizados pela IA para processar dados e gerar saídas. No entanto, durante cada tarefa, ele utiliza apenas uma fração desses recursos, especificamente 8 bilhões de parâmetros para receber informações e 16 bilhões para formular as respostas.

O objetivo prático para o usuário é permitir que o modelo funcione com maior celeridade e consiga lidar com um volume superior de requisições sem demandar excessivos recursos computacionais. A DeepSeek também assegura que o sistema foi projetado para facilitar o desenvolvimento de modelos ainda maiores no futuro.

A empresa destacou que o V4.1-Flash apresenta "compreensão visual nativa", permitindo-lhe interpretar conteúdos visuais, como imagens. Testes realizados por diversas entidades indicaram que este novo modelo supera o V4-Pro em termos de desempenho, custo, velocidade e tempo total de execução.

Uma alteração significativa reside na maneira como o modelo armazena dados durante uma operação, o que historicamente poderia elevar os custos de serviços de IA de longa duração. Em comparação com a geração anterior, a DeepSeek afirmou que o V4.1-Flash exige menos recursos, o que, segundo a empresa, pode reduzir drasticamente os gastos, particularmente em agentes de IA e sistemas que executam tarefas com pouca intervenção humana.

O V4.1-Flash já está acessível através da API da DeepSeek, que possibilita a integração do modelo em outras aplicações. Os modelos V4-Flash e V4-Flash-Vision-Exp foram descontinuados e suas chamadas estão sendo redirecionadas temporariamente para o novo sistema.

Mais Informações:

O V4-Pro passará por uma retirada gradual. A partir de 14 de setembro de 2026, todas as solicitações direcionadas a ele serão automaticamente enviadas ao V4.1-Flash, aplicando-se a cobrança correspondente ao novo modelo. Este processo se estenderá até o lançamento do V4.1-Pro.

Os novos valores da API entrarão em vigor em 10 de setembro. A DeepSeek estabelece tarifas distintas para períodos de alta e baixa demanda; fora do horário de pico, o preço será metade da tarifa máxima. A empresa reforçou: "V4.1-Flash permite atender mais usuários a um custo menor. Estamos repassando essa economia para você."

Adicionalmente, a DeepSeek planeja colaborar com a comunidade de código aberto para expandir o suporte ao modelo e investigar outras metodologias de implementação. O relato sobre o lançamento do novo modelo foi inicialmente publicado no Olhar Digital.

Popular