DeepSeek lança seu primeiro modelo multimodal nativo de código aberto, V4-Flash-Vision-Exp
Leia mais
Pandaily
pandaily.com

DeepSeek lança seu primeiro modelo multimodal nativo de código aberto, V4-Flash-Vision-Exp

A empresa DeepSeek apresentou seu primeiro modelo multimodal nativo. O modelo DeepSeek-V4-Flash-Vision-Exp foi disponibilizado na plataforma Hugging Face em 31 de agosto sob licença MIT, marcando o suporte inicial à entrada de imagens na série V4 juntamente com texto.

O lançamento inclui os arquivos do modelo, o tokenizador, uma implementação mínima para codificação de prompts e uma implementação mínima de inferência em PyTorch. Esta implementação abrange o codificador visual, o alinhador (aligner), o atenção DFlash, a camada de roteamento de mistura de especialistas (mixture-of-experts routing layer), os módulos Hyper-Connections e DSpark.

A DeepSeek observou que o peso do modelo é uma compilação experimental 'Exp'; anteriormente, o modelo estava disponível através da API DeepSeek desde 21 de agosto. Graças às capacidades visuais, o modelo pode descrever imagens, ler texto em capturas de tela e analisar gráficos, aceitando entradas nos formatos JPEG, PNG, GIF e WebP.

Em tarefas baseadas exclusivamente em texto — como raciocínio, agentes e conhecimento mundial — a empresa afirma que o desempenho corresponde à versão V4-Flash, mantendo seus pontos fortes anteriores. No entanto, em benchmarks para agentes que exigem compreensão visual, o modelo supera significativamente o V4-Flash, aproximando as capacidades do agente multimodal ao nível do Claude Opus 4.8.

Ao abrir o stack de inferência e os próprios pesos, a DeepSeek posiciona este modelo para integração em vários frameworks e ferramentas para agentes, expandindo sua estratégia de pesos abertos de tarefas textuais para tarefas com suporte à visão. Para desenvolvedores e empresas, este lançamento reduz a barreira de entrada para implantação local de um modelo competitivo com capacidades visuais ou uso de infraestrutura padrão, alinhando-se à tendência setorial de modelos abertos econômicos e personalizáveis.

Modelos capazes de trabalhar com dados visuais tornaram-se elementos chave no mercado de agentes de IA, pois os desenvolvedores combinam capturas de tela e imagens reais com funções de raciocínio. O passo da DeepSeek segue a tendência crescente de lançamentos multimodais abertos de laboratórios chineses, que utilizam licenças permissivas e precificação agressiva para ganhar popularidade nas plataformas de desenvolvedores dos EUA, catálogos de serviços em nuvem e menus de modelos corporativos.

Como o modelo é relativamente leve para seu nível de peso e vem com uma referência mínima de inferência, as equipes podem implementá-lo rapidamente sem a necessidade de ferramentas de orquestração proprietárias. A empresa declarou que continuará a aprimorar a linha V4, usando a compilação experimental com função de visão como meio de verificar decisões arquitetônicas — componentes do alinhador, DSpark e Hyper-Connections — antes de um lançamento multimodal mais amplo. Atualmente, a flag experimental indica a necessidade de cautela: o reconhecimento e a compreensão de gráficos são fortes, mas a DeepSeek aconselha testar o modelo em cargas de trabalho específicas, em vez de presumir prontidão de produção em todas as tarefas de imagem. Usuários iniciais, incluindo grupos de pesquisa e desenvolvedores de aplicativos, estão usando o stack aberto para avaliar até que ponto as habilidades do agente multimodal do modelo, próximas ao nível Opus, resistirão aos testes em seus próprios processos.

Popular