O DeepSeek Harness apresentou sua primeira atualização significativa após a conclusão dos testes beta públicos — a versão v0.1.0-rc.8. A principal novidade foi a implementação de capacidades multimodais. A atualização inclui 14 mudanças que afetam o processamento de entrada multimodal, a interação entre agentes, a experiência do usuário no terminal, a chamada de ferramentas e o suporte a desenvolvedores.
Agora, o sistema suporta a recepção direta de imagens e entrada mista de texto e imagens, sendo que os comandos /goal e /plan podem receber imagens diretamente. O Claude Code e o Codex foram integrados ao sistema de agentes, o terminal Windows foi aprimorado e problemas relacionados a solicitações de imagens, transmissão de dados em streaming e gateways de usuário foram corrigidos.
O DeepSeek Harness iniciou sua versão beta pública e código aberto em 13 de agosto. Durante a noite dos testes beta, Zhidx carregou o código-fonte e realizou testes, traduzindo um documento de 88 páginas e desenvolvendo o jogo Snake. Em menos de uma semana, a plataforma de agentes adquiriu funcionalidades multimodais.
Os desenvolvedores de diferentes regiões reagiram de maneiras distintas a isso: desenvolvedores domésticos expressaram entusiasmo, enquanto os estrangeiros se concentraram em dois novos recursos que foram vistos como progresso claro. Mais interessante foi a descoberta por alguns desenvolvedores da abordagem do DeepSeek Harness: para modelos que originalmente não suportam entrada de imagens, o Harness utiliza ferramentas de OCR, estatísticas de cor e digitalização de pixels para converter imagens em informações estruturadas antes de passá-las para modelos de texto para análise. Assim, é criado um mecanismo de visão em camadas para modelos puramente textuais.
Os adaptadores de modelo DeepSeek agora permitem ativar a recepção nativa de imagens através da configuração. Para modelos com capacidades de visão, o Harness envia as imagens diretamente, e /goal e /plan suportam entrada mista. O menu @ no campo de entrada permite referenciar arquivos e sessões, dando aos usuários a possibilidade de incluir arquivos locais e sessões existentes na tarefa, permitindo que os fluxos de trabalho dos agentes considerem capturas de tela.
O sistema de agentes foi expandido: a nova versão permite instalar Claude Code e Codex sob demanda como pacotes de perfil. O Codex suporta um modo de permissão sem interação interativa e pode ter vários instâncias nomeadas. Usuários do Windows obtiveram sessões persistentes do PowerShell no terminal PTY, que estão incluídas por padrão no modo mínimo. Além disso, a atualização corrige erros relacionados a imagens muito grandes ou histórico acumulado, solicitações malsucedidas, transmissão em streaming interrompida que perdeu prefixos de resposta, bem como gateways de usuário compatíveis com OpenAI que falhavam devido a diferenças no formato da solicitação.
O desenvolvedor Yinsen descobriu que, se o modelo não declarar suporte à entrada de imagens, a chamada direta de read_image falha inicialmente, mas a tarefa não para. O Harness muda para uma opção de backup, usando reconhecimento de texto OCR, estatísticas de proporção de cores e digitalização parcial de linhas de pixels, lendo dimensões da imagem e metadados de modo de cor. Uma imagem contendo texto e elementos gráficos simples pode ser dividida em conteúdo de texto, proporção de cor de fundo, alterações de pixels e tamanho; os resultados obtidos são passados para o modelo de texto, que gera uma visão geral da imagem com base no texto OCR e nas posições dos pixels. Para capturas de tela de apresentações, diagramas de blocos e interfaces com estrutura clara, a combinação de OCR e características de pixels restaura informações úteis; enquanto fotos reais restauram menos dados. A funcionalidade de visão não está vinculada exclusivamente ao modelo base. A comunidade já criou plugins de visão, como dsh-vision, dsh-vision-toolkit, modlens, dsh-auto-vision, dsh-subagent-vision e pi-vision através de pi2dsh. Com o lançamento rc.8, a multimodalidade nativa e esses esquemas baseados em ferramentas funcionam em conjunto.
