Na noite de 13 de agosto, a empresa DeepSeek fez dois anúncios importantes: lançou oficialmente o DeepSeek V4 Pro, acessível através de aplicativo, interface web e API, e apresentou o primeiro post da equipe DeepSeek Harness com o avatar 'black whale', anunciando a versão preliminar do Harness, que foi lançada com código aberto sob a licença MIT.
A importância do Harness reside no fato de que, na era dos agentes, o modelo deixa de ser o único fator que determina a capacidade da inteligência artificial de realizar tarefas. Anteriormente, em 6 e 11 de agosto, a Composio, uma empresa de ferramentas para agentes, integrou o mesmo modelo DeepSeek V4-Flash em oito diferentes sistemas de execução (harnesses). Esses sistemas foram solicitados para executar 30 tarefas multifásicas em aplicações reais, como Gmail, Google Calendar, GitHub e Slack.
Os resultados desses testes mostraram grandes disparidades: o melhor sistema completou 20 tarefas, enquanto o pior conseguiu completar 14. Dos 240 execuções totais, apenas 129 foram bem-sucedidas, e apenas seis das 30 tarefas foram concluídas por todos os oito sistemas. Em termos de custo, a execução de 16 tarefas pelos modelos Claude Code, Codex e DeepAgents custou aproximadamente US$ 0,195, US$ 0,081 e US$ 0,045 por tarefa bem-sucedida, respectivamente, demonstrando uma diferença de custo de quatro vezes ao usar o mesmo modelo.
De acordo com a posição interna da DeepSeek, os agentes devem resolver o problema do aprendizado contínuo, o que, em última análise, permitirá à IA acelerar seu próprio desenvolvimento. O Harness é posicionado como um ambiente de trabalho através do qual os modelos entram no desenvolvimento real. A empresa, baseada em baixo custo e força dos modelos, não pode permitir que a execução de tarefas e os pontos de entrada dos desenvolvedores dependam de sistemas de terceiros.
O princípio de design principal, de acordo com a documentação da DeepSeek, é que tudo é um plugin. O Harness é construído sobre o sistema de plugins Cordis: modelos, ferramentas, habilidades, sessões, sandboxes, armazenamento, ciclos, agendamento e interface do usuário — tudo isso é formado por plugins. Isso difere dos plugins padrão: os plugins do VS Code adicionam funcionalidades ao editor, e os plugins do Codex adicionam ferramentas ao agente, enquanto os plugins do Harness podem substituir completamente o cérebro, o conjunto de ferramentas, as regras ou a aparência do agente.
Durante uma pré-visualização interna, os desenvolvedores conseguiram criar centenas de plugins em poucos dias, incluindo um que implementou memória de longo prazo entre sessões com autoevolução em segundo plano. Outro recurso chave é a capacidade de rastrear o histórico. O Harness utiliza logs de sessão com capacidade de adição de registros (append-only session logs): tudo o que o modelo vê, prompts do sistema, cadeias de raciocínio, chamadas de ferramentas e resultados, planejamento de subagentes e cada injeção de contexto é totalmente registrada, e a compressão de contexto nunca exclui o histórico original. Os desenvolvedores podem visualizar o histórico por origem na visualização Trajectory com recursos de recuperação, fork, extração e reprodução.
O líder da equipe, Qiu Tianyi, possui um diploma em ciência da computação pela Universidade de Zhejiang e trabalhou por nove anos na firma de negociação quantitativa Jane Street antes de se juntar à DeepSeek em março de 2026, quando o projeto Harness começou internamente. O Harness suporta nativamente quase 40 modelos grandes, incluindo Kimi, OpenAI, Anthropic e Google, posicionando-se como um conjunto de componentes, e não como um agente pronto. A versão v0.1 indica claramente que o 'black whale' acabou de vir à tona.