A equipe chinesa AOE Tech Labs, desenvolvedora do produto de desktop de agente Floatboat, publicou dados completos da avaliação Harness em cinco benchmarks de agentes em 7 de agosto. O modelo base utilizado foi o DeepSeek-V4-Flash, que é o modelo confiável mais acessível no mercado. Mantendo o modelo e o custo, apenas o executor Harness foi alterado. O modelo, que anteriormente apresentava resultados inferiores ao Claude Opus 4.8 em todos os cinco benchmarks no seu próprio Harness DeepSeek, conseguiu superar o Opus 4.8 no Harness interno do Floatboat.
O resultado se torna ainda mais significativo considerando a precificação. O Opus 4.8 custa US$ 5 por milhão de tokens de entrada e US$ 25 por milhão de tokens de saída. Com uma proporção de entrada para saída de 3:1, comum em cenários de trabalho de agentes, o custo combinado do Floatboat é de apenas US$ 0,175 por milhão de tokens, enquanto o do Opus 4.8 é de US$ 10, representando uma diferença de 57,1 vezes. Esses cinco benchmarks representam classificações públicas de líderes de terceiros, incluindo o BrowseComp, criado pela OpenAI. Os dados não são um artefato da seleção de perguntas.
A metodologia de pesquisa foi conduzida com o máximo rigor. No grupo de controle, foi usada a versão oficial do DeepSeek-V4-Flash-0731, e não um ponto de verificação preliminar. O grupo de controle operou no Harness próprio do provedor em modo minimalista, tornando a comparação mais rigorosa, pois os engenheiros do provedor participaram do processo. O lado do Floatboat operou em sandboxes físicos isolados com parâmetros de entrada idênticos. A única variável foi o próprio Harness.
Ao classificar as tarefas pelo horizonte de execução, de curto para longo, o aumento de desempenho não diminui: 1,9%, 9,6%, 12,6%, 19,9% e 23,6%. Tarefas curtas são essencialmente sessões de perguntas e respostas com uma única solicitação, onde a qualidade do modelo desempenha um papel decisivo. Tarefas de longo horizonte, que refletem o trabalho real, dependem do sistema de execução: acesso a arquivos, chamadas de ferramentas, salvamento de estado, autocorreção multifásica e rollback. O trabalho real ocorre no final do longo horizonte.
A AOE Tech Labs introduziu o Coeficiente de Alavancagem do Harness, ou HLR, para tornar a comparação verificável. A fórmula de cálculo é o ganho obtido apenas pela mudança do Harness dividido pelo ganho obtido ao atualizar para um modelo de referência mais forte. Um valor HLR maior que um significa que o próprio Harness supera a atualização do modelo. No DeepSWE, o Floatboat relatou um HLR de 3,57: mantendo o modelo inalterado e mudando apenas o Harness, foi alcançado um desempenho público 3,57 vezes maior do que ao atualizar para o Opus 4.8. Em todos os cinco benchmarks, o HLR aumentou monotonicamente com o aumento do horizonte de 0,78 para 3,57.
A AOE Tech Labs foi fundada no final de 2025 com a participação dos investidores HSG e VLight Capital em uma rodada de financiamento semente. A equipe lançou o Floatboat Desktop em janeiro, o FloatIM em abril e o FloatSchedule em maio. A ideia principal é que um sistema que reduz continuamente a lacuna entre o sistema de execução alvo em desenvolvimento e o desvio da saída do modelo é a chave para agentes de uso diário. O modelo mais barato agora é capaz de corresponder ou superar o modelo avançado mais caro quando o Harness é projetado para funcionar com longo horizonte.
