A Unisound apresentou o modelo U2-Flash, posicionando-o como uma ferramenta de trabalho completa da classe Flash, e não como uma versão simplificada de sua linha anterior U2. O modelo utiliza um design de mistura esparsa de especialistas (sparse mixture-of-experts) com um total de cerca de 266 bilhões de parâmetros, sendo que aproximadamente 10 bilhões de parâmetros estão ativos durante a inferência, o que representa menos de 4% do volume total de pesos.
O objetivo desta arquitetura é executar simultaneamente tarefas de codificação, operação de agentes, raciocínio matemático e seguimento de instruções em um único ponto validado. A Unisound apresenta este lançamento como uma estratégia de aumento de densidade: alcançar a qualidade das tarefas principais com baixa latência e custo de tokens característicos da classe Flash, otimizada para fluxos de trabalho de produção, e não apenas para chats de demonstração.
Além disso, a empresa enfatiza que mais de dez anos de dados de cenários verticais foram usados para melhorar a qualidade pós-treinamento, especialmente quando os modelos precisam completar tarefas multifásicas. Dois caminhos chave de desenvolvimento sustentam a apresentação. O primeiro é o ciclo de pós-treinamento, que permite ao modelo ajudar na geração de tarefas, análise de trajetórias e verificação do stack de treinamento. Este é o primeiro passo declarado da Unisound em direção à autoaperfeiçoamento recursivo dentro de areias de testes e portões de verificação definidos pelo ser humano.
O segundo caminho é o raciocínio latente no espaço de estados ocultos, apresentado como uma interface controlada de intensidade de pensamento, e não como um modo interno opaco. Elementos adicionais incluem aprendizado por reforço assíncrono de agentes com trabalhadores paralelos, destilação online multi-instrutor de política entre especialistas em matemática, código e agentes, bem como geração adaptativa de tarefas que mantém a complexidade no nível das capacidades atuais do modelo.
A Unisound informa que este ciclo já criou um conjunto de quase 100.000 tarefas de desenvolvimento de software, cobrindo as principais linguagens de programação. Além disso, a destilação multi-instrutor reduziu o número de etapas para um nível correspondente às habilidades em cerca de 55%.
De acordo com os resultados publicados, o U2-Flash demonstra um resultado de 64.6 no DeepSWE v1.1, 24.3 no TerminalBench 3.0 e 61.6 no SWE-Bench Pro. O último resultado aumentou em 10.5 pontos em comparação com a geração anterior, de acordo com os materiais da empresa, que também afirmam liderança sobre os pontos de controle concorrentes nomeados nas classes Flash e Pro.
Em relação aos indicadores de desempenho, foi declarada uma média de tempo até o primeiro token inferior a três segundos, um throughput pico de até 300 tokens por segundo, uma redução de 20–30% no número de iterações do agente e uma redução do ciclo de execução da tarefa do início ao fim em cerca de 35%, com economia de tokens comparável ao U2.
O modelo também é otimizado para funcionar com os principais stacks de aceleradores domésticos em termos de throughput, latência e escalabilidade de cluster para implementações nos setores governamental, financeiro, industrial e de energia.
O U2-Flash está disponível na plataforma MaaS da Unisound durante um período promocional que se estenderá até 30 de setembro de 2026. Este período inclui descontos em tokens e a concessão de um volume de teste de 100 milhões de tokens para novos e usuários existentes. No entanto, como a documentação de lançamento não incluiu reprodução independente do benchmark completo nem confirmação de paridade de hardware, recomenda-se aos compradores realizar validação no nível da carga de trabalho antes de considerar o U2-Flash como inteligência de produção padrão.


