A equipe Qwen da Alibaba lançou o Qwen3.8-Omni-Flash, um modelo multimodal nativo capaz de processar texto, imagens, áudio e vídeo simultaneamente, utilizando uma janela de contexto de um milhão de tokens. Este modelo está disponível na plataforma Qwen AI a partir de 18 de setembro e é posicionado não apenas como uma demonstração de capacidades de legendagem, mas como um conjunto de agentes para fluxos de trabalho longos com áudio e vídeo, incluindo planejamento de tarefas, chamada de ferramentas e fornecimento de materiais multimídia prontos.
Em testes em um conjunto de cerca de 30 benchmarks públicos e internos, o Qwen3.8-Omni-Flash demonstrou um aumento médio de desempenho superior a 26% em comparação com a versão anterior Qwen3.5-Omni-Plus. As melhorias mais significativas foram observadas em tarefas relacionadas ao entendimento de áudio e vídeo por agentes, bem como em tarefas de longo alcance: o WildClawBench-MM aumentou em 36,5 pontos, o AgenticVBench em 22,3 pontos, e o UniClawBench atingiu 69,6.
Além disso, a percepção básica melhorou: o LongAudioSpan aumentou em 8,3 pontos, e o OmniVideoBench em 9,6 pontos. Enquanto isso, a taxa de erros de diarização no AliMeeting e a taxa de erros de concatenação de palavras diminuíram de 88,11/89,61 para 3,35/17,18, respectivamente.
A aplicação prática inclui a compreensão de vídeos longos em modo agente. Em vez de analisar cada quadro, o modelo determina autonomamente quais partes precisam ser visualizadas e ouvidas, concentrando os tokens nos segmentos mais relevantes. No modo agente, a precisão no OmniVideoBench aumentou de 63,4 para 67,8, enquanto o consumo de tokens diminuiu em aproximadamente 45,7%, ficando em cerca de 79.117 em vez de 145.736.
Os fluxos de trabalho para reuniões suportam a entrada de materiais de áudio e vídeo de até uma hora para separação de falantes, transcrição, elaboração de atas e execução de ações subsequentes, como envio de e-mails ou codificação através de ferramentas. Para suportar esses pipelines, a Alibaba expandiu o Qwen-MM-Plugins e abriu o Qwen-Live Harness para interação multimodal contínua em tempo real. Uma versão especial, o Realtime SKU, oferece transmissão de baixa latência, prática de fala com consideração de sotaque e dicas de áudio espacial que avaliam direção e distância do som. A empresa informou que os preços da API por hora de entrada de áudio foram reduzidos em mais de 98%, e por hora de entrada de áudio e vídeo em mais de 93%, apresentando o lançamento como um salto nas capacidades e um caminho mais econômico para agentes multimodais de produção.
