A Meta introduziu nesta terça-feira (1) o Muse Voice Transcribe, seu primeiro modelo de inteligência artificial focado na percepção de áudio em tempo real. Esta nova tecnologia possui a funcionalidade de transcrever diálogos conforme eles ocorrem, diferenciar os interlocutores e gerenciar interações envolvendo mais de vinte indivíduos ao mesmo tempo.
O desenvolvimento deste modelo foi realizado pelos Meta Superintelligence Labs (MSL). Além disso, ele suporta o funcionamento com diversos idiomas dentro de uma única conversa. De acordo com a companhia, o treinamento incluiu mais de 70 línguas, sendo que 25 delas foram especificamente validadas para este lançamento.
Um aspecto notável do Muse Voice Transcribe é sua aptidão para executar o chamado code-switching, que ocorre quando um indivíduo muda de idioma durante o diálogo. A tecnologia é capaz de detectar essa alternância mesmo no meio de uma frase.
Em uma demonstração apresentada pela Meta, oito pessoas conversaram simultaneamente, e o sistema conseguiu identificar cada participante, associando corretamente suas falas. A IA também demonstrou capacidade de lidar com interrupções, sobreposição de vozes e variações de sotaque.
Funcionalidades Integradas do Modelo
Este modelo integra três funções essenciais em uma única estrutura: o reconhecimento automático de fala em fluxo contínuo (ASR), a identificação dos distintos participantes da conversa, conhecida como speaker diarization, e a marcação precisa dos inícios e fins de cada fala.
Atualmente, o novo modelo já está sendo implementado em recursos de ditado dentro do aplicativo Meta AI para Mac. Visto que o aplicativo oferece capacidades de voz para outros serviços, o Muse Voice Transcribe também pode ser aplicado para ditado em diversas outras aplicações.
A tecnologia está acessível a desenvolvedores através do Muse Code e da API de modelos da Meta. O custo de utilização é de US$ 3 (aproximadamente R$ 15,50) por mil minutos de áudio. A Meta também disponibilizou uma demonstração do modelo em sua página de pesquisa, permitindo aos usuários testar a transcrição de áudio em tempo real.
Este lançamento ocorre em um período inferior a uma semana após a apresentação do Gemini 3.5 Transcribe, desenvolvido pelo Google, que também investe em funcionalidades avançadas de reconhecimento de áudio. Contudo, o Muse Voice Transcribe se destaca por focar explicitamente na combinação de transcrição, identificação de múltiplos participantes e processamento multilíngue em tempo real.
