Meta lança Muse Voice Transcribe, IA capaz de transcrever conversas em tempo real com múltiplos idiomas
Leia mais
Olhar Digital
olhardigital.com.br

Meta lança Muse Voice Transcribe, IA capaz de transcrever conversas em tempo real com múltiplos idiomas

A Meta introduziu nesta terça-feira (1) o Muse Voice Transcribe, seu primeiro modelo de inteligência artificial focado na percepção de áudio em tempo real. Esta nova tecnologia possui a funcionalidade de transcrever diálogos conforme eles ocorrem, diferenciar os interlocutores e gerenciar interações envolvendo mais de vinte indivíduos ao mesmo tempo.

O desenvolvimento deste modelo foi realizado pelos Meta Superintelligence Labs (MSL). Além disso, ele suporta o funcionamento com diversos idiomas dentro de uma única conversa. De acordo com a companhia, o treinamento incluiu mais de 70 línguas, sendo que 25 delas foram especificamente validadas para este lançamento.

Um aspecto notável do Muse Voice Transcribe é sua aptidão para executar o chamado code-switching, que ocorre quando um indivíduo muda de idioma durante o diálogo. A tecnologia é capaz de detectar essa alternância mesmo no meio de uma frase.

Em uma demonstração apresentada pela Meta, oito pessoas conversaram simultaneamente, e o sistema conseguiu identificar cada participante, associando corretamente suas falas. A IA também demonstrou capacidade de lidar com interrupções, sobreposição de vozes e variações de sotaque.

Funcionalidades Integradas do Modelo

Este modelo integra três funções essenciais em uma única estrutura: o reconhecimento automático de fala em fluxo contínuo (ASR), a identificação dos distintos participantes da conversa, conhecida como speaker diarization, e a marcação precisa dos inícios e fins de cada fala.

Atualmente, o novo modelo já está sendo implementado em recursos de ditado dentro do aplicativo Meta AI para Mac. Visto que o aplicativo oferece capacidades de voz para outros serviços, o Muse Voice Transcribe também pode ser aplicado para ditado em diversas outras aplicações.

A tecnologia está acessível a desenvolvedores através do Muse Code e da API de modelos da Meta. O custo de utilização é de US$ 3 (aproximadamente R$ 15,50) por mil minutos de áudio. A Meta também disponibilizou uma demonstração do modelo em sua página de pesquisa, permitindo aos usuários testar a transcrição de áudio em tempo real.

Este lançamento ocorre em um período inferior a uma semana após a apresentação do Gemini 3.5 Transcribe, desenvolvido pelo Google, que também investe em funcionalidades avançadas de reconhecimento de áudio. Contudo, o Muse Voice Transcribe se destaca por focar explicitamente na combinação de transcrição, identificação de múltiplos participantes e processamento multilíngue em tempo real.

Popular