Meta выпустила Muse Voice Transcribe — ИИ, способный транскрибировать разговоры в реальном времени на нескольких языках
Подробнее
Olhar Digital
olhardigital.com.br

Meta выпустила Muse Voice Transcribe — ИИ, способный транскрибировать разговоры в реальном времени на нескольких языках

В этот вторник (1-е число) Meta представила Muse Voice Transcribe — свою первую модель искусственного интеллекта, ориентированную на восприятие аудио в реальном времени. Эта новая технология имеет функцию транскрибирования диалогов по мере их возникновения, различения собеседников и управления взаимодействиями с участием более двадцати человек одновременно.

Разработка этой модели была проведена в Meta Superintelligence Labs (MSL). Кроме того, она поддерживает работу с различными языками в рамках одного разговора. По данным компании, обучение включало более 70 языков, из которых 25 были специально проверены для этого выпуска.

Примечательным аспектом Muse Voice Transcribe является его способность выполнять так называемый кодовый переключатель (code-switching), который происходит, когда человек меняет язык во время диалога. Технология способна обнаруживать эту смену даже посреди фразы.

В демонстрации, представленной Meta, восемь человек разговаривали одновременно, и система смогла идентифицировать каждого участника, правильно сопоставив их реплики. ИИ также продемонстрировал способность справляться с прерываниями, наложением голосов и вариациями акцентов.

Интегрированные функции модели

Эта модель объединяет три основные функции в единой структуре: автоматическое распознавание речи в непрерывном потоке (ASR), идентификацию различных участников разговора, известную как диаризация говорящих (speaker diarization), и точную маркировку начала и конца каждой реплики.

В настоящее время новая модель уже внедряется в функции диктовки в приложении Meta AI для Mac. Поскольку приложение предлагает голосовые возможности для других сервисов, Muse Voice Transcribe также может быть применен для диктовки в различных других приложениях.

Технология доступна разработчикам через Muse Code и API моделей Meta. Стоимость использования составляет 3 доллара США (примерно 15,50 реалов) за тысячу минут аудио. Meta также предоставила демонстрацию модели на своей странице поиска, позволяя пользователям тестировать транскрибирование аудио в реальном времени.

Этот запуск произошел менее чем через неделю после презентации Gemini 3.5 Transcribe от Google, который также инвестирует в расширенные функции распознавания аудио. Однако Muse Voice Transcribe выделяется тем, что явно фокусируется на сочетании транскрибирования, идентификации множества участников и многоязычной обработки в реальном времени.

Популярное