Meta sesli suhbatlarni real vaqtda tushunishga yoʻnaltirilgan birinchi sunʼiy intellekt modeli boʻlgan Muse Voice Transcribe ni seshanba kuni (1-sentabr) taqdim etdi. Bu yangi texnologiya dialoglarni sodir boʻlishi bilan transkriptlash, ishtirokchilarni ajratib koʻrsatish va bir vaqtning oʻzida yigirma kundan ortiq shaxslarni jalb qiluvchi oʻzaro aloqalarni boshqarish imkoniyatiga ega.
Bu modelni Meta Superintelligence Labs (MSL) ishlab chiqdi. Bundan tashqari, u bitta suhbat ichida turli tillarda ishlashni qoʻllab-quvvatlaydi. Kompaniyaning maʼlumotlariga koʻra, oʻqitish 70 dan ortiq tilni oʻz ichiga olgan boʻlib, ularning 25 tasi aynan ushbu chiqarish uchun tasdiqlangan.
Muse Voice Transcribe ning sezilarli jihati – bu kod-switching deb ataladigan jarayonni amalga oshirish qobiliyati, bu jarayonda biror shaxs suhbat davomida tilini almashtiradi. Ushbu texnologiya jumlaning oʻrtasida ham bunday almashinuvni aniqlashi mumkin.
Meta tomonidan taqdim etilgan namoyishda sakkiz kishi bir vaqtda suhbatlashdi va tizim har bir ishtirokchini aniqlab, ularning nutqlarini toʻgʻri bogʻladi. Sunʼiy intellekt shuningdek, toʻxtashlar, ovozlar ustma-ustligi va aksent farqlari bilan ishlash qobiliyatini namoyish etdi.
Modelning integratsiyalashgan funksiyalari
Bu model uchta muhim funksiyani bitta tuzilishda birlashtiradi: uzluksiz oqimdagi avtomatik nutqni tanish (ASR), suhbatning turli ishtirokchilarini aniqlash, yaʼni soʻzlovchi diarizatsiya va har bir nutqning boshlanishi va tugashini aniq belgilash.
Hozirda yangi model Mac uchun Meta AI ilovasi ichidagi dikto funksiyalariga tatbiq etilmoqda. Ilova boshqa xizmatlar uchun ovoz imkoniyatlarini taqdim etgani sababli, Muse Voice Transcribe turli boshqa ilovalarda ham dikto uchun qoʻllanilishi mumkin.
Bu texnologiya ishlab chiquvchilar uchun Muse Code va Meta modellari API orqali mavjud. Foydalanish narxi audio ming daqiqasi uchun 3 AQSh dollari (taxminan 15,50 BRL) ni tashkil etadi. Meta shuningdek, foydalanuvchilarga real vaqtda audio transkripsiyasini sinab koʻrish imkonini bergan oʻz tadqiqot sahifasida model namunasini joylashtirdi.
Bu chiqarish Google tomonidan ishlab chiqilgan Gemini 3.5 Transcribe taqdim etilishidan bir haftadan kam vaqt oʻtganda sodir boʻldi, u ham ilgʻor audio tanishish funksiyalariga sarmoya kiritmoqda. Biroq, Muse Voice Transcribe transkripsiya, koʻp ishtirokchilarni aniqlash va real vaqtda koʻp tilli qayta ishlashni aniq birlashtirishga urgʻu berishi bilan ajralib turadi.


