मेटा ने मंगलवार (1) को म्यूज़ वॉयस ट्रांसक्राइब पेश किया, जो ऑडियो की वास्तविक समय में धारणा पर केंद्रित इसका पहला आर्टिफिशियल इंटेलिजेंस मॉडल है। इस नई तकनीक में संवादों को होते ही ट्रांसक्राइब करने, वक्ताओं के बीच अंतर करने और एक साथ बीस से अधिक व्यक्तियों को शामिल करने वाली इंटरैक्शन को प्रबंधित करने की कार्यक्षमता है।
इस मॉडल का विकास मेटा सुपरइंटेलिजेंस लैब्स (MSL) द्वारा किया गया था। इसके अलावा, यह एक ही बातचीत के भीतर विभिन्न भाषाओं के साथ काम करने का समर्थन करता है। कंपनी के अनुसार, प्रशिक्षण में 70 से अधिक भाषाओं को शामिल किया गया था, जिनमें से 25 को विशेष रूप से इस लॉन्च के लिए मान्य किया गया था।
म्यूज़ वॉयस ट्रांसक्राइब की एक उल्लेखनीय विशेषता कोड-स्विचिंग करने की इसकी क्षमता है, जो तब होता है जब कोई व्यक्ति संवाद के दौरान भाषा बदलता है। यह तकनीक वाक्य के बीच में भी इस बदलाव का पता लगाने में सक्षम है।
मेटा द्वारा प्रस्तुत एक प्रदर्शन में, आठ लोगों ने एक साथ बातचीत की, और सिस्टम प्रत्येक प्रतिभागी की पहचान करने और उनकी बातों को सही ढंग से जोड़ने में सफल रहा। एआई ने रुकावटों, आवाज़ों के ओवरलैप और लहजे में भिन्नताओं से निपटने की क्षमता भी प्रदर्शित की।
मॉडल की एकीकृत कार्यक्षमताएँ
यह मॉडल एक ही संरचना में तीन आवश्यक कार्यों को एकीकृत करता है: निरंतर प्रवाह में स्वचालित स्पीच रिकग्निशन (ASR), जिसे स्पीकर डायराइज़ेशन के रूप में जाना जाता है, और प्रत्येक भाषण की शुरुआत और समाप्ति का सटीक अंकन।
वर्तमान में, नया मॉडल मैक के मेटा एआई एप्लिकेशन में डिक्टेशन सुविधाओं में लागू किया जा रहा है। चूंकि यह एप्लिकेशन अन्य सेवाओं के लिए आवाज क्षमताओं की पेशकश करता है, इसलिए म्यूज़ वॉयस ट्रांसक्राइब का उपयोग कई अन्य अनुप्रयोगों में डिक्टेशन के लिए भी किया जा सकता है।
यह तकनीक म्यूज़ कोड और मेटा मॉडल एपीआई के माध्यम से डेवलपर्स के लिए उपलब्ध है। उपयोग की लागत प्रति हजार ऑडियो मिनट के लिए 3 अमेरिकी डॉलर (लगभग 15.50 रुपये) है। मेटा ने अपनी खोज पृष्ठ पर मॉडल का एक प्रदर्शन भी उपलब्ध कराया है, जिससे उपयोगकर्ता वास्तविक समय में ऑडियो ट्रांसक्रिप्शन का परीक्षण कर सकते हैं।
यह लॉन्च गूगल द्वारा विकसित जेमिनी 3.5 ट्रांसक्राइब की प्रस्तुति के एक सप्ताह से भी कम समय बाद हुआ है, जो उन्नत ऑडियो पहचान सुविधाओं में भी निवेश कर रहा है। हालांकि, म्यूज़ वॉयस ट्रांसक्राइब ट्रांसक्रिप्शन, कई प्रतिभागियों की पहचान और वास्तविक समय में बहुभाषी प्रसंस्करण के संयोजन पर स्पष्ट रूप से ध्यान केंद्रित करके अलग दिखता है।
