अगली पीढ़ी के आर्टिफिशियल इंटेलिजेंस इंफ्रास्ट्रक्चर के निर्माण के लिए कंप्यूटिंग शक्ति और हार्डवेयर की बढ़ती लागत के कारण महत्वपूर्ण पूंजी की आवश्यकता होती है। इस समस्या को हल करने और पारंपरिक डिक्टेशन की सीमाओं से परे जाने के लिए, स्टार्टअप Wispr ने $2 बिलियन के मूल्यांकन पर सीरीज़ बी फंडिंग राउंड में $280 मिलियन जुटाए।
यह बड़ी पूंजी प्रवाह कंपनी को अपनी स्वयं की वॉयस मॉडल को प्रशिक्षित करने की अनुमति देगा जो वास्तविक दुनिया की जटिल ऑडियो सामग्री को आसानी से संसाधित करते हैं। महंगी कम्प्यूटेशनल आवश्यकताओं की समस्या को पहले ही हल करके, Wispr का लक्ष्य एक सार्वभौमिक वॉयस इंटरफ़ेस बनाना है जो रोजमर्रा के उपकरणों और डिजिटल प्लेटफॉर्म पर टेक्स्ट इनपुट को प्रतिस्थापित कर सके।
अधिकांश लोग वॉयस कमांड को टाइमर सेट करने या छोटे संदेश लिखने के लिए एक साधारण उपकरण के रूप में देखते हैं। हालांकि, Wispr भविष्य को देखता है जहां प्राकृतिक मानव भाषण सभी दैनिक उपयोग किए जाने वाले सॉफ़्टवेयर अनुप्रयोगों में डेटा इनपुट का प्राथमिक तरीका बन जाएगा।
Wispr का फ्लैगशिप एप्लिकेशन, Flow, उपयोगकर्ताओं को डेस्कटॉप और मोबाइल दोनों ऑपरेटिंग सिस्टम पर किसी भी टेक्स्ट फ़ील्ड में बिना किसी रुकावट के बोलने की अनुमति देता है। Flow वास्तविक समय में मानव भाषण को संसाधित करता है, जिससे भद्दी अनप्रोसेस्ड ट्रांसक्रिप्शन की आवश्यकता समाप्त हो जाती है। यह 'उम्म' और 'आह' जैसे फिलर शब्दों को हटाता है, व्याकरण संबंधी त्रुटियों को ठीक करता है, और चलते-फिरते ठोकर लगने को चुपचाप ठीक करता है। इस प्रकार, यह उपयोगकर्ता के जल्दबाजी वाले, अस्पष्ट विचारों को थकाऊ मैन्युअल संपादन और टाइपिंग के बिना स्पष्ट, व्यावसायिक पाठ में बदल देता है।
नई पूंजी सीधे तौर पर Canto के विकास और कार्यान्वयन में तेजी लाती है - जो Wispr का पेटेंटेड वॉयस मॉडल है जिसे विशेष रूप से वास्तविक दुनिया की शोरगुल वाली स्थितियों के लिए बनाया गया है। मानक स्पीच-टू-टेक्स्ट इंजन शांत कमरों में स्वीकार्य रूप से काम करते हैं, लेकिन सामान्य परिस्थितियों में पूरी तरह से विफल हो जाते हैं। पृष्ठभूमि की बातचीत, भौंकते जानवर, भारी यातायात और कॉफी शॉप का शोर आमतौर पर गंभीर ट्रांसक्रिप्शन त्रुटियों का कारण बनता है। Canto इस गंभीर बाधा को दूर करता है, सीधे अनफ़िल्टर्ड, अराजक ऑडियो डेटा पर प्रशिक्षित होता है।
इसके कारण Canto शोरगुल वाले वातावरण में भाषण पहचान त्रुटि दर को 30% से घटाकर 10% से कम कर देता है। उपयोगकर्ता यात्रा के दौरान या ओपन-प्लान लेआउट वाले कार्यालयों में रहते हुए लंबे ईमेल या जटिल दस्तावेज़ आसानी से बोल सकते हैं। नतीजतन, Canto शोरगुल वाली जगहों पर भाषण पहचान त्रुटि प्रतिशत को 30% से घटाकर 10% से कम कर देता है, जिससे उपयोगकर्ताओं को यात्रा के दौरान, शहर की व्यस्त सड़कों पर टहलते समय या शोरगुल वाले कार्यालयों में विस्तृत पत्र या जटिल रणनीतिक दस्तावेज़ आराम से बोलने की अनुमति मिलती है।
बड़े वेंचर फंड स्पष्ट रूप से Wispr के तकनीकी दृष्टिकोण और महत्वाकांक्षी उत्पाद दृष्टि में विशाल दीर्घकालिक मूल्य देखते हैं। सीरीज़ बी फंडिंग राउंड का नेतृत्व Menlo Ventures ने Notable Capital, NEA, Neo Ventures, 8VC और MVP Ventures के साथ किया। इस रणनीतिक धन निवेश के माध्यम से, Wispr ने कुल मिलाकर $361 मिलियन जुटाए हैं। यह तकनीक पहले से ही कॉर्पोरेट टीमों, रचनात्मक पेशेवरों और यहां तक कि प्रसिद्ध उपयोगकर्ताओं के बीच लोकप्रिय हो रही है। आज तक, उपयोगकर्ताओं ने Flow प्लेटफॉर्म पर 60 बिलियन से अधिक शब्द बनाए हैं।
Fortune 500 सूची की लगभग सभी कंपनियों और 10,000 से अधिक उद्यमों के कर्मचारी प्रतिदिन Flow का उपयोग करते हैं। बहुभाषी विशेषज्ञ और पेशेवर एथलीट भाषा के बीच सहजता से स्विच करने की अपनी क्षमता के लिए Flow की सराहना करते हैं बिना शब्दों को खोए। भविष्य में, आर्टिफिशियल इंटेलिजेंस के विकास के साथ, पारंपरिक भौतिक कीबोर्ड और टचस्क्रीन अप्रचलित हो सकते हैं। पर्याप्त धन होने के कारण, Wispr इन पैसों का उपयोग प्रत्येक डेस्कटॉप और मोबाइल एप्लिकेशन के ठीक नीचे स्थित एक स्थायी वॉयस लेयर बनाने के लिए कर रहा है। विभिन्न अनुप्रयोगों के बीच स्विच करने या लंबे संदेशों को मैन्युअल रूप से टाइप करने के बजाय, उपयोगकर्ता बस अपनी स्क्रीन से स्वाभाविक रूप से बात कर सकेंगे। विशेषीकृत वॉयस इनपुट का अनुकूलन मैन्युअल टाइपिंग की तुलना में काफी तेज और सटीक हो जाता है।

