Для создания инфраструктуры искусственного интеллекта нового поколения требуется значительный капитал из-за растущих затрат на вычислительные мощности и оборудование. Чтобы решить эту проблему и выйти за рамки традиционной диктовки, стартап Wispr привлек 280 миллионов долларов в рамках раунда финансирования Серии B при оценке в 2 миллиарда долларов.
Этот крупный приток капитала позволит компании обучать собственные голосовые модели, которые легко обрабатывают сложный аудиоматериал из реального мира. Решая проблему дорогостоящих вычислительных потребностей заранее, Wispr стремится создать универсальный голосовой интерфейс, который заменит набор текста в повседневных устройствах и цифровых платформах.
Большинство людей воспринимают голосовое управление как простой инструмент для установки таймеров или написания коротких сообщений. Однако Wispr видит будущее, в котором естественная человеческая речь станет основным способом ввода данных во все используемые ежедневно программные приложения.
Флагманское приложение Wispr, Flow, позволяет пользователям беспрепятственно говорить в любое текстовое поле как на настольных, так и на мобильных операционных системах. Flow обрабатывает человеческую речь в режиме реального времени, устраняя необходимость в неаккуратных необработанных транскрипциях. Оно убирает слова-паразиты вроде «эм» и «а», исправляет грамматические ошибки и незаметно корректирует спотыкания на ходу. Таким образом, оно преобразует поспешные, расплывчатые идеи пользователя в четкий, деловой текст без утомительного ручного редактирования и набора.
Новый капитал напрямую ускоряет разработку и внедрение Canto — запатентованной голосовой модели Wispr, созданной специально для шумных условий реального мира. Стандартные движки преобразования речи в текст работают приемлемо в тихих помещениях, но полностью выходят из строя в обычных условиях. Фоновые разговоры, лающие животные, сильный трафик и шум из кофейни обычно приводят к серьезным ошибкам транскрипции. Canto устраняет это серьезное препятствие, обучаясь непосредственно на нефильтрованных, хаотичных аудиоданных.
Благодаря этому Canto снижает частоту ошибок распознавания речи в шумной обстановке с 30% до менее чем 10%. Пользователи могут легко диктовать длинные электронные письма или сложные документы, находясь в дороге или в офисах открытой планировки. В результате Canto уменьшает процент ошибок распознавания речи в громких местах с 30% до менее чем 10%, позволяя пользователям комфортно диктовать подробные письма или сложные стратегические документы во время поездок, прогулок по оживленным улицам города или пребывания в шумных офисах.
Крупные венчурные фонды очевидно видят огромную долгосрочную ценность в техническом подходе и амбициозном видении продукта Wispr. Раунд финансирования Серии B возглавили Menlo Ventures совместно с Notable Capital, NEA, Neo Ventures, 8VC и MVP Ventures. Благодаря этому стратегическому вливанию средств Wispr в общей сложности привлек 361 миллион долларов. Технология уже завоевывает большую популярность среди корпоративных команд, творческих специалистов и даже известных пользователей. На сегодняшний день пользователи создали более 60 миллиардов слов на платформе Flow.
Сотрудники почти всех компаний из списка Fortune 500 и более 10 000 предприятий ежедневно используют Flow. Мультиязычные специалисты и профессиональные спортсмены высоко оценивают Flow за его способность плавно переключаться между языками без потери слов. В будущем, с развитием искусственного интеллекта, традиционная физическая клавиатура и сенсорный экран могут устареть. Имея внушительный запас средств, Wispr использует эти деньги для создания постоянного голосового слоя, расположенного непосредственно под каждым настольным и мобильным приложением. Вместо того чтобы переключаться между разными приложениями или вручную набирать длинные сообщения, пользователи смогут просто естественно разговаривать со своими экранами. В сочетании с оптимизацией специализированных моделей голосовой ввод становится значительно быстрее и точнее ручного набора.


