Китайский стартап в области искусственного интеллекта VUI Labs привлек внимание мирового рынка голосовых технологий, выпустив модель Luna-TTS. Эта система немедленно завоевала высокие позиции в авторитетных рейтингах: она стала лидером в TTS Arena на платформе Hugging Face, превзойдя ElevenLabs, MiniMax и Cartesia, а также заняла третье место в Speech Arena от Artificial Analysis, опередив Google.
Концепция компании охватывает спектр от высокоточного синтеза речи до создания мультимодального, полнодуплексного голосового агента, что имеет сходство с направлением исследований Thinking Machines Lab.
Luna-TTS отличается от традиционной авторегрессионной парадигмы. Поскольку человеческая речь включает в себя эмоции, тембр и дыхание, а архитектура AR вынуждает генерировать последовательно, это приводит к увеличению задержек и накоплению ошибок. Вместо этого Luna-TTS кодирует звук в дискретные токены и использует диффузионную языковую модель на базе Qwen3 для параллельного прогнозирования пакетов голосовых токенов с функцией потоковой передачи в реальном времени.
Технический отчет продемонстрировал первое место в четырех метриках качества голоса в Seed-TTS-Eval, обогнав ByteDance Seed, MiniMax, Zhipu и серии Qwen, а также первое место в CV3-Eval по коррекции ошибок и устойчивости к шуму, достигнув шести первых мест в целом.
Технологический стек модели весьма сложен. Luna-Codec использует восьмикодовую архитектуру при частоте 24 кГц и частоте кадров 25 Гц. Семантическая информация закрепляется в первом кодобуке посредством функции потерь семантической дистилляции WavLM, в то время как кодобуки с двух по восьмой фиксируют тембр, канал, эмоцию и просодию. Команда внедрила обучение с подкреплением GRPO после обучения в неавторегрессионной дискретной маскированной диффузионной модели.
Для сценариев реального времени, Luna-TTS Realtime генерирует речь блоками продолжительностью 1,28 секунды, используя от 8 до 16 параллельных шагов шумоподавления. Это позволяет добиться задержки первого пакета в 41,6 миллисекунду на двух GPU H20 и коэффициента реального времени 0,024, что более чем в 40 раз быстрее реального времени.
Выразительность модели обеспечивается глубокой работой над данными. Команда создала многоязычный корпус объемом в один миллион часов, из которых 43,4% составляют китайский язык, 43,1% — английский, 13,6% — японский и корейский. Для тонкой настройки было отобрано около 100 000 часов материала высочайшего качества, а также добавлены экспрессивные данные с тегами невербализации, такими как смех, вздохи, всхлипывания и кашель, которые подаются напрямую в виде текстовых подсказок, позволяя модели естественно воспроизводить нюансы дыхания и эмоций. Клонирование голоса требует всего нескольких минут образцов.
Коммерчески VUI Labs разработала трехуровневую продуктивную систему: API модели для генерации, клонирования, транскрипции и перевода в реальном времени; платформу для создателей и разработчиков, предназначенную для дубляжа и мультимодального контента; а также платформу голосового агента, объединяющую распознавание, языковые модели, вызов инструментов и генерацию для сквозного внедрения. Компания успешно внедрила свои решения в логистическую диспетчеризацию, интернет-страхование и SaaS для путешествий, обслуживая клиентов, которые провели более миллиона реальных деловых разговоров. По оценкам компании, рынок голосовых технологий в сочетании с видением и сотрудничеством достигнет от 266 до 740 миллиардов долларов США к 2030 году. Научно-исследовательская группа, насчитывающая почти 50 человек, половина из которых имеет степень PhD, возглавляемая Qian Yanmin, доктором наук из Цинхуа и постдоком Кембриджа, удостоенным Первой премии по естественным наукам в области искусственного интеллекта Ву Вэньцзюня.