Sunʼiy intellekt sohasidagi Xitoy startapi VUI Labs Luna-TTS modelini chiqarib, global ovoz texnologiyalari bozorining diqqatini tortdi. Ushbu tizim avtoritetli reytinglarda darhol yuqori oʻrinlarni egalladi: u Hugging Face platformasidagi TTS Arena da ElevenLabs, MiniMax va Cartesia ustidan gʻalaba qozonib, yetakchi boʻldi, shuningdek, Artificial Analysis ning Speech Arena da Google dan oldin uchinchi oʻrinni egalladi.
Kompaniyaning konsepsiyasi yuqori aniqlikdagi nutq sintezidan koʻp modal, toʻliq ikki tomonlama ovoz agentini yaratishgacha boʻlgan spektrni qamrab oladi, bu Thinking Machines Lab tadqiqot yoʻnalishi bilan oʻxshashdir.
Luna-TTS anʼanaviy avtoregressiv paradigmadan farq qiladi. Inson nutqi hissiyotlar, ton va nafas olishni oʻz ichiga olgani, ammo AR arxitekturasi ketma-ket generatsiya qilishni majburlashi kechikishlarning oshishiga va xatoliklarning toʻplanishiga olib keladi. Buning oʻrniga, Luna-TTS tovushni diskret tokenlarga kodlaydi va real vaqtda striming funksiyasi bilan Qwen3 asosidagi diffuzion til modelidan foydalanib, ovoz tokenlari paketlarini parallel bashorat qiladi.
Texnik hisobot Seed-TTS-Eval da ovoz sifati boʻyicha toʻrtta metrikada birinchi oʻrinni egallaganini, ByteDance Seed, MiniMax, Zhipu va Qwen seriyalarini ortda qoldirganini namoyish etdi, shuningdek, xato tuzatish va shovqinga chidamlilik boʻyicha CV3-Eval da birinchi oʻrinni egallab, umumiy jihatdan olti birinchi oʻringa erishdi.
Modelning texnik steki juda murakkab. Luna-Codec 24 kHz chastota va 25 Hz kadr chastotasida sakkiz kodli arxitektura dan foydalanadi. Semantik maʼlumot birinchi kod kitobchasida WavLM semantik destillatsiya yoʻqotish funksiyasi orqali mustahkamlangan, shu bilan birga ikkinchi dan sakkizinchi kod kitobchalari ton, kanal, hissiyot va prosodiya ni belgilaydi. Jamoa avtoregressiya boʻlmagan diskret maskirovka qilingan diffuzion modelda oʻrgatilgandan soʻng GRPO kuchaytirilgan oʻrganishni joriy etdi.
Real vaqt ssenariylari uchun, Luna-TTS Realtime 1,28 soniyalik bloklar boʻyicha nutq hosil qiladi, 8 dan 16 gacha parallel shovqinni kamaytirish bosqichlaridan foydalanadi. Bu H20 GPUlarida 41,6 millisekund dastlabki paket kechikishiga va 0,024 real vaqt koeffitsientiga erishish imkonini beradi, bu real vaqtdan 40 marta ortiq tezroqdir.
Modelning ifodaliligi maʼlumotlar ustida chuqur ish bilan taʼminlanadi. Jamoa bir million soat hajmdagi koʻp tilli korpusni yaratdi, undan 43,4% xitoy tili, 43,1% ingliz tili, 13,6% esa yaponcha va koreys tili tashkil etadi. Nozik sozlash uchun eng yuqori sifatli materiallardan taxminan 100 000 soat tanlandi, shuningdek, kulgi, nafas olish, yigʻlash va oʻxirlash kabi noverbalizatsiya teglari bilan ifodali maʼlumotlar qoʻshildi, ular bevosita matnli belgilar sifatida beriladi va modelga nafas olish va hissiyotlardagi nozik farqlarni tabiiy ravishda qayta ishlash imkonini beradi. Ovoz klonlash faqat bir necha daqiqa namunalar talab qiladi.
Tijoriy jihatdan VUI Labs uch darajali mahsulot tizimini ishlab chiqdi: real vaqtda generatsiya, klonlash, transkripsiya va tarjima uchun model APIsi; dublyaj va koʻp modal kontent uchun yaratuvchilar va ishlab chiquvchilar platformasi; shuningdek, toʻliq integratsiya uchun aniqlash, til modellari, vositalar chaqiruvi va generatsiyani birlashtiruvchi ovoz agenti platformasi. Kompaniya oʻz yechimlarini logistika dispetseriyasi, internet sugʻurtalash va sayohatlar uchun SaaS ga muvaffaqiyatli joriy etdi, milliondan ortiq haqiqiy biznes suhbatlarini xizmat koʻrsatgan mijozlarga xizmat qildi. Kompaniyaning baholariga koʻra, ovoz texnologiyalari bozori vizyon va hamkorlik bilan 2030 yilga qadar 266 milliarddan 740 milliard AQSh dollarigacha yetib boradi. Tsinghua universitetining doktoranti va Cambridge postdoktori boʻlgan, sunʼiy intellekt sohasidagi Wu Wenxujun Birinchi mukofotiga sazovor boʻlgan Qian Yanmin boshchiligidagi taxminan 50 kishilik ilmiy-tadqiqot guruhi bor.