अलीबाबा की Qwen टीम ने Qwen3.8-Omni-Flash जारी किया है — एक नेटिव मल्टीमॉडल मॉडल जो एक मिलियन टोकन की कॉन्टेक्स्ट विंडो का उपयोग करके टेक्स्ट, छवियों, ऑडियो और वीडियो को एक साथ संसाधित करने में सक्षम है। यह मॉडल 18 सितंबर से Qwen AI प्लेटफॉर्म पर उपलब्ध है और इसे केवल कैप्शनिंग क्षमताओं के प्रदर्शन के रूप में नहीं, बल्कि ऑडियो और वीडियो के साथ लंबी कार्यप्रवाहों के लिए एजेंटों के सेट के रूप में प्रस्तुत किया गया है, जिसमें कार्य योजना बनाना, टूल को कॉल करना और तैयार मीडिया सामग्री प्रदान करना शामिल है।
लगभग 30 सार्वजनिक और आंतरिक बेंचमार्क के सेट पर परीक्षण करने पर, Qwen3.8-Omni-Flash ने पिछली पीढ़ी Qwen3.5-Omni-Plus की तुलना में औसत प्रदर्शन में 26% से अधिक की वृद्धि दिखाई। सबसे महत्वपूर्ण सुधार ऑडियो और वीडियो एजेंटिक समझ से संबंधित कार्यों और बड़े क्षितिज वाले कार्यों में देखे गए, जहां WildClawBench-MM में 36.5 अंक, AgenticVBench में 22.3 अंक और UniClawBench 69.6 तक पहुंच गया।
इसके अलावा, बुनियादी धारणा में भी सुधार हुआ: LongAudioSpan में 8.3 अंकों की वृद्धि हुई, और OmniVideoBench में 9.6 अंकों की वृद्धि हुई। इस बीच, AliMeeting में डायरीकरण त्रुटि दर 88.11/89.61 से घटकर 3.35/17.18 हो गई, और शब्दों के संयोजन में त्रुटि दर क्रमशः 88.11/89.61 से घटकर 3.35/17.18 हो गई।
व्यावहारिक अनुप्रयोग में एजेंट मोड में लंबे वीडियो की समझ शामिल है। प्रत्येक फ्रेम का विश्लेषण करने के बजाय, मॉडल स्वयं निर्धारित करता है कि किन हिस्सों को देखना और सुनना है, टोकन को सबसे प्रासंगिक खंडों पर केंद्रित करता है। एजेंट मोड में OmniVideoBench पर सटीकता 63.4 से बढ़कर 67.8 हो गई, जबकि टोकन खपत लगभग 45.7% कम होकर 145,736 के बजाय लगभग 79,117 हो गई।
मीटिंग वर्कफ़्लो स्पीकर विभाजन, प्रतिलेखन, प्रोटोकॉल बनाने और ईमेल भेजने या उपकरणों के माध्यम से एन्कोडिंग जैसे बाद के कार्यों के लिए एक घंटे तक के ऑडियो और वीडियो सामग्री इनपुट का समर्थन करते हैं। इन पाइपलाइनों का समर्थन करने के लिए, अलीबाबा ने Qwen-MM-Plugins का विस्तार किया और वास्तविक समय में निरंतर मल्टीमॉडल इंटरैक्शन के लिए Qwen-Live Harness खोला। विशेष रियलटाइम SKU संस्करण कम विलंबता स्ट्रीमिंग, उच्चारण-जागरूक भाषण अभ्यास और ध्वनि की दिशा और दूरी का आकलन करने वाले स्थानिक ऑडियो संकेतों को सक्षम बनाता है। कंपनी ने बताया कि प्रति घंटे ऑडियो इनपुट के लिए एपीआई मूल्य में 98% से अधिक की कमी आई है, और प्रति घंटे ऑडियो-वीडियो इनपुट के लिए 93% से अधिक की कमी आई है, इस रिलीज़ को क्षमताओं में एक छलांग और उत्पादन मल्टीमॉडल एजेंटों के लिए एक अधिक किफायती मार्ग के रूप में प्रस्तुत किया है।


