अलीबाबा ने 1 मिलियन कॉन्टेक्स्ट विंडो सपोर्ट के साथ Qwen3.8-Omni-Flash मॉडल पेश किया
और पढ़ें
Pandaily
pandaily.com

अलीबाबा ने 1 मिलियन कॉन्टेक्स्ट विंडो सपोर्ट के साथ Qwen3.8-Omni-Flash मॉडल पेश किया

अलीबाबा की Qwen टीम ने Qwen3.8-Omni-Flash जारी किया है — एक नेटिव मल्टीमॉडल मॉडल जो एक मिलियन टोकन की कॉन्टेक्स्ट विंडो का उपयोग करके टेक्स्ट, छवियों, ऑडियो और वीडियो को एक साथ संसाधित करने में सक्षम है। यह मॉडल 18 सितंबर से Qwen AI प्लेटफॉर्म पर उपलब्ध है और इसे केवल कैप्शनिंग क्षमताओं के प्रदर्शन के रूप में नहीं, बल्कि ऑडियो और वीडियो के साथ लंबी कार्यप्रवाहों के लिए एजेंटों के सेट के रूप में प्रस्तुत किया गया है, जिसमें कार्य योजना बनाना, टूल को कॉल करना और तैयार मीडिया सामग्री प्रदान करना शामिल है।

लगभग 30 सार्वजनिक और आंतरिक बेंचमार्क के सेट पर परीक्षण करने पर, Qwen3.8-Omni-Flash ने पिछली पीढ़ी Qwen3.5-Omni-Plus की तुलना में औसत प्रदर्शन में 26% से अधिक की वृद्धि दिखाई। सबसे महत्वपूर्ण सुधार ऑडियो और वीडियो एजेंटिक समझ से संबंधित कार्यों और बड़े क्षितिज वाले कार्यों में देखे गए, जहां WildClawBench-MM में 36.5 अंक, AgenticVBench में 22.3 अंक और UniClawBench 69.6 तक पहुंच गया।

इसके अलावा, बुनियादी धारणा में भी सुधार हुआ: LongAudioSpan में 8.3 अंकों की वृद्धि हुई, और OmniVideoBench में 9.6 अंकों की वृद्धि हुई। इस बीच, AliMeeting में डायरीकरण त्रुटि दर 88.11/89.61 से घटकर 3.35/17.18 हो गई, और शब्दों के संयोजन में त्रुटि दर क्रमशः 88.11/89.61 से घटकर 3.35/17.18 हो गई।

व्यावहारिक अनुप्रयोग में एजेंट मोड में लंबे वीडियो की समझ शामिल है। प्रत्येक फ्रेम का विश्लेषण करने के बजाय, मॉडल स्वयं निर्धारित करता है कि किन हिस्सों को देखना और सुनना है, टोकन को सबसे प्रासंगिक खंडों पर केंद्रित करता है। एजेंट मोड में OmniVideoBench पर सटीकता 63.4 से बढ़कर 67.8 हो गई, जबकि टोकन खपत लगभग 45.7% कम होकर 145,736 के बजाय लगभग 79,117 हो गई।

मीटिंग वर्कफ़्लो स्पीकर विभाजन, प्रतिलेखन, प्रोटोकॉल बनाने और ईमेल भेजने या उपकरणों के माध्यम से एन्कोडिंग जैसे बाद के कार्यों के लिए एक घंटे तक के ऑडियो और वीडियो सामग्री इनपुट का समर्थन करते हैं। इन पाइपलाइनों का समर्थन करने के लिए, अलीबाबा ने Qwen-MM-Plugins का विस्तार किया और वास्तविक समय में निरंतर मल्टीमॉडल इंटरैक्शन के लिए Qwen-Live Harness खोला। विशेष रियलटाइम SKU संस्करण कम विलंबता स्ट्रीमिंग, उच्चारण-जागरूक भाषण अभ्यास और ध्वनि की दिशा और दूरी का आकलन करने वाले स्थानिक ऑडियो संकेतों को सक्षम बनाता है। कंपनी ने बताया कि प्रति घंटे ऑडियो इनपुट के लिए एपीआई मूल्य में 98% से अधिक की कमी आई है, और प्रति घंटे ऑडियो-वीडियो इनपुट के लिए 93% से अधिक की कमी आई है, इस रिलीज़ को क्षमताओं में एक छलांग और उत्पादन मल्टीमॉडल एजेंटों के लिए एक अधिक किफायती मार्ग के रूप में प्रस्तुत किया है।

समान कहानियाँ

TaichuAI ने स्थानिक समझ के लिए ZDTaichu5.0-9B नामक एक ओपन मल्टीमॉडल मॉडल जारी किया
और पढ़ें
pandaily.com

TaichuAI ने स्थानिक समझ के लिए ZDTaichu5.0-9B नामक एक ओपन मल्टीमॉडल मॉडल जारी किया

TaichuAI कंपनी ने ZDTaichu5.0-9B मॉडल को सार्वजनिक रूप से उपलब्ध कराया है। यह मल्टीमॉडल फाउंडेशन मॉडल लगभग 9 अरब मापदंडों का है और सामान्य दृश्य समझ, स्थानिक तर्क, एजेंट टूल के उपयोग और एम्बोडीड एआई में अनुसंधान के लिए डिज़ाइन किया गया है।

मॉडल की वास्तुकला Qwen3.5-9B भाषा बैकबोन को C-RADIOv4-H दृष्टि एन्कोडर के साथ जोड़ती है। मॉडल पाठ के साथ-साथ किसी भी रिज़ॉल्यूशन की एक या अधिक छवियों और वीडियो को इनपुट के रूप में स्वीकार करता है, जो 128 हजार टोकन तक के संदर्भ की लंबाई का समर्थन करता है। TMTPost द्वारा 15 सितंबर को प्रकाशित इस प्रकाशन में वास्तविक दुनिया में स्थान की धारणा, विभिन्न दृश्यों के बीच रूपांतरण और एम्बोडीड सिस्टम के लिए कार्य योजना पर ध्यान केंद्रित किया गया था।

मॉडल के सार्वजनिक कार्ड के अनुसार, TaichuAI व्यापक दृश्य कार्यों की एक विस्तृत श्रृंखला में लगभग 10-बिलियन सामान्य VLM के बीच उत्कृष्ट परिणाम प्रदर्शित करता है, साथ ही स्थानिक, एम्बोडीड और एजेंट परिदृश्यों में अपनी क्षमताओं का विस्तार करता है। स्थान और एम्बोडमेंट के क्षेत्र में उल्लेखनीय मेट्रिक्स में ViewSpatial 62.50, MMSI-Bench 47.20, MindCube-tiny 78.27, ERQA 48.00 और RoboSpatial 56.00 शामिल हैं।

एजेंट और निर्देश सेटों के संबंध में, मूल्यांकन कार्ड पर नोट्स में बताए गए TAU2-Bench 87.70 का स्कोर प्राप्त करता है, जबकि Claw-Eval का औसत स्कोर 71.40 है, और IFEval 93.70 दिखाता है। एंट्रॉपी-प्राथमिकता वाले अनुकूली पुनरावर्ती तर्क तंत्र का वर्णन एक ऐसे तंत्र के रूप में किया जाता है जो अधिक जटिल टोकन के लिए लेटेंट वेरिएबल्स के अतिरिक्त परिशोधन चरणों को उजागर करता है।

मॉडल की क्षमताएं ऑप्टिकल कैरेक्टर रिकग्निशन (OCR) और दस्तावेज़ समझ, छवियों पर गणित, सूक्ष्म द्वि-आयामी संबंधों, कई दृश्यों के जुड़ाव, त्रि-आयामी दृश्यों और परिप्रेक्ष्य की धारणा, और लंबी संदर्भ विंडो के भीतर कई छवियों और वीडियो को ट्रैक करने, जिसमें बहु-चरणीय टूल उपयोग की योजना बनाना शामिल है, तक फैली हुई हैं। हालांकि, उपकरणों का वास्तविक निष्पादन होस्ट एप्लिकेशन की जिम्मेदारी बनी रहती है।

कार्ड पर सूचीबद्ध स्थानिक शिक्षण विषयों में सापेक्ष संबंध, सघन गणना और फ्रेम, कैमरा गति और गहराई का क्रमबद्धीकरण, ईगोसेंट्रिक बनाम एलोसेंट्रिक दृश्य, और VLA शैली में अनुकूलन के लिए उच्च-स्तरीय क्षमता निर्धारण और कार्रवाई योजना शामिल है।

मॉडल के वज़न Hugging Face पर TaichuAI/ZDTaichu5.0-9B पर NVIDIA ओपन मॉडल लाइसेंस के तहत रखे गए हैं, जबकि Qwen3.5 के Apache-2.0 नोटिस बरकरार रहते हैं। सेवा के लिए कस्टम vLLM 0.26.0 शाखा और OpenAI के साथ संगत एंडपॉइंट प्रदान करने के लिए TaichuAI का Docker इमेज उपयोग किया जाता है, जिसमें स्थानिक लगाव और सामान्य कार्यों के लिए अनुशंसित नमूनाकरण सेटिंग्स होती हैं।

अन्य विक्रेताओं द्वारा प्रस्तुत मॉडलों के समान, बाहरी प्रयोगशालाओं को बेंचमार्क मेट्रिक्स को स्वतंत्र पुनरुत्पादन के परिणामों के सामने निर्दिष्ट प्रॉम्प्ट और जजों के साथ घोषित माना जाना चाहिए। हालांकि, मध्यम आकार के ओपन मल्टीमॉडल चेकपॉइंट, स्थान और एजेंटों पर जोर, और तैयार vLLM पैकेजिंग का संयोजन शोधकर्ताओं को मूल्यांकन के लिए एक ठोस कलाकृति प्रदान करता है।

DeepSeek ने MoE आर्किटेक्चर के साथ V4.1 Flash जारी किया, पुराने V4 Pro को बदल दिया
और पढ़ें
pandaily.com

DeepSeek ने MoE आर्किटेक्चर के साथ V4.1 Flash जारी किया, पुराने V4 Pro को बदल दिया

DeepSeek कंपनी ने DeepSeek V4.1 Flash मॉडल को सामान्य उपलब्धता (GA) में जारी करने की घोषणा की है। इस मॉडल को सीमित बीटा संस्करण से एक नए मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) आर्किटेक्चर और कारण-परिणाम एन्कोडर-डिकोडर (Causal-Encoder-Decoder) पर आधारित उत्पादन SKU में बदल दिया गया है।

V4.1 Flash को इस संरचनात्मक परिवार का सबसे छोटा सदस्य बताया गया है और कंपनी के बयानों के अनुसार, यह प्रदर्शन, लागत, गति और समग्र कार्य समय के मामले में DeepSeek V4 Pro से बेहतर है। यह इस सप्ताह के दौरान V4 Pro को चरणबद्ध तरीके से हटाने का मार्ग प्रशस्त करता है।

वास्तुशिल्प रूप से, V4.1 Flash 552 बिलियन पैरामीटर वाला एक MoE मॉडल है जिसमें असममित सक्रियण है: इनपुट डेटा पढ़ने पर लगभग 8 बिलियन पैरामीटर सक्रिय होते हैं, जबकि आउटपुट डेटा उत्पन्न करते समय लगभग 16 बिलियन पैरामीटर सक्रिय होते हैं। DeepSeek का दावा है कि यह विभाजन समान आकार के अधिक सघन मॉडलों की तुलना में कम्प्यूटेशनल लागत को कम करता है, जो एजेंट वर्कलोड के लिए विशेष रूप से महत्वपूर्ण है जो संक्षिप्त निर्णय या टूल कॉल देने से पहले बड़ी कोडबेस, दस्तावेज़ और चैट इतिहास को संसाधित करते हैं।

नई प्रीट्रेनिंग ज्ञान जांच (pretraining) को पोस्ट-ट्रेनिंग सुदृढीकरण शिक्षण (reinforcement learning post-training) के साथ जोड़कर GA चेकपॉइंट का आधार बनाया गया है। आधिकारिक डेटा GPQA Diamond, Codeforces शैली प्रोग्रामिंग, MathArena Apex, Terminal-Bench 2.1 और CyberGym जैसे परीक्षण सेटों पर उच्च परिणाम प्रदर्शित करता है। इसके अलावा, यह स्टैक पिछली पीढ़ियों की तुलना में KV कैश संपीड़न प्रदान करता है, जिससे लंबी सत्रों के दौरान मेमोरी पर बोझ कम होता है।

छवि समझ की कार्यक्षमता अब मुख्य फ्लैश एपीआई में एकीकृत है, न कि एक प्रायोगिक ऐड-ऑन के रूप में। पुराने V4 Flash और V4 Flash Vision Exp एंडपॉइंट अक्षम कर दिए गए हैं; हालांकि, संगतता सुनिश्चित करने के लिए, deepseek-v4-flash और deepseek-v4-flash-vision-exp को अस्थायी रूप से V4.1 Flash पर रीडायरेक्ट किया जाता है। डेवलपर्स विवरण, ऑप्टिकल कैरेक्टर रिकग्निशन (OCR) और ग्राफ़ पढ़ने के लिए सार्वजनिक छवि URL, एन्कोडेड पेलोड या API फ़ाइल लिंक पास कर सकते हैं। संदर्भ विंडो लगभग दस लाख टोकन बनी हुई है जिसमें अधिकतम आउटपुट के लिए बड़ा बजट है, और यह JSON आउटपुट, टूल कॉलिंग और अनुकूलन योग्य प्रयास स्तर के साथ थिंकिंग मोड का समर्थन करता है।

नए वाणिज्यिक नियम लागू होते हैं। नए फ्लैश टैरिफ (पीक और ऑफ-पीक) 10 सितंबर 2026 को बीजिंग समय के अनुसार 12:00 बजे लागू हुए, जिसमें कैश में आने वाले इनपुट डेटा की लागत पिछले फ्लैश मूल्य निर्धारण की तुलना में ऑफ-पीक समय में लगभग 60% कम हो गई है - जो बार-बार इतिहास दोहराने वाले एजेंटों के लिए एक सीधा लाभ है। 14 सितंबर को बीजिंग समय के अनुसार 12:00 बजे DeepSeek V4 Pro का समर्थन बंद कर देगा: deepseek-v4-pro पर अनुरोध V4.1 Flash पर निर्देशित किए जाएंगे और भविष्य के V4.1 Pro के रिलीज होने तक फ्लैश दरों पर बिल किए जाएंगे। GA मॉडल को deepseek-flash कहा जाना चाहिए।

उपभोक्ता एप्लिकेशन, क्विक, एक्सपर्ट और विजन मोड को एक बुद्धिमान मोड में संयोजित किया गया है, जो जटिलता निर्धारित करता है, छवियों के आगमन पर दृष्टि फ़ंक्शन को सक्रिय करता है और मैन्युअल स्विचिंग की आवश्यकता के बिना थिंकिंग प्रक्रिया को स्केल करता है।

इस प्रकार, यह वास्तुकला और उत्पाद लाइन का औपचारिक रीसेट है, न कि केवल समाप्त होने वाला पूर्वावलोकन: यह एक नया MoE आधार है, मुख्य कार्य उपकरण के रूप में मल्टीमॉडल फ्लैश, उच्च कैश लोड के साथ सस्ता ट्रैफ़िक है, और प्रो के रिलीज और मोड के समेकन के लिए एक निश्चित कैलेंडर है।

लोकप्रिय