कंपनी एंटी ग्रुप ने लिंग श्रृंखला में पहली नेटिव मल्टीमॉडल मॉडल, लिंग-3.0-फ्लैश-वीएल पेश की और इसे जनता के लिए उपलब्ध कराया। यह रिलीज़ Hugging Face और ModelScope प्लेटफॉर्म पर inclusionAI नामक संगठन के माध्यम से हुई।
यह मॉडल मिक्सचर-ऑफ-एक्सपर्ट्स प्रकार के लिंग-3.0-फ्लैश बैकबोन पर बनाया गया है और इसका कुल आकार 124 बिलियन पैरामीटर है, जिसमें प्रति टोकन लगभग 5.5 बिलियन पैरामीटर सक्रिय होते हैं। यह चित्र, पाठ और वीडियो इनपुट स्वीकार करने में सक्षम है, और कंपनी लंबे दस्तावेज़ों और वीडियो सामग्री को संसाधित करने के लिए 256 हजार टोकन का संदर्भ विंडो बताती है। BF16 और FP8 प्रारूपों में वज़न 9 सितंबर को प्रकाशित किए गए थे, और जल्द ही FP4 और INT4 प्रारूपों में संस्करणों की योजना बनाई जा रही है।
मुख्य डिज़ाइन निर्णय दृष्टि पर आधारित फीडबैक लूप का कार्यान्वयन था। यह लूप धारणा को केवल कैप्शन बनाने के एक बार के चरण के रूप में नहीं, बल्कि निरंतर कार्यप्रवाह के एक अभिन्न अंग के रूप में देखता है। मॉडल को दृश्य रूप से प्रदर्शित या उत्पन्न डेटा के आधार पर अपने परिणामों का निरीक्षण करने, कार्य करने, जांचने और सुधार करने का निर्देश दिया जाता है।
एंटी ग्रुप इस मॉडल को यूजर इंटरफ़ेस (GUI) स्वचालन, फ्रंटएंड कोड जनरेशन और चिकित्सा रिपोर्ट विश्लेषण के लिए तैनात करती है। छवियों को वेब पेजों में बदलने से संबंधित परीक्षणों में, मॉडल ने घटकों और लेआउट के बीच संबंधों को पुनर्स्थापित करने की क्षमता का प्रदर्शन किया, जिसके बाद इसने रेंडरिंग परिणामों के साथ उत्पन्न कोड की तुलना करके उसकी समीक्षा की। Image-to-WebDev Arena में linthium के उपनाम से, एंटी ग्रुप ने बताया कि इसका स्कोर GPT-5.4 के स्कोर से बेहतर था।
एक GUI एजेंट के रूप में, मॉडल इंटरफ़ेस संरचना को समझने और विभिन्न उपकरणों के बीच कार्यों को जोड़ने में सक्षम है। नैदानिक रिपोर्ट परिदृश्यों में, यह केवल एक पृष्ठ की सामग्री को सारांशित करने के बजाय विभिन्न दस्तावेजों से जानकारी को समेकित करने और जोखिमों की पहचान करने के लिए डिज़ाइन किया गया है।
एंटी ग्रुप के बयानों के अनुसार, नेटिव मल्टीमॉडल डेटा का उपयोग करके संयुक्त प्रशिक्षण ने मॉडल की पाठ क्षमताओं और दृश्य कौशल दोनों में सुधार किया है। आर्टिफिशियल एनालिसिस इंटेलिजेंस इंडेक्स v4.1.1 के अनुसार, लिंग-3.0-फ्लैश-वीएल को 42 का मूल्यांकन प्राप्त हुआ, जो टेक्स्ट संस्करण लिंग-3.0-फ्लैश की तुलना में चार अंक अधिक है।
Hugging Face की सामग्री तीन क्षेत्रों में मूल्यांकन को संरचित करती है: समझ, तर्क और कार्रवाई। इन क्षेत्रों में जटिल लेआउट और दस्तावेज़ों के साथ काम करना, साक्ष्य-आधारित बहु-चरणीय जाँच और इंटरफ़ेस-संचालित कार्यों का निष्पादन शामिल है। यह दृष्टिकोण कंपनी के रणनीतिक उद्देश्य के अनुरूप है कि खुले मल्टीमॉडल वज़न को केवल स्थिर दृश्य प्रश्नों का उत्तर देने के बजाय एजेंटों को सॉफ़्टवेयर और नैदानिक कार्यप्रवाहों में चक्र बंद करने में मदद करनी चाहिए।
मॉडल आर्किटेक्चर में मनमाने रिज़ॉल्यूशन वाले विजन एन्कोडर और टाइम-कोडिंग VideoRoPE के साथ दो-स्तरीय प्रोजेक्टर का संयोजन है, जिसके बाद 42-परत वाला हाइब्रिड भाषा स्टेम है। यह स्टेम 5:1 के अनुपात में KDA और गेटेड MLA ब्लॉकों को बारी-बारी से करता है। विरल MoE के कारण, लंबी दृश्य चैट सत्रों और एजेंट क्रिया इतिहास के दौरान भी कम्प्यूटेशनल भार कम रहता है।
प्रदर्शन Ling Studio पर उपलब्ध हैं। वज़न के साथ-साथ, SGLang और Ling के लिए ट्यून किए गए vLLM फ़ॉर्क के लिए नुस्खे प्रलेखित हैं, जिसमें लिंग-3 चैट टेम्पलेट के लिए अनुकूलित तर्क और उपकरण कॉल पार्सर शामिल हैं।
डेवलपर्स के लिए, यह खुला रिलीज़ केवल एक और कैप्शन जेनरेटर नहीं है, बल्कि एक प्रारंभिक खुला मल्टीमॉडल लिंग स्टैक है जो एजेंट कार्यों के लिए नियोजन और सत्यापन प्रक्रियाओं में दृष्टि को एकीकृत करता है। यह लिंग का पहला खुला रिलीज़ भी है जिसमें स्पष्ट दृष्टि फीडबैक लूप के साथ नेटिव मल्टीमॉडल पथ शामिल है, न कि केवल संलग्न दृश्य सुविधाओं का पैकेज।
