अलीबाबा के Qwen ने 20 अगस्त को Qwen-UI-Agent जारी किया। यह मॉडल एक ग्राफिकल यूजर इंटरफेस (GUI) पर आधारित एजेंट है जो फोन, डेस्कटॉप कंप्यूटर, वेब और डीप सर्च पर काम को कवर करता है। मॉडल का मुख्य विचार उपयोगकर्ता इंटरफ़ेस को समझना, क्लिक, डेटा इनपुट और स्वाइप जैसी मानवीय क्रियाओं का अनुकरण करना है ताकि कार्य पूरे किए जा सकें।
चूंकि अधिकांश सॉफ्टवेयर एपीआई खोलने की अनुमति नहीं देते हैं, इसलिए ग्राफिकल इंटरफ़ेस सबसे सार्वभौमिक इनपुट माना जाता है। Qwen-UI-Agent इस बात पर जोर देता है कि स्क्रीन सबसे बड़ा इंटरफ़ेस है, जो एक सार्वभौमिक निष्पादक के रूप में कार्य करता है जो चार विभिन्न वातावरणों के लिए एक ही मॉडल का उपयोग करता है।
इस मॉडल के लिए मुख्य चुनौती वास्तविक उपकरणों के साथ काम करना है, क्योंकि कई GUI एजेंट सिमुलेटर में प्रशिक्षित होते हैं और वास्तविक हार्डवेयर पर विफल हो जाते हैं। अलीबाबा ने भौतिक उपकरणों पर प्रशिक्षण और मूल्यांकन के लिए 100 से अधिक वास्तविक फोन और 150 से अधिक एप्लिकेशन सहित एक मोबाइल वातावरण विकसित किया, साथ ही MobileWorld-Real नामक 400 कार्यों का एक बेंचमार्क भी बनाया।
मोबाइल उपकरणों पर MobileWorld ने 82.1 प्रतिशत का परिणाम दिखाया, जिसने GPT-5.6 Sol, Claude Opus 4.8 और Seed 2.1 Pro जैसे मॉडलों को पीछे छोड़ दिया। MobileWorld-Real ने Gemini 3.1 Pro सहित फ्लैगशिप उपकरणों के बीच सर्वश्रेष्ठ परिणाम प्रदर्शित किया, और AndroidDaily ने 97.5 प्रतिशत हासिल किया। डेस्कटॉप कंप्यूटर पर OSWorld-Verified ने 79.5 प्रतिशत प्राप्त किया, और ब्राउज़र में WebArena ने 73.6 प्रतिशत के साथ पहला स्थान हासिल किया; OSWorld-v2 का उपयोग करते समय निष्पादन चरणों की संख्या में 58 प्रतिशत की कमी आई। प्रदर्शनों ने Amap के माध्यम से खोज करने, Xiaohongshu से सारांश बनाने और पांच या छह ऐप्स में DingTalk में बुकिंग करने की क्षमता दिखाई।
स्क्रीन के साथ इंटरैक्ट करने वाला मॉडल प्रदर्शन समस्याओं की तुलना में अधिक गंभीर सुरक्षा समस्याओं का सामना करता है। Qwen-UI-Agent सीधे कार्य निष्पादन प्रक्रिया में सुरक्षा मूल्यांकन को एकीकृत करता है: अवैध या उच्च जोखिम वाले अनुरोध प्राप्त होने पर, एजेंट ऑपरेशन को अस्वीकार कर देता है और काम समाप्त कर देता है। संवेदनशील परिदृश्यों, जैसे लाल लिफाफे भेजना, फ़ाइलें हटाना या गोपनीयता प्राधिकरण का अनुरोध करना, का सामना करने पर, यह रुक जाता है और पुष्टि की प्रतीक्षा करता है। उदाहरण के लिए, 'अल्ipay के माध्यम से माँ को 500 युआन भेजने' के निर्देश पर, एजेंट राशि और टिप्पणी भरता है, फिर पुष्टि प्राप्त करने के लिए भुगतान चरण पर रुक जाता है। यदि उड़ान की तारीख या केबिन क्लास जैसी जानकारी गायब है, तो यह पहले उस जानकारी का अनुरोध करता है।
मॉडल की कार्रवाई की जगह मिश्रित है: GUI के अलावा, यह कमांड लाइन (CLI) कमांड भी निष्पादित करने में सक्षम है, जिसमें डेस्कटॉप पर सभी कार्रवाइयों का लगभग आधा हिस्सा CLI कार्रवाइयां हैं। 170 चरणों वाले कार्य के हिस्से के रूप में, एजेंट ने वित्तीय डेटा की जांच की, विश्लेषणात्मक स्क्रिप्ट चलाए, Excel, PPT और Word प्रारूपों में रिपोर्ट बनाई, और विज़ुअल सत्यापन के साथ लेआउट को समायोजित किया। इस दौरान, GUI ने वेब से जानकारी प्राप्त करने का काम किया, जबकि CLI ने विश्लेषण किया। प्रशिक्षण आक्रामक है: ऑनलाइन रीइन्फोर्समेंट लर्निंग 10,000 समानांतर वातावरण का उपयोग करके 100 चरणों से अधिक की ट्रेजेक्टरी का समर्थन करती है। एजेंट सक्रिय सेवाएं भी प्रदान करता है: उदाहरण के लिए, उड़ान रद्द होने की सूचना मिलने पर यह पुन: बुकिंग योजना का सुझाव देता है, और कार्यों को फोन और डेस्कटॉप कंप्यूटर के बीच स्थानांतरित किया जा सकता है, जैसे फोटो लाइब्रेरी से रसीद प्राप्त करना और बाद में डेस्कटॉप पर एक्सेल में समरी टेबल बनाना। इस प्रकार, एजेंट निर्देशों की प्रतीक्षा करने से हटकर उपयोगकर्ता की देखभाल की ओर बढ़ता है।
एपीआई के बाहर की दुनिया एपीआई के अंदर की दुनिया की तुलना में कहीं अधिक विशाल है। Qwen-UI-Agent ने एक सीधा दृष्टिकोण चुना: दुनिया को बदलने की कोशिश न करना, बल्कि इसे मौजूदा रूप में उपयोग करना सीखना, जबकि तकनीकी रिपोर्ट, परियोजना पृष्ठ और कोड प्रकाशित किए गए हैं। आम उपयोगकर्ताओं के लिए प्रासंगिक प्रश्न यह बना हुआ है कि ये क्षमताएं तुच्छ और जटिल कार्यों को हल करने के लिए दैनिक फोन सहायकों में कब एकीकृत होंगी।

