हुआवेई के X-राउटर सिस्टम ने एजेंट प्रश्नों के अनुकूलन के लिए मॉडल रूटिंग खोली
और पढ़ें
Pandaily
pandaily.com

हुआवेई के X-राउटर सिस्टम ने एजेंट प्रश्नों के अनुकूलन के लिए मॉडल रूटिंग खोली

हुआवेई ने X-Router प्रस्तुत किया है, जो ओपनJiuwen प्लेटफॉर्म का हिस्सा एक स्व-विकसित मॉडल राउटर है। यह प्लेटफॉर्म, जिसे हुआवेई क्लाउड और हुआवेई लैबोरेटरीज की टीमों द्वारा 2012 से, साथ ही विश्वविद्यालयों और उद्यम डेवलपर्स द्वारा विकसित किया गया है, AI एजेंटों के साथ काम करने के लिए डिज़ाइन किया गया है।

2 अक्टूबर को घोषित, X-Router एजेंट और उन मॉडलों के बीच कार्य करता है जिन्हें यह कॉल करता है। इसका कार्य प्रत्येक इनकमिंग अनुरोध के लिए यह निर्धारित करना है कि कौन सा मॉडल उसे संसाधित करेगा: सरल कार्यों को हल्के और कम लागत वाले मॉडलों को भेजा जाता है, जबकि जटिल कार्यों को सबसे शक्तिशाली मॉडलों को भेजा जाता है।

टीम ने उल्लेख किया है कि सिस्टम Ascend के अनुकूल है और परीक्षण के दौरान इसने टोकन खपत को 50% से अधिक कम करने में मदद की है।

कार्य सिद्धांत और वास्तुकला

X-Router ओपनJiuwen मॉडल रूटिंग तंत्र में एल्गोरिदम में से एक है। इसमें Rust पर एक कोर और Python पर एक एक्सटेंशन है, और इसका कोड Apache-2.0 लाइसेंस के तहत GitHub और AtomGit पर उपलब्ध है।

होस्ट प्रक्रिया में चलने वाला Qwen3-0.6B क्लासिफायर संवाद का विश्लेषण करता है और इसे पांच में से एक जटिलता स्तर निर्दिष्ट करता है: SIMPLE, MEDIUM, COMPLEX, RESEARCH या REASONING। अनुरोध जो निर्दिष्ट स्तर या उससे नीचे के हैं, उन्हें स्थानीय मॉडल द्वारा संसाधित किया जाता है, जबकि अधिक जटिल अनुरोध संबंधित क्लाउड मॉडल में भेजे जाते हैं।

इसके अलावा, यदि लक्षित मॉडल ठीक से काम करना शुरू कर देता है, तो राउटर समस्या को बढ़ाने के बजाय स्वचालित रूप से स्थानीय मॉडल का उपयोग करने पर स्विच हो जाता है।

यह तंत्र प्रत्येक मॉडल के लिए क्षमता प्रोफाइल का समर्थन करता है, जिन्हें ऐतिहासिक डेटा के आधार पर ऑफ़लाइन बनाया जाता है और मॉडल संस्करण या प्रदर्शन बदलने पर एक मिनट के भीतर अपडेट किया जाता है। प्रत्येक चरण में, यह हाल की बातचीत और टूल कॉल की प्रगति का अध्ययन करता है, अंतिम उपयोगकर्ता अनुरोध को ध्यान में रखता है, और KV-कैश की निकटता, वर्तमान लोड और मॉडल के हालिया टाइमआउट या दर सीमा जैसे सिस्टम मापदंडों को भारित करता है।

अतिरिक्त रूप से, वैकल्पिक कॉन्टेक्स्टुअल बंजार्ड समान पिछले अनुरोधों के परिणामों पर प्रशिक्षित होता है और क्लासिफायर के निर्णय को रद्द कर सकता है यदि कोई अन्य स्तर स्पष्ट रूप से बेहतर परिणाम दिखाता है, जबकि कमजोर प्रमाण आधार होने पर मूल चयन को बनाए रखता है।

चूंकि रूटिंग एल्गोरिदम शुद्ध फ़ंक्शन हैं और मेमोरी एक अलग स्थिति परत में संग्रहीत होती है, इसलिए इस स्थिति के नुकसान से केवल सिस्टम ठंडी रूटिंग पर वापस आ जाता है, जिससे अनुरोध विफल नहीं होते हैं।

परीक्षण परिणाम

टीम ने X-Router को openJiuwen एजेंट वर्कस्वार्म में एकीकृत किया और 11 श्रेणियों में PinchBench के सभी 147 कार्यों का परीक्षण किया। प्रत्येक अनुरोध को Kimi-K2-Thinking पर भेजने पर $11.11 की मॉडल लागत पर 71.36% का प्रदर्शन प्राप्त हुआ। X-Router का उपयोग करके स्थिर रूटिंग ने $8.25 की लागत पर 66.3% दिखाया।

बंजार्ड प्रशिक्षण को सक्षम करने पर परिणाम बढ़कर 70.70% हो गया, और लागत घटकर $6.16 हो गई, जो बेसलाइन से लगभग 44.6% कम है।

LLMRouterBench के माध्यम से Terminal-Bench पर, Opus 4.8, Qwen3.5-122B और Qwen3.5-35B मॉडल पूल का उपयोग करते हुए, लागत बचाने पर केंद्रित सेटिंग ने Opus की तुलना में 51.4% कम लागत पर 95.2% सफलता हासिल की, जबकि गुणवत्ता पर केंद्रित सेटिंग ने 15.7% लागत में कमी के साथ 98.6% दिखाया।

राउटर को WorkSwarm में MoA बहु-मॉडल सहयोग सुविधा के साथ भी एकीकृत किया गया है, जो यह तय करने की अनुमति देता है कि जटिल प्रश्न का उत्तर देने से पहले कई मॉडलों को कब प्रतिक्रिया देनी चाहिए ताकि उनके परिणामों को संयोजित किया जा सके। टीम सुदृढीकरण शिक्षण का उपयोग करके रूटिंग रणनीतियों के प्रशिक्षण सहित स्व-विकसित सुविधाओं के आगे के विकास की योजना बना रही है।

लोकप्रिय