IQuest Research ने IQuest-Q1 मॉडल जनता के लिए जारी किया है, जो एक विरल भाषा मॉडल है जिसे 'मिश्रण-के-विशेषज्ञ' (MoE) प्रकार का है। इसे एजेंटों के भीतर कोडिंग, तर्क और बहु-चरणीय टूल उपयोग के कार्यों के लिए विकसित किया गया है। मॉडल में कुल लगभग 320 बिलियन पैरामीटर हैं, जबकि प्रति टोकन लगभग 15 बिलियन पैरामीटर सक्रिय होते हैं।
वजन और मॉडल कार्ड 28 सितंबर को IQuestLab संगठन पर Hugging Face प्लेटफॉर्म पर प्रकाशित किए गए थे, और इन्फेरेंस के लिए कोड IQuest-Q1 की विशेष लाइसेंस के तहत GitHub पर उपलब्ध है। टीम IQuest-Q1 को एजेंट कमांड लाइन सिस्टम के लिए एक मौलिक मॉडल के रूप में प्रस्तुत करती है।
तकनीकी विशिष्टताएँ और प्रशिक्षण
मॉडल कार्ड के अनुसार, IQuest-Q1 में 88 ट्रांसफार्मर परतें, 256 विशेषज्ञ हैं, जिनमें से प्रत्येक टोकन पर आठ सक्रिय होते हैं। मॉडल एक हाइब्रिड अटेंशन पैटर्न का उपयोग करता है, जिसमें तीन स्लाइडिंग विंडो लेयर और एक फुल अटेंशन लेयर का संयोजन शामिल है, और यह 524,288 टोकन का संदर्भ विंडो भी सपोर्ट करता है। मल्टी-टोकन भविष्यवाणी के लिए स्पेक्युलेटिव डिकोडिंग का समर्थन करने वाली परतें प्रदान की गई हैं।
IQuest आठ ग्राफिक्स प्रोसेसिंग यूनिट (GPU) पर SGLang या vLLM के साथ मॉडल का उपयोग करने और इसे Claude Code या Codex जैसे वातावरण के अंदर चलाने की सलाह देता है। प्री-ट्रेनिंग और इंटरमीडिएट ट्रेनिंग प्रक्रिया में कोड और STEM विषयों की ओर डेटा शिफ्ट करना और लंबी संदर्भ वाले एजेंट ट्रेजेक्टरी जोड़ना शामिल था, जिसके बाद एजेंट-केंद्रित तीन चरण आए।
IQuest ने वास्तविक API, MCP सर्वर और निष्पादन योग्य रिपॉजिटरी सहित अपनी प्रणालियों के साथ कार्य तैयार किए और कई वातावरणों पर एक नीति को प्रशिक्षित किया। रीइन्फोर्समेंट लर्निंग विधियों ने विभिन्न परिदृश्यों के लिए चार विशेषज्ञ मॉडल बनाए - एजेंट उपयोगकर्ता अनुभव, कई वातावरणों में काम करना, बड़े क्षितिज वाले कार्य और सामान्य एजेंट संचालन। इन मॉडलों को बाद में नीति के माध्यम से मल्टी-टीचर डिस्टिलेशन द्वारा एक एकल छात्र में संयोजित किया गया।
परीक्षण परिणाम
प्रकाशित बेंचमार्क पर परीक्षण करते समय, IQuest-Q1 ने निम्नलिखित परिणाम दिखाए: DeepSWE v1.1 पर 64.6, NL2Repo पर 63.0, CyberGym पर 84.5, Terminal-Bench 2.1 पर 83.2, JobBench पर 55.7 और Agents' Last Exam पर 29.6। तुलनात्मक तालिका दर्शाती है कि मॉडल NL2Repo पर GLM-5.3 और DeepSeek-V4-Pro से बेहतर प्रदर्शन करता है, हालांकि DeepSWE और CyberGym परीक्षणों में यह DeepSeek-V4.1-Flash से पीछे रहता है। अन्य मॉडलों के परिणाम जहां संभव हो, सार्वजनिक रूप से प्रस्तुत किए गए हैं।
IQuest ने इस बात पर भी जोर दिया कि मॉडल मानव नियंत्रण के तहत विकसित किया गया था। एक मामले में, जैसा कि IQuest के ब्लॉग में वर्णित है, Claude Code में काम कर रहा IQuest-Q1 ने पाया कि रिवॉर्ड कर्व में धीमापन टेक्स्ट डिकोडिंग के दौरान डाले गए अतिरिक्त स्पेस के कारण हुआ था, जिसके परिणामस्वरूप सीखने के हानि फ़ंक्शन में केवल बहु-चरणीय ट्रेजेक्टरी का अंतिम कदम बचा था। इस त्रुटि को ठीक करने के बाद औसत इनाम बहाल हो गया। शोधकर्ताओं ने अनुसंधान की दिशा, महंगी प्रयोगों और कार्यान्वयन के लिए संस्करणों के चयन पर नियंत्रण बनाए रखा। टीम चेतावनी देती है कि मॉडल पाठ-आधारित है, प्रारंभिक चरण में है और कमांड लाइन में वास्तविक कार्यों को निष्पादित करते समय निरंतर मानव नियंत्रण की आवश्यकता है।


