झोंगगुआनचुन अकादमी और झोंगगुआनचुन आर्टिफिशियल इंटेलिजेंस इंस्टीट्यूट ने ZGCM-1-7B मॉडल जारी किया है। यह 7.39 बिलियन पैरामीटर वाला एक पूरी तरह से खुला सघन मॉडल है जिसे टूल का उपयोग करके गणितीय तर्क और एजेंट खोज कार्यों के लिए डिज़ाइन किया गया है।
वज़न, प्रशिक्षण डेटा और प्रशिक्षण कोड Hugging Face और GitHub प्लेटफॉर्म पर MIT लाइसेंस के तहत उपलब्ध हैं, जबकि विस्तृत तकनीकी रिपोर्ट arXiv पर प्रकाशित की गई है।
यह मॉडल सीमित स्लाइडिंग विंडो वाले 27 परतों और पांच वैश्विक परतों से बनी हाइब्रिड अटेंशन आर्किटेक्चर का उपयोग करता है। यह 256 हजार टोकन का संदर्भ विंडो समर्थन करता है और एक ही चेकपॉइंट में प्रत्यक्ष उत्तर और विचार दोनों मोड प्रदान करता है।
प्री-ट्रेनिंग चरण में लगभग 4.19 ट्रिलियन टोकन का उपयोग हाइब्रिड प्रेसिजन FP8 और म्यूऑन ऑप्टिमाइज़ेशन के साथ किया गया था। मध्यवर्ती प्रशिक्षण के दौरान, संदर्भ को 16 हजार से 64 हजार और फिर 256 हजार तक बढ़ाया गया, जिसमें लगभग 600 बिलियन टोकन का उपयोग किया गया। इस दौरान, इंटरैक्शन ट्रेजेक्टरीज़ को MDP स्टेट-एक्शन ट्रांजिशन में परिवर्तित किया गया।
सुपरवाइज्ड फाइन-ट्यूनिंग ने सामान्य और एजेंट ट्रेजेक्टरीज़ को एकीकृत किया, जिसमें टूल उपयोग शामिल था, जिसका सत्यापन निष्पादन द्वारा किया गया था, और केवल सहायक पर केंद्रित हानि थी।
विचार मोड में, मॉडल ने MATH-500 पर लगभग 97.13%, AIME 2026 पर 75.00% और HMMT 2025 पर 70.42% परिणाम दिखाए। रिपोर्ट के अनुसार, इन प्रदर्शनों ने चौदह तर्क बेंचमार्क पर सात तुलनात्मक 7-8 बिलियन पैरामीटर मॉडलों में सर्वश्रेष्ठ औसत रैंक सुनिश्चित किया।
एजेंट खोज कार्यों में, ZGCM-1 ने वेब सर्च और पेज रीडिंग का उपयोग करते हुए WebWalkerQA पर लगभग 63.09%, BrowseComp पर 19.43%, और उपकरणों Ghidra का उपयोग करते हुए Binary Function Search पर 62.00% हासिल किया।
आर्किटेक्चर प्रयोग दिखाते हैं कि 256K संदर्भ पर प्रशिक्षण थ्रूपुट पूर्ण ध्यान की तुलना में लगभग 3.94 गुना अधिक है। इसके अलावा, आर्किटेक्चर, प्रेसिजन, ऑप्टिमाइज़र और नॉर्मलाइज़ेशन चयन के संयोजन के कारण, प्री-ट्रेनिंग शुरू होने से लेकर 16K पर हानि प्राप्त करने तक का समय लगभग 4.2 गुना कम हो गया।
तेजी से शुरुआत के लिए उपयोगकर्ता मॉडलिंग फ़ाइलों के लिए trust_remote_code फ़ाइल की आवश्यकता होती है। टीम विभिन्न चरणों के लिए कॉन्फ़िगरेशन भी प्रकाशित करती है: डेटा प्रोसेसिंग, प्री-ट्रेनिंग, इंटरमीडिएट ट्रेनिंग, SFT और RL। बताया गया है कि डेटा क्यूरेशन और मूल्यांकन में शोधकर्ताओं द्वारा नियंत्रित AI एजेंटों ने भाग लिया। खुले वज़न के साथ काम करने वाली प्रयोगशालाओं के लिए, ZGCM-1 चैट की नवीनता से अधिक, ZGCM ब्रांड के तहत गणित और खोज के लिए एक कॉम्पैक्ट बेस मॉडल प्रस्तुत करता है जिसमें पारदर्शी एंड-टू-एंड पाइपलाइन है।

