जनमिन विश्वविद्यालय के शोधकर्ताओं ने दीर्घकालिक एजेंटों पर एक व्यापक 149-पृष्ठ की समीक्षा प्रकाशित की है। इस कार्य में अगली पीढ़ी के कृत्रिम बुद्धिमत्ता एजेंटों के लिए दो मुख्य विकास पथ प्रस्तावित किए गए हैं: रनटाइम क्षमताओं को बेहतर बनाने के लिए सिस्टम इंजीनियरिंग (हार्नेस इंजीनियरिंग) और मॉडल ऑप्टिमाइज़ेशन, जो धीरे-धीरे सीखने के माध्यम से क्षमताओं को वापस मॉडल में एकीकृत करता है।
एजेंटों की संरचना और विशेषताएँ
जनमिन विश्वविद्यालय के GAIR अनुसंधान केंद्र द्वारा बीजिंग विश्वविद्यालय, त्सिंगहुआ विश्वविद्यालय, सून् यातसेन विश्वविद्यालय, हांगकांग विज्ञान और प्रौद्योगिकी विश्वविद्यालय और सिंगापुर राष्ट्रीय विश्वविद्यालय के साथ तैयार की गई यह व्यापक समीक्षा इस विकसित हो रहे क्षेत्र को समझने के लिए पहली व्यवस्थित नींव प्रस्तुत करती है। इन एजेंटों को परिभाषित करने वाली प्रमुख विशेषता परस्पर निर्भर निर्णयों को सुसंगत प्रक्षेपवक्रों में व्यवस्थित करने की क्षमता है।
कार्य की जटिलता पदानुक्रम
समीक्षा का मुख्य योगदान कार्यों की जटिलता के तीन-स्तरीय पदानुक्रम और संबंधित क्षमताओं के पदानुक्रम को प्रस्तुत करना है। H1 स्तर के कार्य, जो एक ही संदर्भ विंडो के भीतर हल होते हैं, योजना-कार्रवाई-फीडबैक-सुधार चक्रों को बनाए रखने और C1 इंटरैक्टिव तर्क क्षमता के अनुरूप होते हैं। H2 स्तर के कार्य, जो घंटों या दिनों तक फैले होते हैं, इतिहास को संपीड़ित करने, प्रगति को बनाए रखने और सत्रों के बीच स्थानांतरित करने की आवश्यकता होती है, जो विस्तारित संदर्भ विंडो की क्षमताओं से परे है; यहां मौलिक बाधा 'संदर्भ क्षय' (Context Rot) के रूप में पहचानी जाती है, जो C2 स्थिति और स्मृति के अनुरूप है। सबसे जटिल कार्य, H3, विभिन्न प्रक्रियाओं के बीच कार्यों के प्रवाह का प्रतिनिधित्व करते हैं, जहां कार्य वातावरण, उपकरणों और लक्ष्यों में परिवर्तन के साथ लगातार आते रहते हैं, जिसके लिए बहु-उपयोगी कौशल में अनुभव संचय और निरंतर सुधार की आवश्यकता होती है, जो C3 अनुभव संचय और निरंतर सीखने के अनुरूप है।
प्रगति पर मात्रात्मक डेटा
समीक्षा सार्वजनिक METR डेटा का उपयोग करके क्षमताओं की प्रगति के मात्रात्मक प्रमाण प्रदान करती है। विश्लेषण से पता चलता है कि 50% कार्यों को पूरा करने की अवधि, जिसे मानव विशेषज्ञ के समतुल्य समय के रूप में मापा जाता है उन कार्यों के लिए जिन्हें एजेंट लगभग 50% सफलता के साथ निष्पादित करता है, पूरे डेटासेट पर हर 196.5 दिनों (लगभग 7 महीने) में दोगुनी हो जाती है। 2023 के बाद की अवधि पर ध्यान केंद्रित करने पर यह लगभग 130.8 दिनों (4 महीने) तक तेज हो जाता है। 2026 तक, GPT-3 ने लगभग 9 सेकंड का कार्य निष्पादन समय दिखाया, GPT-4 ने लगभग 4 मिनट, o3 ने लगभग 2 घंटे, और Claude Opus 4.6 ने लगभग 12 घंटे। मिनट से घंटों और दर्जनों घंटों तक यह बदलाव H1 से H2 और फिर H3 तक क्षमताओं के उत्थान को दर्शाता है।
एआई एजेंटों के विकास युग
लेखकों ने एआई एजेंटों के विकास के तीन युगों का वर्णन किया है। पहला, प्रॉम्प्ट इंजीनियरिंग का युग (2020-2023), तर्क श्रृंखला (चेन-ऑफ-थॉट) और एक ही मॉडल कॉल के भीतर कार्यों के विघटन पर आधारित था। अगला, कॉन्टेक्स्ट इंजीनियरिंग का युग (2023-2025), RAG, फ़ंक्शन कॉलिंग और मेमोरी के माध्यम से मॉडल जो देख सकता है उस पर नियंत्रण का विस्तार करता है। अंत में, सिस्टम इंजीनियरिंग (हार्नेस इंजीनियरिंग) का युग आ रहा है, जहां क्षमताओं की सीमा मॉडल के चारों ओर सिस्टम आर्किटेक्चर द्वारा निर्धारित होती है। लेखक का तर्क है कि मुख्य समझ यह है कि नियंत्रित इंजीनियरिंग समाधानों का क्षेत्र धीरे-धीरे बाहर की ओर फैलता है, और दीर्घकालिक क्षमताएं न केवल मॉडल की बुद्धिमत्ता में सुधार पर निर्भर करती हैं, बल्कि आसपास की सिस्टम वास्तुकला की परिष्कारिता पर भी निर्भर करती हैं। यह 149-पृष्ठ की समीक्षा तेजी से बढ़ते, लेकिन पहले व्यवस्थित नहीं किए गए क्षेत्र के लिए एक सामान्य शब्दावली और वैचारिक आधार स्थापित करती है, जिससे शोधकर्ताओं और चिकित्सकों को एजेंट क्षमताओं के अगले चरण के विकास के लिए एक रोडमैप मिलता है।