MirroS ने सिमुलेटेड कोड वर्ल्ड्स में एआई एजेंटों को प्रशिक्षित करने के लिए AgentGarten जारी किया
और पढ़ें
Pandaily
pandaily.com

MirroS ने सिमुलेटेड कोड वर्ल्ड्स में एआई एजेंटों को प्रशिक्षित करने के लिए AgentGarten जारी किया

MirroS की शोध टीम ने AgentGarten प्रस्तुत किया है - एक ऐसा फ्रेमवर्क जो एआई एजेंटों को इंटरैक्ट करने, अवलोकन करने और सीखने के लिए एक वातावरण प्रदान करता है। 9 अक्टूबर की QbitAI की रिपोर्ट के अनुसार, आवश्यक सभी कोड, तकनीकी रिपोर्ट और परियोजना पृष्ठ सार्वजनिक रूप से उपलब्ध हैं।

AgentGarten दुनिया के सिमुलेशन कार्य को दो भागों में विभाजित करता है। कोड खेल के नियमों, भौतिकी, संपर्कों और लेआउट के लिए जिम्मेदार है, जो स्पष्ट स्थिति और प्रत्येक परिणाम की पूर्वानुमेयता सुनिश्चित करता है। फिर न्यूरल रेंडरर कोड द्वारा निर्यात किए गए योजनाबद्ध ज्यामितीय चित्र (जैसे एजेंट के कैमरे से गहराई या सतह के सामान्य डेटा) को यथार्थवादी अगले फ्रेम में परिवर्तित करता है।

टीम का दावा है कि यह दृष्टिकोण दो सामान्य समझौतों से बचने की अनुमति देता है: गेम इंजनों का उपयोग करके बनाए गए दृश्य, जिनके लिए यथार्थवाद प्राप्त करने के लिए महंगी कलात्मक प्रोसेसिंग की आवश्यकता होती है; और विश्व मॉडल, जिसकी भौतिकी तंत्रिका नेटवर्क के भीतर छिपी होती है और जिसे अनुरोधित या बदला नहीं जा सकता है।

रेंडरर छोटे स्ट्रीमिंग सेगमेंट में वीडियो उत्पन्न करता है, जिससे एजेंट कार्रवाई कर सकता है, परिणाम देख सकता है और अगला निर्णय ले सकता है। MirroS ने Adversarial Forcing नामक विधि का उपयोग करके सिस्टम को प्रशिक्षित किया। इस विधि में सटीक पुनरुत्पादन शामिल है ताकि ग्रेडिएंट मॉडल द्वारा उत्पन्न इतिहास तक पहुंच सकें, साथ ही वास्तविक वीडियो पर प्रशिक्षित एक डिस्क्रिमिनेटर भी है ताकि लंबी क्रिया अनुक्रमों में बहाव और ग्रिड कलाकृतियों को रोका जा सके।

कस्टम Triton कर्नेल, CUDA ग्राफ और हल्के डिकोडर का उपयोग करने के कारण, सिस्टम एक ग्राफिकल प्रोसेसर पर 480p रिज़ॉल्यूशन पर 30 फ्रेम प्रति सेकंड से अधिक की दर का समर्थन करता है।

प्रशिक्षण प्रक्रिया की जांच के लिए, टीम ने 2019 के एक ज्ञात अध्ययन से छुपन-छुपाई के खेल का पुन: उपयोग किया। उस अध्ययन में, छिपने वालों द्वारा ठिकाने बनाने से पहले सुदृढीकरण शिक्षण के लिए लगभग 25 मिलियन एपिसोड की आवश्यकता थी, और खोजकर्ताओं द्वारा रैंप का उपयोग शुरू करने से पहले लगभग 100 मिलियन की आवश्यकता थी। AgentGarten में, एजेंटों ने केवल प्रथम-व्यक्ति फ्रेम देखे जो रेंडर किए गए थे, और उन्होंने पायथन में छोटी प्रोग्रामिंग के माध्यम से कार्यों को नियंत्रित किया। प्रत्येक दौर के बाद, उन्होंने अपने गेम सत्रों का विश्लेषण किया और एक 'नियम पुस्तिका' में सबक दर्ज किए जिन्हें अगले दौर में पारित किया गया। छिपने वालों ने चौथे दौर तक ठिकाने बनाना शुरू कर दिया, और खोजकर्ता दसवें दौर तक रैंप का उपयोग करके दीवारों को पार करने में सक्षम थे।

चार अन्य वातावरणों में भी इसी तरह का चक्र चार दौरों के लिए शुरू किया गया था। प्रदर्शन में सुधार हुआ: साथी कुत्ते का मूल्यांकन 13 से बढ़कर 19 हो गया, दो कारों द्वारा पुल पार करने का समय 71 से घटकर 41 सेकंड हो गया, दो चरवाहों के कुत्तों ने तीन के बजाय सभी चार भेड़ों को इकट्ठा किया, और खदान के लिए लोडर ने निर्धारित समय से 31 सेकंड पहले अपना काम पूरा कर लिया।

MirroS इस कार्य को ऐसे एजेंटों के निर्माण की दिशा में एक कदम के रूप में देखता है जो भौतिक परिस्थितियों में लगातार बेहतर होते हैं, इस बात पर जोर देते हुए कि यह तैनाती के लिए तैयार उत्पाद के बजाय एक अनुसंधान वातावरण है।

लोकप्रिय