ACE रोबोटिक्स और NTU ने ओपन-सोर्स मल्टीमॉडल वर्ल्ड मॉडल Puffin-World जारी किया
और पढ़ें
Pandaily
pandaily.com

ACE रोबोटिक्स और NTU ने ओपन-सोर्स मल्टीमॉडल वर्ल्ड मॉडल Puffin-World जारी किया

ACE Robotics ने नानयांग टेक्नोलॉजिकल यूनिवर्सिटी के S-Lab के साथ, बीजिंग जियाओटोंग यूनिवर्सिटी और मिशिगन विश्वविद्यालय की भागीदारी से, Puffin-World को सार्वजनिक रूप से उपलब्ध कराया है। यह एकीकृत मल्टीमॉडल वर्ल्ड मॉडल दुनिया की भौतिकी, ज्यामिति और उपस्थिति को दुनिया की अभिन्न त्रि-आयामी अवस्थाओं के रूप में देखता है।

जारी किए गए पैकेज में Puffin-16M का कोड, मॉडल और डेटासेट शामिल है। विकास का उद्देश्य केवल RGB छवियों के आधार पर अगले फ्रेम की भविष्यवाणी करने के बजाय रोबोटों के लिए तैयार धारणा और सिमुलेशन प्रदान करना है।

अधिकांश जनरेटिव वर्ल्ड मॉडल भविष्य के पिक्सेल की भविष्यवाणी करने पर ध्यान केंद्रित करते हैं। हालांकि, Puffin-World गुरुत्वाकर्षण-जागरूक भौतिक स्थिति के मॉडलिंग को एकीकृत करता है, जिसमें अक्षांश संकेतक, गहराई से पुनर्प्राप्त ज्यामिति की स्थिति और RGB प्रारूप में प्रस्तुत उपस्थिति की स्थिति शामिल है। ये सभी तत्व Omni-Camera प्रतिनिधित्व के माध्यम से जुड़े हुए हैं, जो निरपेक्ष और सापेक्ष कैमरा फ्रेम को जोड़ता है।

निरपेक्ष संदर्भ बिंदु वास्तविक गुरुत्वाकर्षण और अभिविन्यास के संबंध में अवलोकनों को स्थिर करते हैं, जबकि सापेक्ष किरण ज्यामिति निरंतर दृश्य बिंदु परिवर्तन और संयुक्त गति का समर्थन करती है। मॉडल एक ही छवि से निरपेक्ष रोल, पिच और ऊर्ध्वाधर दृश्य क्षेत्र का आकलन करने में सक्षम है, साथ ही मनमाने दृश्य बिंदु के साथ प्रक्षेपवक्र संश्लेषित करना, सघन ज्यामिति को पुनर्स्थापित करना और पाठ या दृश्य डेटा का उपयोग करके गुरुत्वाकर्षण और स्थिति के अनुसार बहाव को समायोजित करते हुए उत्पन्न दृश्य में बंद अन्वेषण करना भी सक्षम है।

प्रशिक्षण का पैमाना Puffin-16M डेटासेट द्वारा सुनिश्चित किया जाता है, जिसमें Puffin-Cam-15M में लगभग 15 मिलियन 'दृश्य-भाषा-कैमरा' ट्रिपलेट और Puffin-Traj-1M में 1 मिलियन जटिल प्रक्षेपवक्र शामिल हैं। ये प्रक्षेपवक्र विभिन्न वातावरणों में पिच, यॉ, रोल और संयुक्त गति को कवर करते हैं: आंतरिक, बाहरी, सिंथेटिक और सड़क परिदृश्य।

टीम ने 28 सार्वजनिक डेटासेट में कैमरे की निरपेक्ष स्थिति के लेबल जोड़ने के लिए Puffin-World का भी उपयोग किया, जो लगभग 44.5 मिलियन छवियों को कवर करते हैं जो आगे के शोध के लिए उपलब्ध हैं। डेटा में यह योगदान निरपेक्ष स्थिति में अंतराल को भरने के लिए है जो केवल सापेक्ष डेटा पर आधारित कैमरा कॉर्पस में मौजूद है, क्योंकि वे गुरुत्वाकर्षण संरेखण को प्रशिक्षित नहीं कर सकते हैं।

चार सार्वजनिक बेंचमार्क, जो कैमरा बनाम दुनिया की तुलना करते हैं - Stanford2D3D, MegaDepth, TartanAir और LaMAR - Puffin-World अपने वर्ग में सर्वश्रेष्ठ माध्य त्रुटियां प्रदर्शित करता है। Stanford2D3D पर, रोल, पिच और ऊर्ध्वाधर दृश्य क्षेत्र के लिए माध्य त्रुटियां क्रमशः 0.29°, 0.53° और 1.62° तक कम हो जाती हैं। इसके अलावा, मॉडल MegaDepth (0.28°), TartanAir (0.31°) और LaMAR (0.26°) में डिग्री के भीतर सबसे कम रोल दिखाता है।

परियोजना सामग्री में बहु-दृष्टिकोण मॉडलिंग के लिए RealEstate10K पर अग्रणी PSNR और LPIPS स्कोर और मनमाने दृश्य बिंदु के लिए कैमरा नियंत्रण पर परीक्षण बेंचों पर कम कोण त्रुटियां भी इंगित की गई हैं। वास्तुकला में दृष्टि एन्कोडर, ज्यामिति के साथ संरेखित भाषा मॉडल, डिफ्यूजन जेनरेटर और एक हल्का कनेक्टर शामिल है। यह समझ, पीढ़ी और पुनर्निर्माण को बाहरी ज्यामिति मॉड्यूल के बिना एक ही संरचना का उपयोग करने की अनुमति देता है, जो कार्य-विशिष्ट है।

एम्बोडीड स्टैक सिस्टम के लिए, ओपन रिलीज़ एक एकल नियंत्रण बिंदु प्रदान करता है जो कैमरे की निरपेक्ष भौतिकी को समझ सकता है, नियंत्रित दृश्य बिंदुओं का अनुकरण कर सकता है और सुसंगत त्रि-आयामी दुनिया को फिर से बना सकता है। यह साधारण फ्रेम भविष्यवाणी से भौतिक परिदृश्य के अस्तित्व और इसे कैसे खोजा जा सकता है के मॉडलिंग में बदलाव का प्रतिनिधित्व करता है।

लोकप्रिय