लाइट ओरिजिन कंपनी ने अपना मॉडल लाइटनेव-0 सार्वजनिक कर दिया है। यह कॉम्पैक्ट यूनिवर्सल नेविगेशनल मॉडल Qwen3-VL-4B बैकबोन पर बनाया गया है और इसे वज़न, कोड, तकनीकी रिपोर्ट और INSIGHT-Bench मूल्यांकन किट के साथ जारी किया गया है।
कंपनी इस मॉडल को एक नेविगेशनल ब्रेन के रूप में प्रस्तुत करती है जो निर्देशों का पालन करने, खुले शब्दावली वाले ऑब्जेक्ट्स पर नेविगेट करने और विज़ुअल ट्रैकिंग जैसे कार्यों को पूरा करने के लिए एक एकीकृत टोकन इंटरफ़ेस का उपयोग करता है, जिसके लिए प्रत्येक कार्य के लिए विशेष आउटपुट लेयर्स की आवश्यकता नहीं होती है।
कार्य का आधार घोषित पैमाने पर Real2Sim2Real प्रक्रिया है। एक विशेष डेटा इंजन इंटरनेट से एकत्र किए गए 2000 से अधिक वास्तविक दृश्यों को पुन: प्रयोज्य सिमुलेटर में परिवर्तित करता है। फिर दृष्टि, भाषा और क्रिया की सुसंगत बातचीत के 4000 घंटे से अधिक का संश्लेषण किया जाता है।
प्रशिक्षण प्रक्रिया तीन चरणों में होती है: पहले स्थानिक प्रतिनिधित्व बनाने के लिए एम्बोडीड रीजनिंग के साथ प्रशिक्षण होता है; इसके बाद सुसंगत ट्रेजेक्टरीज़ पर एम्बोडीड कंट्रोल्ड फाइन-ट्यूनिंग होती है; और अंत में, ऑनलाइन रीइन्फोर्समेंट लर्निंग का उपयोग किया जाता है, जिससे नीति अपनी स्वयं की त्रुटियों के आधार पर बेहतर हो सके।
विविधता सुनिश्चित करने के लिए, कैमरे की ऊंचाई, दृश्य क्षेत्र और झुकाव को यादृच्छिक बनाया जाता है ताकि किसी भी फाइन-ट्यूनिंग पर शुरू होने से पहले समान दृश्यों को कई दृष्टिकोणों से कवर किया जा सके।
मूल्यांकन करते हुए, लाइट ओरिजिन बताती है कि फर्स्ट-पर्सन व्यू से लिया गया मोनोक्युलर RGB लाइटनेव-0 दस विभिन्न नेविगेशनल परिदृश्यों में उच्च परिणाम प्रदर्शित करता है। इन परिदृश्यों में VLN-CE, मैटरपोर्ट3D/HM3D ऑब्जेक्ट नेविगेशन, HM3D-OVON और EVT-Bench ट्रैकिंग शामिल हैं।
यह मॉडल सिंगल-कैमरा तरीकों में शीर्ष स्थान रखता है और पैनोरमिक सिस्टम को शामिल करने पर भी प्रतिस्पर्धी बना रहता है। दो-चैनल निर्देश टोकन छवि स्थान में स्थानिक इरादों को व्यक्त करते हैं। आगे, अवशेष वेक्टर क्वांटाइजेशन के साथ त्रि-स्तरीय एक्शन टोकनाइज़र टीम के अनुसार सेंटीमीटर में पुनर्निर्माण त्रुटि के साथ 10-स्टेप चंक को डिकोड करता है।
जीरो-नॉलेज डेमो विभिन्न आंतरिक और बाहरी दृश्यों में मानवोइड, चौपाया, पहिया और हवाई प्लेटफार्मों पर एक ही चेकपॉइंट को लागू करने की अनुमति देते हैं जो पहले कभी नहीं देखे गए थे, जिसमें भीड़भाड़ वाली सड़कों पर ट्रैकिंग भी शामिल है।
सभी कलाकृतियाँ GitHub पर lightorigins/LightNav-0 और Hugging Face पर LightOriginsHQ/LightNav-0 पर Apache 2.0 लाइसेंस के तहत सार्वजनिक रूप से उपलब्ध हैं। रोबोटिक्स में लगे टीमों के लिए, सबसे मूल्यवान पहलू केवल एक और VLN स्कोर नहीं है, बल्कि सुसंगतता का पुनरुत्पादनीय चक्र है - वास्तविक दृश्यों से सिमुलेशन तक, और फिर विषम निकायों तक - जिसका उद्देश्य टेलीऑपरेशन पर अत्यधिक निर्भर नेविगेशन डेटा संग्रह को कम करना है, जबकि एक एकीकृत RGB और भाषा इंटरफ़ेस बनाए रखा जाता है।
