स्बर कंपनी ने Kandinsky WM 1.0 जनरेटिव मॉडल परिवार के लॉन्च की घोषणा की है, जो उच्च स्तर की भौतिक विश्वसनीयता वाले वीडियो सामग्री के उत्पादन के लिए डिज़ाइन किए गए हैं। ये वीडियो फुटेज फिजिकल एआई सिस्टम, जिसमें बिना चालक वाला परिवहन और विभिन्न रोबोट शामिल हैं, को प्रशिक्षित करने के लिए आवश्यक हैं।
N + 1 की संपादकीय टीम को प्राप्त प्रेस विज्ञप्ति के अनुसार, इन मॉडलों का कोड और वज़न MIT लाइसेंस के तहत प्रकाशित किए गए हैं, जिससे वे डेवलपर्स के लिए मुफ्त उपयोग के लिए उपलब्ध हैं।
फिजिकल एआई सिस्टम को बुद्धिमान सिस्टम के रूप में परिभाषित किया गया है जो वास्तविक भौतिक वातावरण के साथ बातचीत कर सकते हैं, जिसमें पैदल यात्री, वाहन, औद्योगिक उपकरण और अन्य रोबोट शामिल हैं। ऐसे सिस्टम के प्रशिक्षण का आधार व्यापक वीडियो डेटासेट होते हैं। हालांकि, इस तरह के डेटा को एकत्र करना अक्सर महंगा और श्रमसाध्य होता है, और वास्तविक परिस्थितियों में दुर्घटनाओं, उपकरणों की विफलता या चरम मौसम की घटनाओं जैसे कुछ महत्वपूर्ण परिदृश्यों को रिकॉर्ड करना असंभव होता है।
इसके अलावा, रोबोटों, जैसे फोर्कलिफ्ट या बिना चालक टैक्सी, को सीधे कार्यप्रवाह में फाइन-ट्यून करना न केवल महंगा है, बल्कि संभावित रूप से खतरनाक भी है।
पहले, फिजिकल एआई को प्रशिक्षित करने के लिए न्यूरल नेटवर्क द्वारा उत्पन्न वीडियो का उपयोग कई कलाकृतियों के कारण चुनौतियों का सामना करता था: ज्यामिति में विकृतियाँ, परिप्रेक्ष्य की समस्याएं और वस्तुओं का अप्राकृतिक, 'नरम' विरूपण दिखाई देना। स्बर के डेवलपर्स ने, डेनिस दिमित्रोव के नेतृत्व में, इस समस्या का समाधान करते हुए भौतिक रूप से विश्वसनीय वीडियो दृश्यों को उत्पन्न करने के लिए एक विशेष मॉडल परिवार बनाया।
नए मॉडल Kandinsky 5.0 Video Lite पर आधारित हैं, लेकिन उन्हें रोबोट कैमरों, बिना चालक वाहनों और औद्योगिक प्रक्रियाओं के दौरान एकत्र किए गए लाखों वीडियो रिकॉर्डिंग पर अतिरिक्त रूप से प्रशिक्षित किया गया है। डेवलपर्स के अनुसार, इसने वीडियो पीढ़ी में सामान्य त्रुटियों को काफी कम करने की अनुमति दी है।
इन Kandinsky WM मॉडलों के कारण, यह पांच सेकंड के आसपास की अवधि के भौतिक रूप से सही वीडियो क्लिप बनाना सीख गया है। ये फुटेज विभिन्न कार्यों और स्थितियों को प्रदर्शित कर सकते हैं, जैसे वस्तुओं के साथ हेरफेर, सड़क के दृश्य या उत्पादन चक्रों के चरण। प्राप्त सामग्री कंप्यूटर विजन सिस्टम और बिना चालक परिवहन के लिए सिमुलेटर को प्रशिक्षित करने के लिए उपयोगी है।
ऑटोमोबाइल दृश्यों की गुणवत्ता बढ़ाने के लिए सुदृढीकरण सीखने (reinforcement learning) का एक अतिरिक्त चरण लागू किया गया था: Kandinsky WM वीडियो उत्पन्न करता था, और अन्य न्यूरल नेटवर्क मूल्यांकनकर्ताओं के रूप में कार्य करते थे, वस्तुओं के आकार के संरक्षण, दृश्य की ज्यामितीय सटीकता और गतिविधियों की प्राकृतिकता की जांच करते हुए प्रतिक्रिया प्रदान करते थे।
Kandinsky WM 1.0 मॉडल पहले से ही Kandinsky प्रोजेक्ट के खुले रिपॉजिटरी में उपलब्ध हैं। प्रेस विज्ञप्ति में उल्लेख किया गया है कि AIRI संस्थान इन मॉडलों का उपयोग अपने रोड सिम्युलेटर में करता है, और स्बर रोबोटिक्स सेंटर इनका उपयोग अपने रोबोटों को प्रशिक्षित करने के लिए करता है।
सामग्री के दूसरे भाग में उल्लेख किया गया है कि एयरबस (Airbus) ने U145 नामक एक मॉकअप प्रस्तुत किया है - H145 हेलीकॉप्टर का बिना चालक संस्करण। इस संशोधन में, पायलट के केबिन को एआई नियंत्रण प्रणाली वाले सेंसर के सेट से बदल दिया गया है, और केबिन के स्थान पर लोडिंग के लिए एक फोल्डिंग टेबल वाला दरवाजा स्थापित किया गया है। पहले उड़ान की योजना 2026 के अंत के लिए है, और पूर्ण परिचालन शुरुआत अगले दशक में अपेक्षित है।