Clockwork.io ने बुनियादी ढांचे की विफलताओं के कारण उत्पन्न होने वाली परिचालन समस्याओं से निपटने के लिए $31 मिलियन की नई पूंजी जुटाई है, जिससे जीपीयू की भारी मात्रा में कंप्यूटिंग संसाधनों का नुकसान हो सकता है।
बुनियादी ढांचे में एक छोटा सा व्यवधान भी हजारों परस्पर जुड़े ग्राफिक्स प्रोसेसिंग यूनिट्स के काम को रोक सकता है। सिस्टम के धीमे रीबूट के दौरान महत्वपूर्ण वित्तीय संसाधन वास्तव में खो जाते हैं। कंपनी का लक्ष्य उन्नत सॉफ्टवेयर लागू करना है जो हार्डवेयर की वास्तविक विफलता होने से पहले ही प्रशिक्षण कार्य का पता लगाता है।
आर्टिफिशियल इंटेलिजेंस का स्केलिंग एक अत्यंत महंगा और जटिल प्रक्रिया है। जब कंपनियां हजारों जुड़े हुए चिप्स पर विशाल मॉडल को प्रशिक्षित करती हैं, तो आदर्श सिंक्रनाइज़ेशन बिल्कुल आवश्यक होता है। यदि केवल एक सर्वर फ्रीज हो जाता है, तो पूरा वितरित भार रुक जाता है।
ऐतिहासिक रूप से इस समस्या को हल करने का एकमात्र तरीका चेकपॉइंट का अंधा रीबूट था, लेकिन यह अक्षम प्रक्रिया घंटों की मूल्यवान गणनाओं को बर्बाद करती है। उदाहरण के लिए, मेटा ने बताया कि अपने Llama 3 मॉडल को प्रशिक्षित करते समय उन्हें लगभग हर तीन घंटे में अप्रत्याशित विफलताओं का सामना करना पड़ा। रीबूट के दौरान सिलिकॉन के निष्क्रिय रहने के लिए भुगतान जारी रखना आधुनिक अत्यधिक प्रतिस्पर्धी तकनीकी वातावरण में अस्थिर है।
समाधान हार्डवेयर विफलता को रोकने की कोशिश करना बंद करना और सॉफ्टवेयर को क्षति को अनदेखा करना सिखाना है। यहीं पर Clockwork की प्रतिभा सामने आती है। उनके मुख्य उपकरण, TorchPass और LinkPass, नाजुक हार्डवेयर और महत्वपूर्ण वर्कफ़्लो के बीच एक अदृश्य बुद्धिमान बफर के रूप में कार्य करते हैं।
यदि नेटवर्क कनेक्शन अचानक विफल हो जाता है, तो LinkPass तुरंत ट्रैफ़िक को पुनर्निर्देशित करता है। यदि गणना के दौरान जीपीयू विफल होना शुरू हो जाता है, तो TorchPass वर्तमान कार्य को स्वस्थ चिप पर सुचारू रूप से स्थानांतरित कर देता है। इसके अलावा, कंपनी ने हाल ही में एक उद्योग-पहला फ़ंक्शन पेश किया है जो डेवलपर्स के कोड में बदलाव किए बिना चलते-फिरते मल्टी-नोड कार्य के स्नैपशॉट लेने की अनुमति देता है।
समाधान की वैधता का प्रमाण बाजार के प्रमुख खिलाड़ियों द्वारा इसका कार्यान्वयन है। यह दृष्टिकोण पहले ही वास्तविक दुनिया में परखा जा चुका है। उदाहरण के लिए, लिंक्डइन अपनी व्यापक प्रणालियों में इस फॉल्ट टॉलरेंस लेयर का उपयोग करता है, जिससे हर महीने हजारों घंटों के जीपीयू के निष्क्रिय समय को सक्रिय रूप से रोका जाता है। विफलताएं, जो पहले बड़े परिचालन संकट पैदा करती थीं, अब नियमित रखरखाव के रूप में देखी जाती हैं।
Together AI और WhiteFiber जैसे क्लाउड समाधान प्रदाता भी इस तकनीक को सक्रिय रूप से लागू कर रहे हैं। वे Clockwork.io में निवेश करते हैं क्योंकि ग्राहकों को विश्वसनीय और निर्बाध कंप्यूटिंग शक्ति प्रदान करना उनके व्यवसाय मॉडल का आधार है।
इस महत्वपूर्ण धन प्रवाह के कारण, जिसका नेतृत्व Premji Invest और Wing Venture Capital जैसे बड़े निवेशकों ने किया है, कंपनी का कुल वित्तपोषण $73 मिलियन तक पहुंच गया है। Clockwork.io इस पूंजी का उपयोग बुनियादी ढांचे की फॉल्ट टॉलरेंस के नियमों को मौलिक रूप से बदलने के लिए करने की योजना बना रहा है।
जैसे-जैसे मॉडल तेजी से बढ़ते हैं, हार्डवेयर विफलता की संभावना गणितीय अनिवार्यता के करीब पहुंचती है। इन विशाल वर्कलोड की सुरक्षा केवल एक वांछनीय विकल्प नहीं है, बल्कि अस्तित्व के लिए एक महत्वपूर्ण तंत्र है। रीबूट चक्र में निष्क्रिय रहने के बजाय महंगे चिप्स को सक्रिय रूप से चालू रखने का रखरखाव अगली पीढ़ी के आर्टिफिशियल इंटेलिजेंस विकास के लिए मुख्य लाभ है।
