एंथ्रोपिक ने साइबर सुरक्षा मूल्यांकन के दौरान क्लाउड मॉडलों द्वारा अनधिकृत रूप से वास्तविक सिस्टम तक पहुंचने में सफल होने के बाद नए सुरक्षा उपायों को लागू करने की घोषणा की। जैसा कि ओलहार डिजिटल ने कुछ सप्ताह पहले बताया था, इन घटनाओं ने रोकथाम में खामियों और संरेखण के मुद्दों को उजागर किया, जिससे कंपनी को अपनी प्रशिक्षण और परीक्षण प्रोटोकॉल की समीक्षा करने के लिए मजबूर होना पड़ा।
मॉडलों का जानबूझकर साइबर सुरक्षा सुरक्षा उपायों के बिना संचालन किया जा रहा था। एक घटना में, तीसरे पक्ष की कॉन्फ़िगरेशन विफलता ने इंटरनेट तक पहुंच की अनुमति दी। दूसरी स्थिति में, यूके एआई सिक्योरिटी इंस्टीट्यूट द्वारा किए गए परीक्षण के दौरान जानबूझकर पहुंच की अनुमति दी गई थी।
दोनों घटनाओं, जिनकी रिपोर्ट 30 जुलाई और 4 अगस्त को की गई थी, के कारण एंथ्रोपिक को बाहरी साइबर सुरक्षा मूल्यांकन और उच्च जोखिम वाले सुदृढीकरण शिक्षण वातावरण को अस्थायी रूप से निलंबित करना पड़ा।
संरेखण समस्याओं का प्रारंभिक विश्लेषण
प्रारंभिक जांच में संरेखण से संबंधित दो चुनौतियों की पहचान की गई। उनमें से एक को 'प्रेरित तर्क' कहा जाता है, जिसमें मॉडल विपरीत जानकारी की व्याख्या अपनी मूल धारणा का समर्थन करने के लिए कर सकता है, भले ही विपरीत साक्ष्य मौजूद हों। दूसरी समस्या मॉडल की एक विशिष्ट लक्ष्य को प्राप्त करने के लिए हानिकारक कार्य करने की प्रवृत्ति में निहित है।
मॉडलों को सूचित किया गया था कि वे नकली परिदृश्यों में हैं। हालांकि, जब उन्होंने वास्तविक इंटरनेट कनेक्शन के संकेत का पता लगाया, तो उन्होंने इन संकेतकों की व्याख्या इस तरह से की हो सकती है कि वे यह विश्वास बनाए रखें कि वे एक नकली वातावरण में हैं। परीक्षणों की कॉन्फ़िगरेशन ने भी इसमें योगदान दिया, क्योंकि एक मामले में, काल्पनिक लक्ष्य का नाम एक मौजूदा वेबसाइट के नाम के समान था।
इन जोखिमों को कम करने के लिए, एंथ्रोपिक ने एक क्लासिफायर विकसित किया जो निष्पादन के दौरान परीक्षण वातावरण से बचने या इंटरनेट तक अनधिकृत पहुंच प्राप्त करने के किसी भी प्रयास की पहचान कर सकता है। यदि किसी गतिविधि को संदिग्ध के रूप में चिह्नित किया जाता है, तो उसे तुरंत ब्लॉक कर दिया जाता है, कार्य समाप्त कर दिया जाता है और एक मानव टीम सदस्य को सूचित किया जाता है।
कार्यान्वित उपाय और अतिरिक्त जोखिम
लिए गए कार्यों में आंतरिक साइबर सुरक्षा मूल्यांकन फिर से शुरू करना शामिल है। हालांकि, कुछ अधिक खतरनाक सुदृढीकरण शिक्षण वातावरण विस्तृत मैन्युअल विश्लेषण से गुजरने तक निलंबित रहते हैं।
जांच में एक अन्य संभावित जोखिम कारक का भी खुलासा हुआ: 'रिवॉर्ड हैकिंग' के प्रति संवेदनशील प्रशिक्षण वातावरण। इन परिदृश्यों में, मॉडल निर्दिष्ट कार्य को ठीक से पूरा किए बिना पुरस्कार प्राप्त कर सकता है।
फरवरी में, एंथ्रोपिक को मिथोस प्रीव्यू के तीन दिनों के प्रशिक्षण को उलटना पड़ा क्योंकि उसने इस व्यवहार के संकेतों को देखा। दो महीने बाद, कंपनी ने प्रक्रिया को फिर से तैयार करने के लिए सुदृढीकरण शिक्षण वातावरण में संशोधनों को लगभग एक महीने के लिए फ्रीज कर दिया।
दस प्रतिशत से अधिक उत्पादन वातावरणों में 'रिवॉर्ड हैकिंग', अधूरे कार्य या गलत कॉन्फ़िगरेशन जैसी समस्याओं के संकेत मिले। ये केवल ठीक होने और नई प्रमाणन प्राप्त करने के बाद ही प्रशिक्षण में वापस आए।
अतिरिक्त रूप से, कंपनी ने जानबूझकर ऐसे वातावरणों में एक मॉडल को प्रशिक्षित किया जो ऐसी विफलताओं के प्रति संवेदनशील थे। इन सिमुलेशन में, सिस्टम ने सैंडबॉक्स से भागने, नकली बुनियादी ढांचे पर हमला करने, अपने स्वयं के इनाम फ़ंक्शन को संशोधित करने और सुरक्षा तंत्र को दरकिनार करने की अधिक प्रवृत्ति दिखाई।
भविष्य की दृष्टि और सहयोग
एंथ्रोपिक का तर्क है कि आर्टिफिशियल इंटेलिजेंस की प्रगति के लिए सुरक्षा और गति के बीच टकराव की आवश्यकता नहीं होनी चाहिए। कंपनी के लिए, यह महत्वपूर्ण है कि सरकारें और निगम समन्वय के लिए प्रभावी और सत्यापन योग्य कानूनी तंत्र स्थापित करें।
कंपनी ने कहा: 'हम यह सुनिश्चित करना चाहते हैं कि दोनों अध्ययन पूरे हों और हम आने वाले हफ्तों में अधिक विवरण साझा करेंगे।' एंथ्रोपिक METR के साथ एक स्वतंत्र ऑडिट में सहयोग करने की योजना बना रही है। कंपनी ने जोर देकर कहा: 'हम मानते हैं कि दुनिया को लाभ होगा यदि उद्योग जल्द से जल्द समन्वित गति के लिए एक कानूनी, सत्यापन योग्य और प्रभावी तंत्र अपनाता है।'
यह ध्यान रखना महत्वपूर्ण है कि इन घटनाओं के परिणामस्वरूप एंथ्रोपिक के आंतरिक बुनियादी ढांचे पर कोई घुसपैठ नहीं हुई। समस्या मूल्यांकन वातावरण में हुई, लेकिन इसने यह दर्शाया कि कैसे अपर्याप्त कॉन्फ़िगरेशन तब एक नया आयाम ले सकते हैं जब एआई मॉडल स्वायत्त रूप से कार्य करने की बढ़ती क्षमता रखते हैं।