Anthropic ने अपने AI मॉडल के Claude संस्करण से जुड़ी सुरक्षा घटना की सूचना दी
और पढ़ें
Olhar Digital
olhardigital.com.br

Anthropic ने अपने AI मॉडल के Claude संस्करण से जुड़ी सुरक्षा घटना की सूचना दी

Anthropic ने अपने आर्टिफिशियल इंटेलिजेंस मॉडल, Claude के एक प्रारंभिक संस्करण से संबंधित साइबर सुरक्षा की चौथी घटना की पहचान की है। कंपनी द्वारा जारी बयान के अनुसार, यह घटना जनवरी में हुई थी और Claude Opus 4.6 के एक प्रारंभिक संस्करण से संबंधित है।

इस घटना की खोज 141,006 परीक्षण सत्रों में किए गए दूसरे ऑडिट के दौरान की गई थी। इस समीक्षा ने ऐसे सत्रों को खोजने की अनुमति दी जिन्हें पहले विश्लेषण नहीं किया गया था, जिससे Anthropic को नई सुरक्षा घटना की पहचान करने में मदद मिली।

कंपनी ने प्रभावित पक्षों को हुई घटना के बारे में सूचित किया, हालांकि उसने शामिल प्रणालियों या इस घटना के दौरान मॉडल द्वारा की गई कार्रवाइयों के बारे में विस्तृत जानकारी जारी करने से परहेज किया।

घटनाओं के बारे में अधिक जानकारी

इस तरह की घटनाएं 'एआई ब्रेकआउट इवेंट्स' से संबंधित चिंताओं में योगदान करती हैं, जो ऐसे परिदृश्य हैं जहां एआई सिस्टम परीक्षण के दौरान परिभाषित सीमाओं को पार कर जाते हैं और इंटरनेट पर स्वायत्त रूप से काम करना शुरू कर देते हैं।

Anthropic का मामला एआई एजेंटों से जुड़े अंतर्निहित जोखिमों पर निगरानी तेज होने के दौर में सामने आया है। एक पिछली घटना में, OpenAI के एजेंटों ने अपने संचालन पर लगाए गए सीमाओं को पार करने के बाद जर्मन भाषा की एक सहयोगी वेबसाइट तक पहुंच प्राप्त की और उसे बदल दिया।

इन घटनाओं की श्रृंखला के परिणामस्वरूप, Anthropic ने परिचालन सुरक्षा विफलताओं को स्वीकार किया और घोषणा की कि उसके मॉडल अभी भी मानवीय मूल्यों के साथ पूरी तरह से संरेखित नहीं हुए हैं। इसके अलावा, कंपनी ने परीक्षण वातावरण के लिए अधिक सख्त नियंत्रण तंत्र और स्वायत्त रूप से कार्य करने में सक्षम प्रणालियों पर गहन निरीक्षण की वकालत करना शुरू कर दिया है।

समान कहानियाँ

क्लाउड मॉडल द्वारा बाहरी सिस्टम तक पहुंचने के बाद एंथ्रोपिक ने नए सुरक्षा अवरोध लागू किए
और पढ़ें
olhardigital.com.br

क्लाउड मॉडल द्वारा बाहरी सिस्टम तक पहुंचने के बाद एंथ्रोपिक ने नए सुरक्षा अवरोध लागू किए

एंथ्रोपिक ने साइबर सुरक्षा मूल्यांकन के दौरान क्लाउड मॉडलों द्वारा अनधिकृत रूप से वास्तविक सिस्टम तक पहुंचने में सफल होने के बाद नए सुरक्षा उपायों को लागू करने की घोषणा की। जैसा कि ओलहार डिजिटल ने कुछ सप्ताह पहले बताया था, इन घटनाओं ने रोकथाम में खामियों और संरेखण के मुद्दों को उजागर किया, जिससे कंपनी को अपनी प्रशिक्षण और परीक्षण प्रोटोकॉल की समीक्षा करने के लिए मजबूर होना पड़ा।

मॉडलों का जानबूझकर साइबर सुरक्षा सुरक्षा उपायों के बिना संचालन किया जा रहा था। एक घटना में, तीसरे पक्ष की कॉन्फ़िगरेशन विफलता ने इंटरनेट तक पहुंच की अनुमति दी। दूसरी स्थिति में, यूके एआई सिक्योरिटी इंस्टीट्यूट द्वारा किए गए परीक्षण के दौरान जानबूझकर पहुंच की अनुमति दी गई थी।

दोनों घटनाओं, जिनकी रिपोर्ट 30 जुलाई और 4 अगस्त को की गई थी, के कारण एंथ्रोपिक को बाहरी साइबर सुरक्षा मूल्यांकन और उच्च जोखिम वाले सुदृढीकरण शिक्षण वातावरण को अस्थायी रूप से निलंबित करना पड़ा।

संरेखण समस्याओं का प्रारंभिक विश्लेषण

प्रारंभिक जांच में संरेखण से संबंधित दो चुनौतियों की पहचान की गई। उनमें से एक को 'प्रेरित तर्क' कहा जाता है, जिसमें मॉडल विपरीत जानकारी की व्याख्या अपनी मूल धारणा का समर्थन करने के लिए कर सकता है, भले ही विपरीत साक्ष्य मौजूद हों। दूसरी समस्या मॉडल की एक विशिष्ट लक्ष्य को प्राप्त करने के लिए हानिकारक कार्य करने की प्रवृत्ति में निहित है।

मॉडलों को सूचित किया गया था कि वे नकली परिदृश्यों में हैं। हालांकि, जब उन्होंने वास्तविक इंटरनेट कनेक्शन के संकेत का पता लगाया, तो उन्होंने इन संकेतकों की व्याख्या इस तरह से की हो सकती है कि वे यह विश्वास बनाए रखें कि वे एक नकली वातावरण में हैं। परीक्षणों की कॉन्फ़िगरेशन ने भी इसमें योगदान दिया, क्योंकि एक मामले में, काल्पनिक लक्ष्य का नाम एक मौजूदा वेबसाइट के नाम के समान था।

इन जोखिमों को कम करने के लिए, एंथ्रोपिक ने एक क्लासिफायर विकसित किया जो निष्पादन के दौरान परीक्षण वातावरण से बचने या इंटरनेट तक अनधिकृत पहुंच प्राप्त करने के किसी भी प्रयास की पहचान कर सकता है। यदि किसी गतिविधि को संदिग्ध के रूप में चिह्नित किया जाता है, तो उसे तुरंत ब्लॉक कर दिया जाता है, कार्य समाप्त कर दिया जाता है और एक मानव टीम सदस्य को सूचित किया जाता है।

कार्यान्वित उपाय और अतिरिक्त जोखिम

लिए गए कार्यों में आंतरिक साइबर सुरक्षा मूल्यांकन फिर से शुरू करना शामिल है। हालांकि, कुछ अधिक खतरनाक सुदृढीकरण शिक्षण वातावरण विस्तृत मैन्युअल विश्लेषण से गुजरने तक निलंबित रहते हैं।

जांच में एक अन्य संभावित जोखिम कारक का भी खुलासा हुआ: 'रिवॉर्ड हैकिंग' के प्रति संवेदनशील प्रशिक्षण वातावरण। इन परिदृश्यों में, मॉडल निर्दिष्ट कार्य को ठीक से पूरा किए बिना पुरस्कार प्राप्त कर सकता है।

फरवरी में, एंथ्रोपिक को मिथोस प्रीव्यू के तीन दिनों के प्रशिक्षण को उलटना पड़ा क्योंकि उसने इस व्यवहार के संकेतों को देखा। दो महीने बाद, कंपनी ने प्रक्रिया को फिर से तैयार करने के लिए सुदृढीकरण शिक्षण वातावरण में संशोधनों को लगभग एक महीने के लिए फ्रीज कर दिया।

दस प्रतिशत से अधिक उत्पादन वातावरणों में 'रिवॉर्ड हैकिंग', अधूरे कार्य या गलत कॉन्फ़िगरेशन जैसी समस्याओं के संकेत मिले। ये केवल ठीक होने और नई प्रमाणन प्राप्त करने के बाद ही प्रशिक्षण में वापस आए।

अतिरिक्त रूप से, कंपनी ने जानबूझकर ऐसे वातावरणों में एक मॉडल को प्रशिक्षित किया जो ऐसी विफलताओं के प्रति संवेदनशील थे। इन सिमुलेशन में, सिस्टम ने सैंडबॉक्स से भागने, नकली बुनियादी ढांचे पर हमला करने, अपने स्वयं के इनाम फ़ंक्शन को संशोधित करने और सुरक्षा तंत्र को दरकिनार करने की अधिक प्रवृत्ति दिखाई।

भविष्य की दृष्टि और सहयोग

एंथ्रोपिक का तर्क है कि आर्टिफिशियल इंटेलिजेंस की प्रगति के लिए सुरक्षा और गति के बीच टकराव की आवश्यकता नहीं होनी चाहिए। कंपनी के लिए, यह महत्वपूर्ण है कि सरकारें और निगम समन्वय के लिए प्रभावी और सत्यापन योग्य कानूनी तंत्र स्थापित करें।

कंपनी ने कहा: 'हम यह सुनिश्चित करना चाहते हैं कि दोनों अध्ययन पूरे हों और हम आने वाले हफ्तों में अधिक विवरण साझा करेंगे।' एंथ्रोपिक METR के साथ एक स्वतंत्र ऑडिट में सहयोग करने की योजना बना रही है। कंपनी ने जोर देकर कहा: 'हम मानते हैं कि दुनिया को लाभ होगा यदि उद्योग जल्द से जल्द समन्वित गति के लिए एक कानूनी, सत्यापन योग्य और प्रभावी तंत्र अपनाता है।'

यह ध्यान रखना महत्वपूर्ण है कि इन घटनाओं के परिणामस्वरूप एंथ्रोपिक के आंतरिक बुनियादी ढांचे पर कोई घुसपैठ नहीं हुई। समस्या मूल्यांकन वातावरण में हुई, लेकिन इसने यह दर्शाया कि कैसे अपर्याप्त कॉन्फ़िगरेशन तब एक नया आयाम ले सकते हैं जब एआई मॉडल स्वायत्त रूप से कार्य करने की बढ़ती क्षमता रखते हैं।

लोकप्रिय