Anthropic ने बेहतर विशेषताओं और कम प्रतिबंधों के साथ Claude Fable 5.1 और Claude Mythos 5.1 जारी किया
और पढ़ें
Olhar Digital
olhardigital.com.br

Anthropic ने बेहतर विशेषताओं और कम प्रतिबंधों के साथ Claude Fable 5.1 और Claude Mythos 5.1 जारी किया

कंपनी Anthropic ने मंगलवार (1 तारीख) को अपनी उन्नत आर्टिफिशियल इंटेलिजेंस मॉडल श्रृंखला - Claude Fable 5.1 और Claude Mythos 5.1 - के नए संस्करण पेश किए। ये अपडेट प्रदर्शन में वृद्धि के साथ-साथ उपयोग की लागत और Fable सुरक्षा तंत्र के ट्रिगर होने की संख्या को कम करने वाले परिवर्तनों का संयोजन करते हैं।

Fable 5.1 मॉडल व्यापक जनता के लिए डिज़ाइन किया गया है और Anthropic API के माध्यम से, साथ ही क्लाउड कंप्यूटिंग प्लेटफॉर्म पर भी उपलब्ध है। जबकि Mythos 5.1, जो उसी आधार मॉडल का उपयोग करता है, केवल साइबर सुरक्षा और जीवन विज्ञान में अनुसंधान करने वाले Anthropic के चयनित भागीदारों के लिए उपलब्ध रहता है।

प्रदर्शन में नई उपलब्धियां

कंपनी का दावा है कि नए मॉडल प्रोग्रामिंग और ज्ञान प्रसंस्करण से संबंधित कार्यों में प्रदर्शन का एक नया मानक स्थापित करते हैं। Anthropic द्वारा प्रकाशित परीक्षणों के अनुसार, Fable 5.1 ने वैज्ञानिक अनुसंधान के लिए डिज़ाइन किए गए Terminal-Bench-Science 0.1 टेस्ट में 52.6% का परिणाम दिखाया, जो Fable 5 के 24.7% के आंकड़े से काफी अधिक है।

टर्मिनल के माध्यम से प्रोग्रामिंग पर केंद्रित Terminal-Bench 4.0 टेस्ट में, Fable 5.1 ने 55.8% हासिल किया, जबकि Fable 5 ने 42% प्राप्त किया। इस बीच, Mythos 5.1 ने उसी टेस्ट में 60.9% का अधिक परिणाम प्रदर्शित किया। इसके अलावा, नए मॉडल ने OSWorld 2.0 टेस्ट के आंशिक मोड में 77.9% और इस टेस्ट के अधिक सख्त संस्करण में 41.7% प्राप्त किया। Humanity’s Last Exam में, Fable 5.1 ने उपकरणों का उपयोग किए बिना 60.9% और उनका उपयोग करने पर 65% स्कोर किया।

सुरक्षा तंत्र और गोपनीयता में सुधार

एक महत्वपूर्ण बदलाव सुरक्षा तंत्र थे। पहले Fable 5 को आलोचना का सामना करना पड़ा था क्योंकि सिस्टम उच्च जोखिम वाले क्षेत्रों, विशेष रूप से साइबर सुरक्षा में संभावित संबंध का पता लगाने पर वैध अनुरोधों को ब्लॉक कर देते थे। Anthropic का कहना है कि Fable 5.1 के साथ इन सुरक्षात्मक कार्यों को झूठे अलार्म को कम करने के लिए उन्नत किया गया है।

कंपनी बताती है कि Fable 5.1 और Mythos 5.1 मूल रूप से एक ही मॉडल हैं, और पिछले परीक्षणों में अंतर का कुछ हिस्सा सुरक्षा प्रणालियों के हस्तक्षेप से संबंधित था। Anthropic इंगित करता है कि इन सुरक्षा उपायों के हस्तक्षेप पर कुछ साइबर सुरक्षा परीक्षणों में कार्य Claude Opus 4.8 पर पुनर्निर्देशित हो जाते हैं, और जैविक कार्यों को Claude Opus 5 पर, जिससे कुछ मूल्यांकन में Fable के दर्ज किए गए प्रदर्शन में कमी आ सकती थी।

इसके अलावा, गोपनीयता नीति में एक महत्वपूर्ण संशोधन आया है: Anthropic ने Zero Data Retention विकल्प प्रदान करना शुरू कर दिया है। यह ग्राहकों को अपने स्वयं के बुनियादी ढांचे में मॉडल का उपयोग करने की अनुमति देता है, यह सुनिश्चित करते हुए कि डेटा इन वातावरणों को न छोड़े। हालांकि सिस्टम उपयोगकर्ताओं या एजेंटों द्वारा संभावित दुरुपयोग पर नज़र रखना जारी रखेगा, ग्राहक इस बात पर अधिक नियंत्रण प्राप्त करते हैं कि इस निगरानी को कैसे किया जाता है। Anthropic ने यह भी जोर दिया है कि उसने कभी भी स्पष्ट अनुमति के बिना कॉर्पोरेट डेटा पर अपने मॉडलों को प्रशिक्षित नहीं किया है और भविष्य में ऐसा करने की योजना नहीं बना रहा है।

प्रारंभिक उपयोगकर्ताओं से परिणाम

बेंचमार्क के अलावा, Anthropic ने उन कंपनियों द्वारा प्राप्त परिणामों को भी सार्वजनिक किया है जिन्हें Fable 5.1 तक प्रारंभिक पहुंच प्राप्त हुई थी। उदाहरण के लिए, निवेश फर्म Millennium ने बताया कि मॉडल उनकी आंतरिक प्रणालियों में एक अत्यंत दुर्लभ विफलता के कारण का पता लगाने में सक्षम था, जो वर्षों से इंजीनियरों के लिए अस्पष्ट था। मॉडल ने बाहरी लाइब्रेरी का विश्लेषण किया, कोड की तुलना कर्नेल डंप से की, और इस लाइब्रेरी में समस्या को विफलता के स्रोत के रूप में पहचाना।

MongoDB ने उल्लेख किया कि Fable 5.1 अपने सेवाओं के कोड और दस्तावेज़ीकरण की जांच कर सकता है, एक जटिल प्रोटोटाइप विकसित कर सकता है, और अपने काम का मूल्यांकन करने के लिए स्व-जांच चक्रों का उपयोग करते हुए घंटों तक बिना पर्यवेक्षण के काम कर सकता है। Anthropic ने यह भी कहा कि मॉडलों ने आधिकारिक रिलीज से पहले ही वैज्ञानिक परिणाम दिखाए थे, जिसमें मौजूदा तस्वीरों के आधार पर शुक्र का उच्च-रिज़ॉल्यूशन मानचित्रण और व्यक्तिगत GPU अनुकूलन शामिल है।

प्रगति के बावजूद, Anthropic के आंतरिक सुरक्षा दस्तावेज़ बताते हैं कि Mythos 5.1 कुछ विचलन परिदृश्यों में Opus 5 की तुलना में मामूली गिरावट दिखाता है। दस्तावेज़ के अनुसार, मॉडल दुर्भावनापूर्ण उपयोग और प्राधिकरण दावों से संबंधित अनुरोधों को थोड़ा अधिक आसानी से स्वीकार करता है जिन्हें सत्यापित नहीं किया जा सकता है, हालांकि यह पिछली मॉडलों की तुलना में स्पष्ट सीमाओं को अनदेखा करने, इनपुट डेटा गढ़ने या कार्य पूरा होने का झूठा दावा करने की कम प्रवृत्ति रखता है।

लोकप्रिय