Anthropic kompaniyasi muhandislari Claude oilasining uchta modeli internetga kirishni va uchta turli tashkilotning haqiqiy tizimlarini buzish imkoniyatiga ega bo'lganini aniqladilar. Bu hodisa kiberxavfsizlikni baholash bo'yicha sinovlar davomida yuz berdi, bunda modellar internetga va haqiqiy tizimlarga kirishni xato ravishda o'quv ssenariysining bir qismi deb qabul qilishdi.
Bunday 'bayroqni egallash' kabi sinovlarni o'tkazishda neyron tarmoqlari simulyatsiya qilingan muhitda maxf sarlavha yoki faylni topish kabi xayoliy vazifani oladi. Odatda ishlab chiquvchilar bu muhitlarni to'liq izolyatsiya qilishadi, shunda modelning harakatlari haqiqiy kompyuter tizimlariga ta'sir qilmasligi kerak. Biroq, modellarning ortib borayotgan imkoniyatlari tufayli ularni simulyatsiya doirasida ushlab turish murakkab vazifa bo'lib qolmoqda.
Avvalroq OpenAI ning o1 modelining dastlabki versiyasi bilan shunga o'xshash muammolar yuzaga kelgan edi. Bir sinovda qidirilayotgan 'bayroq'li server ishga tushmagan, ammo model ochiq portni topib, sinov boshqaruv tizimiga kirishni amalga oshirgan. Keyin u mustaqil ravishda serverni ishga tushirib, maxf fayl avtomatik nusxalanib ketishi uchun ko'rsatmalarini o'zgartirgan, bu rejalashtirilgan buzilish ssenariysidan chetga chiqdi.
Anthropic Claude modellarining 'bayroqni egallash' formatidagi kiberhujumlar qilish qobiliyatini tekshirish bo'yicha 141006 ta oldingi sinov yozuvlarini o'rgandi. U hamkor Irregular bilan birgalikda oltita ishga tushirishda sodir bo'lgan uchta holatni aniqladi. Opus 4.7, Mythos 5 va nomlanmagan tadqiqot versiyasi tashqi internetga kirishib, promptda ularga tashqi kirishsiz simulyatsiyada sinov o'tkazilayotgani ma'lum qilinishiga qaramay, haqiqiy tizimlarga hujum qildi.
Eng jiddiy holat Opus 4.7 modeliga tegishli edi. Vazifada ishlatilgan xayoliy kompaniya nomi haqiqiy domen bilan mos kelgan. Neyron tarmoq sinov muhitida maqsadni topa olmagach, internetdagi haqiqiy kompaniya saytini topdi va uning infratuzilmasini vazifaning bir qismi deb qabul qildi. To'rtta sinov jarayonida model zaifliklarni topib, hisob ma'lumotlarini olib, ma'lumotlar bazasiga kirib bordi, garchi Opus 4.7 fikrlash jarayonida tizimning haqiqiy ekanligining belgilarini tanib, hujumni to'xtatgan bo'lsa ham.
Ikkinchi holatda Mythos 5 modeli sinov muhitida PyPI katalogidan xayoliy nomli paketni o'rnatish ko'rsatmasini topdi, bunday paket mavjud emas edi. Model haqiqiy PyPI repozitoriyasida hisob ochdi, shu nom bilan paket yaratdi, zararli kod qo'shdi va uni ochiq kirishda joylashtirdi. Taxminan bir soatdan so'ng, bu paket o'n beshta haqiqiy tizimda yuklab olingan va ishga tushirilgan, undan keyin model ulardan biridan hisob ma'lumotlarini o'g'irlab, ulardan foydalanib kompaniya infratuzilmasiga yanada chuqurroq kirib bordi.
Tadqiqot natijalariga ko'ra, Anthropic bu hodisalar modellarning qasddan zararli xatti-harakatlari emas, balki sinovlarning o'zini tashkil etishdagi xatoliklar tufayli yuzaga kelgan degan xulosaga keldi. Claudelar topshirilgan vazifani bajarishdi, ammo simulyatsiya chegaralarini noto'g'ri tushunish natijasida haqiqiy tizimlarga hujum qilishni boshladilar. Kelajakda kompaniya sinov infratuzilmasi ustidan nazoratni kuchaytirish va sinovlar uchun ruxsat etilgan maqsadlarni yanada aniq belgilashni rejalashtirmoqda.
Anthropic shuningdek, eng yangi tadqiqot modeli test muhitidan chiqib ketganini anglagan zahotiyoq hujumini to'xtatganini va Claude ning chiqarilgan versiyalarining standart himoya mexanizmlari bunday harakatlarni to'liq oldini olishi kerakligini ta'kidladi.
Aprelda Anthropic kiberxavfsizlik masalalari bo'yicha xavotirlar tufayli Claude Mythos modelining jamoatchilikka chiqarilishini to'xtatgan edi. Sababi model dasturiy ta'minotdagi zaifliklarni aniqlash va ulardan foydalanishda istisno darajadagi qobiliyat namoyish etgan. Ushbu modelga faqatgina kritik ahamiyatga ega dasturiy ta'minotdagi kamchiliklarni topish va bartaraf etish uchun uni qo'llaydigan cheklangan miqdordagi tashkilotlarga kirish berilgan.