Anthropic sunʼiy intellekt (AI) tizimlarining xavfsizlik chegaralarini sinovdan oʻtkazishga yordam berish uchun yillik maoshlari 455 ming AQSh dollarigacha yetadigan mutaxassislarni ishga qabul qilmoqda. Kompaniya biologik, kimyoviy, portlovchi, kiber, firibgarlik, aldov xatarlari, shuningdek, radiologik va yadro xavflarini qamrab oluvchi maxsus xavfsizlik va suiisteʼmolni oldini olish jamoasiga ega.
Mavjud lavozimlar kimyo, biologiya, kiberxavfsizlik va yadro hamda portlovchi qurollar kabi sohalarda tizimlarni sinovdan oʻtkazish, tahdidlarni tekshirish va xatarlarni tahlil qilish bilan bogʻliq. Ushbu vakansiyalarning maqsadi shunchaki Claudeʼga taqiqlangan javob yaratishni soʻrash orqali uning itoatkorligini tekshirishdan iborat emas; Anthropic uchinchi tomonlarning himoya choralarini buzishi va AIʼdan zarar yetkazish uchun foydalanishi mumkinmi, deb aniqlash uchun modellarini turli usullarda sinovdan oʻtkazadi, bu esa xatolar ekspluatatsiya qilinishidan oldin aniqlanishini maqsad qiladi.
Anthropic Frontier Red Team deb nomlangan jamoani boshqaradi, uning vazifasi modellar ilgari surilayotgan sari ularning imkoniyatlarini tushunish va xatarlarni oldindan koʻrish uchun AI tizimlarini tekshirishdir. Bu nom red teaming tushunchasidan olingan boʻlib, bu xavfsizlik metodologiyasi boʻlib, unda bir jamoa potentsial singdiruvchi rolini oʻynab, tizimdagi zaifliklarni topadi. AI kontekstida bu, xavfsizlik toʻsiqlarini chetlab oʻtish usullarini izlash va modelning zarar yetkazish uchun ishlatilishi mumkinligini aniqlashni anglatadi.
Eʼtibor markazlari kimyoviy, biologik, radiologik va yadro tahdidlari, shuningdek, kiberxavfsizlik va tizimlarning avtonomligi bilan bogʻliq xatarlarni oʻz ichiga oladi. Kompaniya tadqiqotchilar, turli sohalardagi mutaxassislar va avtomatlashtirilgan tizimlar tomonidan amalga oshiriladigan sinovlarni integratsiya qiladi. Anthropic taʼkidlaydiki, tashqi mutaxassislarga hamkorlik modellarni sinovdan oʻtkazishda ham yangi baholash usullarini ishlab chiqishda ham yordam beradi. Tahlil qilinayotgan xatarga qarab, mutaxassislar Claudeʼning jamoat versiyalari yoki turli xil xavfsizlik mexanizmlariga ega tijoriy boʻlmagan modellar bilan ishlaydi.
Mutaxassislarning Vazifaga Qarashi
Oracledagi AI mutaxassisi Gabriel Cunha Olhar Digitalga shunday dedi: vazifa institutsional xatarlarni aniqlash va nazoratni joriy etish qobiliyati model imkoniyatlarining rivojlanishiga mos kelishini taʼminlashdan iborat. Mutaxassislar tizimga hujum qilib, model AI yordamisiz odam nima qila olganiga nisbatan haqiqiy ustunlik bera olishini tekshiradi.
Oʻzining Anthropic ham bir jarayonni batafsil bayon etadi, u mutaxassislar tomonidan olib boriladigan sinovlar bilan boshlanishi va avtomatlashtirilgan tizimlar bilan kengaytirilishi mumkin. Dastlab, mutaxassislar tekshirilishi kerak boʻlgan tahdid turi aniqlaydi va tizimni xavfli xatti-harakatlarni namoyish etishga majburlash yoʻllarini izlaydi. Muammo yaxshiroq tushunilganda, sinovlar yuzlab yoki minglab turli ssenariylarda takrorlanishi mumkin.
Kompaniya bu vazifani qoʻllab-quvvatlash uchun AI modellaridan ham foydalanadi. Bir tizim boshqa modelni sinovdan oʻtkazish uchun hujum urinishlarini yaratishi mumkin va olingan natijalar yangi himoya vositalarini ishlab chiqishga yordam beradi. Bu sikl yangi hujum taktikalari aniqlangandan keyin ham toʻsiqlar samarali qolishini tasdiqlash uchun takrorlanadi.
Anthropic bunday turli sohalardagi mutaxassislarni jalb qilishning asosiy sababi shundaki, notoʻgʻri javobning oʻzi modelning haqiqiy dunyoda zarar yetkazish qobiliyatiga ega ekanligini isbotlamaydi. Mutaxassis tizim tomonidan ishlab chiqarilgan narsa toʻgʻri ekanligini va amalda qoʻllanilishi mumkinligini baholashi kerak.
Vultus CTOsi va kiberxavfsizlik mutaxassisi Rodrigo Gava taʼkidlaydi: «AI ning taqiqlangan narsani javob berishi yolgʻizgina haqiqiy xavfni koʻrsatmaydi». U qoʻshimcha qiladiki, eʼtibor javob texnik jihatdan aniqmi, operatsion jihatdan amalga oshirilishi mumkinmi va zarar yetkazish uchun zarur boʻlgan bilim, vaqt yoki xarajatlarni sezilarli darajada kamaytiradimi, deb baholashda boʻlishi kerak. Kiberxavfsizlikda u misol keltiradi: «Kod murakkab koʻrinishi mumkin va ishlamasligi mumkin, ammo koʻrinishidan xavfsiz maʼlumotlar ketma-ketligi haqiqiy ekspluatatsiya zanjirini yakunlashi mumkin».
Anthropic oʻz xavfsizlik sinovlarida shu mantiqni qoʻllaydi. Mutaxassislar avvalo qaysi tahdidni tekshirmoqchi ekanligini, zarar yetkazish uchun qanday maʼlumotlardan foydalanish mumkinligini va modelning bu harakatda kimnidir samarali yordam berishi uchun nimaga muhtoj ekanligini aniqlaydi. Masalan, biologik xatarlarni baholashda, biosavodxonlik mutaxassislari bilan sinovlar uchun 150 dan ortiq soat sarflangan.
Yadro xatarlarini baholashda ham shunday boʻldi. AQShning Milliy yadro xavfsizlik idorasi (NNSA) bilan hamkorlikda, agentlik mutaxassislari Claude modellarini nazorat qilingan muhitda sinovdan oʻtkazish uchun bir yil sarfladilar. Bu ish Anthropicʼka yadro qurollari ishlab chiqilishi bilan bogʻliq boʻlishi mumkin boʻlgan suhbatlarni aniqlashga qodir vositani yaratish imkonini berdi. Boshlangʻich sinovlarda, vosita yadro qurollari bilan bogʻliq soʻrovlarning 94,8% ni aniqladi va baholangan toʻplamda yolgʻon ijobiy natijalarni qayd etmadi, umumiy aniqlik 96,2% ga yetdi. Anthropicning aytishicha, tizim keyinchalik Claude trafikiga qisman integratsiya qilindi, bu esa notoʻgʻri foydalanishni aniqlashga yordam berdi.
Gava fikricha, «jarayon odatda tahdid modeli bilan boshlanadi: potentsial hujumchi kim, uning maqsadi nima, qanday resurslari bor va muvaffaqiyat qanday hisoblanadi». Shundan soʻng, zaiflikni signal beradigan xatti-harakatlarni keltirib chiqarishga urinishlar uchun ssenariylar ishlab chiqiladi.
Sinovlar faqat modelga bevosita buyruq berish bilan cheklanmaydi. Mutaxassislar koʻp bosqichli suhbatlarni, bir xil soʻrovning qayta ifodalanishini, til va kontekstni oʻzgartirishni, vositalardan, avtonom agentlardan va texnikalarning kombinatsiyasidan foydalanishni tekshirishi mumkin. Maqsad, bitta himoya funksionalligi bor, lekin turli xil resurslar birlashtirilganda chetlab oʻtilishi mumkin boʻlgan holatlarni topishdir.
Mutaxassislar tomonidan muammo aniqlangandan soʻng, Anthropic bu vaziyatni yuzlab yoki minglab variantlarda takrorlanadigan sinovga aylantirishi mumkin. Shu tariqa, kompaniya xato saqlanib qolganini va modelga qoʻllanilgan oʻzgarishlar masalani haqiqatda hal qilganini tekshiradi. AI ham bu jarayonda ishlatiladi: bir model boshqa tizimni sinovdan oʻtkazish uchun hujum urinishlarini yaratishi mumkin va natijalar yangi himoya shakllarini ishlab chiqish uchun ishlatiladi. Toʻsiqlar faolligini taʼminlash uchun protsedura takrorlanadi.
Modellar tizimlarni ekspluatatsiya qilish usullarini topishga qodir boʻlganda, ularni sinovdan oʻtkazish zarurati ortadi. 2026-yil may oyida Anthropic Claude Mythos Preview zaifliklarni aniqlash, ularni ekspluatatsiya vektorlariga aylantirish va toʻliq hujumlarni bajarish uchun turli bosqichlarni birlashtirishga qodir ekanligini eʼlon qildi.
Boshqa bir tadqiqotda, Anthropic Claude Opus 4 va Claude Sonnet 4 ni individual mashqlar va murakkab tarmoq simulyatsiyalaridan tortib kiberxavfsizlik choralarida baholadi. Kompaniya modellarining xatoliklarni aniqlash va koʻp bosqichli hujumlarni amalga oshirishda taraqqiyot koʻrsatganini bildirgan boʻlsa-da, ular hali ham kutilmagan holatlar oldida keng koʻlamli rejalarini ushlab turishda qiyinchiliklarga duch kelishdi.
Taraqqiyot yangi, nomaʼlum zaifliklarni, yaʼni nol kunlik (zero-day) zaifliklarni topishda ham sezilarli. Fevral oyida Anthropic Claude Opus 4.6 ning avvalgi versiyalarga nisbatan katta miqyosda hal qiluvchi zaifliklarni topish qobiliyatini sezilarli darajada yaxshilaganini maʼlum qildi. Kompaniya bunday qobiliyat tizimlarning himoyasini mustahkamlash uchun ishlatilishi mumkinligini taʼkidlaydi.
Gabriel Cunha uchun bunday hodisalar korporatsiyalar faqat bitta javobni emas, balki modellar turli xil resurslarni birlashtirib maqsadga erishish qobiliyatini ham sinovdan oʻtkazishi kerakligini asoslashga yordam beradi. Tizim qancha koʻp vazifalarni avtonom ravishda bajarsa, bu kompetensiyalar birgalikda ishlatilganda nima sodir boʻlishi mumkinligini baholash zarurati shuncha ortadi.
Anthropic oʻzining bu evolyutsiyani kuzatish uchun Frontier Red Teamni saqlab turadi. 2026-yilda guruh zararli aktorlar tomonidan AI dan foydalanish bilan bogʻliq zaifliklarni ekspluatatsiya qilish, kiberhujumlar va tahdidlar haqida tahlillar chop etdi. Eʼlon qilingan maqsad modellarning hozirgi imkoniyatlarini tushunish va ularning evolyutsiyasi bilan nimalar paydo boʻlishi mumkinligini bashorat qilishdir.
Barcha bu saʼy-harakatlarga qaramay, sinovlar AI ning mutlaq xavfsizligini kafolatlamaydi. Buyruqlar, kontekst, vositalar va modelning xatti-harakatlari oʻrtasida virtual nohaqiqat sonli kombinatsiyalar mavjud. Bundan tashqari, yangi funksiyalar yoki versiyalar oldingi baholashlarda mavjud boʻlmagan zaifliklarni kiritishi mumkin.
Asosiy cheklov shundaki, hech qanday red team AI xavfsizligini aniqlashni kafolatlaydigan barcha ssenariylarni toʻliq qamrab ola olmaydi. Modellar ehtimollik xususiyatiga ega, oʻzaro taʼsir maydoni deyarli cheksiz va hujumchilar strategiyalarini doimiy ravishda moslashtirib boradilar.
Vultus CTOsi Rodrigo Gava taʼkidlaydiki, Anthropicning oʻzi bu cheklovlarni tan oladi. AI xavfsizligi haqidagi tahlilida kompaniya shuni taʼkidlaydi,ki, milliy xavfsizlik xatarlari uchun sinovlar hali ham «fan dan koʻra sanʼatga» yaqinroq, chunki modellarda xavotirli xatti-harakatlarni keltirib chiqarish uchun toʻliq standartlashtirilgan usul mavjud emas.
Ikki turdagi xato oʻrtasida ham muvozanat mavjud: yolgʻon manfiy natija (false negative) hujum urinishi aniqlanmasa va himoya mexanizmlaridan oʻtib ketsa yuzaga keladi. Yolgʻon ijobiy natija (false positive) esa noqonuniy faoliyatni notoʻgʻri xavfli deb tasniflash natijasida bloklanishi mumkin.
Shu sababli, Anthropic koʻp qavat himoya mexanizmlarini joriy etadi. Bularga xavfsizlik sinovlari, xatolarni topganlarga mukofot dasturlari, monitoring va modellar toʻsiqlarini chetlab oʻtish urinishlarini aniqlashga moʻljallangan avtomatlashtirilgan tizimlar kiradi.
Frontier Safety Roadmapda kompaniya 2027-yil yanvarigacha kimyoviy va biologik qurolga qarshi himoyalarni chetlab oʻtishning yangi usullarini topishga qodir tizimni ishlab chiqishni maqsad qilib belgilagan. Anthropic shuningdek, Claude bilan bogʻliq murakkab kiberhujumlarni avtomatik tekshirish uchun vositalar yaratishni rejalashtirmoqda.
Anthropic tomonidan ochilgan vakansiyalar bu tuzilmaning amalda qanday ishlashini koʻrsatadi. Kompaniya biologik xavfsizlik, kimyoviy va portlovchi xatarlar, kiberxavfsizlik, firibgarlik va aldov, shuningdek, radiologik va yadro xatarlari boʻyicha turli vazifalar uchun mutaxassislar izlamoqda.
Funksiyalar farqli. Ulardan biri Red Team Engineer boʻlib, tizimlarda zaifliklarni ekspluatatsiya qilinishidan oldin topishga harakat qiladi. Ushbu vakansiya AI xavfsizligi va xavfsizlik sinovlari boʻyicha tajriba, shuningdek, modellar toʻsiqlarini chetlab oʻtish haqidagi bilimlarni talab qiladi. Eʼlon qilingan maosh diapazoni yillik 320 ming AQSh dollaridan 405 ming AQSh dollarigacha.
Boshqa bir lavozim kimyoviy, biologik, radiologik, yadro va portlovchi xatarlar bilan bogʻliq tahdidlar intellektini boshqaruvchisi hisoblanadi. Mutaxassis Anthropic tizimlaridan bu maqsadlar uchun foydalanish urinishlarini aniqlash va tekshirishga bagʻishlangan jamoani boshqaradi, yillik maoshi 455 ming AQSh dollar.
Xavf sohasi boʻyicha bevosita tajriba talab qiladigan lavozimlar ham mavjud. Masalan, biologik xavfsizlikka yoʻnaltirilgan vakansiya biologik hayot fanlarida kamida sakkiz yillik amaliy tajriba, shuningdek, molekulyar biologiya, dori kashf etish yoki kompyuter biologiyasi boʻyicha bilimni talab qiladi. Funksiyalarining bu xilma-xilligi Anthropic strategiyasi shunchaki Claudeʼning baʼzi soʻrovlarni rad etishidan tashqariga choʻzilganligini koʻrsatadi; u zaifliklarni aniqlash, xatarlarni baholash, potentsial suiisteʼmolni tekshirish va bu kashfiyotlarni yangi himoya shakllariga aylantirish uchun mutaxassislarni ishga olishni maqsad qilgan, chunki modellar imkoniyatlarining ortishi ushbu ish hajmining kengayishini talab qiladi.