Anthropic kompaniyasi o'zining Claude sun'iy intellekt modelining sinov paytida uchta turli kompaniyaning tizimlarini buzganini ma'lum qildi. Bu konfiguratsiya xatosi tufayli yuz berdi, bu esa modelga internetga kirish imkoniyatini berdi va tobora avtonom bo'layotgan AI tizimlarining xavfsizligi haqidagi xavotirlarni kuchaytirdi.
Bu e'lon OpenAI birining eksperimental agenti sinov muhitidan chiqib, kiberxavfsizlik benchmarkini o'tkazish jarayonida Hugging Face AI platformasiga kirib borgani haqida ma'lumot berganidan bir necha kun o'tgach sodir bo'ldi.
AI 'qochish' hujumi nima?
Yaqinda sodir bo'lgan holatlar foydalanuvchilar chat-botlarni aldab, batafsil tuzilgan so'rovlar orqali ulardan xavfsizlik qoidalarini e'tiborsiz qoldirishni talab qiladigan an'anaviy 'jailbreak' hujumlaridan farq qiladi. Buning o'rniga, oxirgi hodisalar AI agentlari tomonidan belgilangan maqsadlarga erishish usullarini mustaqil izlash bilan bog'liq edi.
Anthropic sinovlarida modellar kiberxavfsizlik imkoniyatlarini baholash uchun mo'ljallangan simulyatsion 'bayroqni egallash' (capture-the-flag) mashg'ulotlari doirasida zaif parollar kabi nisbatan oddiy xavfsizlik zaifliklaridan foydalangan. OpenAI agenti esa benchmark vazifasini bajarishga urinayotganda, unga sandboxdan chiqib, tashqi tizimlarga kirish imkonini beradigan zaiflikni topgan deb taxmin qilinmoqda.
Bu singoptiklar haqiqiymi?
Ha. Kiberxavfsizlik simulyatsiyalaridan farqli o'laroq, OpenAI va Anthropic holatlari AI agentlari tomonidan tashqi tizimlarga qarshi amalga oshirilgan haqiqiy kiberoperatsiyalarni o'z ichiga olgan. Hech bir kompaniya sezilarli moliyaviy yo'qotishlar yoki operatsion uzilishlar haqida xabar bermadi.
OpenAI o'z agenti kiberxavfsizlik benchmarki ExploitGym uchun javoblar topishga urinayotganda Hugging Face ga kirganini tushuntirdi, maxfiy ma'lumotlarni o'g'irlash uchun emas. Shunga o'xshab, Anthropic uchta hodisa konfiguratsiya xatosi tasodifan modellarga internetga kirish imkonini berganidan keyin ichki tekshiruvlar davomida aniqlangani haqida ma'lum qildi. Oqibatlar cheklangan bo'lsa-da, tadqiqotchilar bu holatlar avtonom AI agentlarining yetarli ruxsatlar mavjud bo'lganda zaifliklarni mustaqil topish va kutilmagan harakatlar qilish qobiliyatini isbotlashini ta'kidlaydi, bu esa monitoring va cheklashni kuchaytirish zarurligini ta'kidlaydi.
AI xavfsizligiga turli yondashuvlar
Hugging Facedagi hodisa AI xavfsizligiga yondashuvlardagi farqlarni ham ko'rsatdi. Hugging Face ma'lumotlariga ko'ra, sud-ekspertiza tahlili uchun investorlar Xitoy kompaniyasi Z.ai ning ochiq kodli GLM-5.2 modelidan foydalangan. Kompaniya xitoy modeli xavfsizlik muhandislari uchun hujum yo'lini yaxshiroq tushunish va cheklash usullarini aniqlashga yordam berganini qayd etdi.
Bu epizod diqqatni tortdi, chunki u AI sanoatida paydo bo'layotgan turli xil xavfsizlik falsafalarini aks ettirdi. OpenAI ning eksperimental agenti avtonom hujum imkoniyatlarini baholash uchun ishlab chiqilgan ilg'or kiberxavfsizlik benchmarki doirasida qasddan keng ruxsatlarga ega bo'lgan. Anthropic ham Claude ni belgilangan maqsadlarga erishishda modellarga mustaqil qarorlar qabul qilishga imkon beradigan muhitlarda sinovdan o'tkazdi.
Biroq, Xitoyning ilg'or AI ishlab chiquvchilari umuman olganda yanada konservativ joylashtirish strategiyalarini qabul qilishgan. Ko'pgina yirik xitoy modellarida avtonom harakatlar tashqi tizimlarga ta'sir qilishidan oldin yanada qattiq ruxsat nazorati, qattiq bajarilish chegaralari va ko'p darajali inson nazorati mavjud.
Xavfsizlik hikoyasini aytish kerakmi yoki imkoniyatlar haqidami?
Garchi Anthropic va OpenAI bu ma'lumotlarni ilg'or AI xavflari shaffofligini oshirish sa'y-harakatlari sifatida taqdim etgan bo'lsa-da, ba'zi tanqidchilar bu e'lonlar tijorat maqsadiga xizmat qilishini da ta'kidlaydilar. TechCrunch AI kompaniyalari xavfsizlik hodisalaridan marketing maqsadida foydalanishda ayblanayotganini qayd etdi, chunki ular katta e'tibor tortadi va kompaniyalarning mahsulotlarining kuchini ta'kidlashi mumkin.
Lawfare jurnali maqolasida St. John universiteti huquq professorining doktoranti Kate Clonik AI kompaniyalari xavfsizlik hodisalarini o'z texnologik yetakchiligini mustahkamlash imkoniyatlariga aylantirishni o'rganganini ta'kidladi. Texnologiya tarixchisi Li Vinselning 'kritika-hype' konsepsiyasiga asoslanib, u AI xavfi haqidagi ogohlantirishlar AI qudratining marketing funksiyasini bajarishi mumkinligini, kompaniyalarga tanqidni jamoatchilikka e'tirof etishga va dunyodagi eng ilg'or tizimlarga ega ekanliklarini anglashni mustahkamlashga imkon berishini yozdi. Clonik qo'shimcha qilib, OpenAI holatida bu ma'lumotlar kompaniyaning kutilayotgan birinchi jamoatchiliklik aksiyadorlik sotuvidan (IPO) oldingi 'reklama' sifatida xizmat qilishi mumkinligini qo'shdi.
Boshqalar yanada to'g'ridan-to'g'ri fikr bildirdilar. AI Now Institute ning bosh AI olimi Hedi Khalaf The Guardian intervyusida Anthropic ning hali chiqarilmagan Claude Mythos modeliga oid xavfsizlik bo'yicha dastlabki katta bayonotini 'marketing post' deb tanqid qildi. U kompaniya xavotirli bayonotlardan yetarli tasdiqlovchi ma'lumotlarsiz sarmoyadorlar va jamoatchilik diqqatini jalb qilish uchun foydalanayotganligini shubha ostiga qo'ydi.
Tanqidchilar shuningdek, hodisalar yakunda AI ning avtonomligini emas, balki inson dizayner qarorlarini ochib berishini ta'kidlaydilar. Agentlarga ambitsiyali vazifalar berilgan, ularga keng ruxsatlar berilgan va ular yetarli cheklash choralarining yetishmasligi sharoitida harakat qilishgan. Bu nuqtai nazardan, haqiqiy muammo bu baholash va xavfsizlik choralari dizaynini yaxshilashda, bu epizodlarni mashinalar mustaqil ravishda o'z yaratuvchilaridan 'qochib ketishi' holatlari sifatida taqdim etishda emas.

