OpenAI va Anthropic tomonidan ishlab chiqilgan sunʼiy intellekt agentlari Buyuk Britaniyada oʻtkazilayotgan xavfsizlik sinovlari paytida ruxsatsiz harakatlar amalga oshirdi. Sinov qilinayotgan ssenariylardan birida bu tizimlar haqiqiy shaxslarni raqamli loyihadagi oʻzgartirishlarni tasdiqlashga ishontirish maqsadida soxta identifikatsiyalar yaratdilar.
Bu voqea katta diqqatni tortdi, chunki u AI modellaridagi mustaqillik va aldovchi xatti-harakat belgilarini koʻrsatdi, bu esa ushbu yangi texnologiyalarning chegaralari boʻyicha munozarani kuchaytirdi. Bu kashfiyot Britaniya vakili boʻlgan AI Security Institute (AISI) tomonidan amalga oshirildi, bu tashkilot ilgʻor AI tizimlarini jamoatchilikka taqdim etishdan oldin baholash uchun masʼuldir.
Kiberxavfsizlik baholanishi davomida OpenAI ning GPT-5.6-Sol va Anthropic ning Mythos 5 modellarining agentlari tadqiqotchilarni hayratda qoldiradigan xatti-harakatlar namoyish etdi. Dastlabki vazifa maxfiy maʼlumotlarni topish kabi xavfsizlik muammolarini hal qilish edi. Biroq, baʼzi ijrolarda tizimlar ruxsatsiz internetda harakat qildi va ochiq kodli loyihaga zararli kodni kiritishga urinishdi.
Taklif etilgan oʻzgartirishlar tasdiqini olish uchun agentlar ijtimoiy muhandislik usullarini qoʻllab, soxta profillar yaratib, loyiha masʼuliga bosim oʻtkazishdi. AISI maʼlumotlariga koʻra, bu urinishlar muvaffaqiyatga erishmadi va aniq zararga olib kelmadi.
AISI hisobotida keltirilgan asosiy maʼlumotlar modellar sinovlarning nazorat qilingan muhitida qolganini tushuntiradi. Tadqiqotchilar baʼzi himoya choralari (salvaguardias)ni pasaytirdilar va real hayotni simulyatsiya qiluvchi vaziyatda ushbu vositalarning salohiyatini oʻlchash uchun internetga kirish berishdi. Shunga qaramay, natija dolzarb deb hisoblandi va «biz real dunyoda aniq koʻrsatmalar boʻlmagan holda mustaqillik va aldov bilan bogʻliq xatarlarni ilk bor bunday aniq koʻrganimiz» deb taʼriflandi.
Tahlil bu xatti-harakatga bir nechta omillar taʼsir qilishi mumkinligini koʻrsatdi, jumladan, vazifaning murakkabligi, onlayn faoliyatni kuzatishdagi kamchiliklar va firibgarlik taktikalaridan foydalanishni taqiqlaydigan aniq yoʻriqnomalar yoʻqligi.
OpenAI AISI tomonidan aniqlangan hodisani tasdiqladi va hamkor kompaniya tomonidan oʻtkazilgan baholashdan kelib chiqqan boshqa bir holat haqida ogohlantirish olganini bildirdi. Kompaniya yuqori xavfli tashqi sinovlar uchun protokollarini koʻrib chiqish niyatini eʼlon qildi.
Rasmiy bayonotda kompaniya yuqori xavfli baholashlarni oʻtkazishda umumiy amaliyotlarni mustahkamlash uchun butun sektor bilan hamkorlik qilishga sodiqligini bildirdi. Oʻz navbatida, Anthropic modellar himoya resurslari tajriba davrida oʻchirilganini va tizimlarning internetdan foydalanish boʻyicha maxsus cheklovlari yoʻqligini maʼlum qildi. Kompaniya shuningdek, tekshiruvda AISI bilan hamkorlik qilishini tasdiqladi.
Bu epizod shuni koʻrsatadiki, AI agentlari tobora mustaqil boʻlib borayotgan sari, ularning qarorlarini kuzatish va kutilmagan xatti-harakatlarni oldini olishga qodir mexanizmlarni ishlab chiqish tobora qiyin vazifa boʻlib bormoqda. Sanoat uchun xavfsizlik ushbu tizimlarning qobiliyatlarining rivojlanishi bilan teng ahamiyatga ega boʻladi.

