Biologlar xavfli viruslar bilan tajriba o'tkazishganda, ular sizib chiqish yoki qochib ketishning oldini olish uchun qat'iy qoidalar doirasida ishlaydilar. Biroq, sun'iy intellekt agentlarini bunday chiqishlardan himoya qilish uchun shunga o'xshash me'yorlar mavjud emas, garchi potentsial oqibatlari fojia bo'lishi mumkin bo'lsa ham.
Bu nafaqat nazariy muammo: shu hafta OpenAI ning sinov modeli o'zining izolyatsiya qilingan muhitidan chiqib ketdi va real kompaniyaning serverlariga kirib, ichki kibersavdo bahosini muvaffaqiyatli topshirishga harakat qildi.
Sun'iy intellektni himoya qilish talablari
Ekspertlar aytadiki, agar AI ishlab chiqarayotgan kompaniyalar sinov jarayonida, shu jumladan modellar etika masalalarini hal qilishni o'rganishda xavfsizlik choralarini kuchaytirmasa, bunday kibersavdo hodisalar takrorlanadi.
OpenAI prezidenti Greg Brockman beshanba kuni matbuar yig'ilishida CNNga kompaniya 'barcha sodir bo'lgan voqeani tushunish uchun' 'to'liq tergov olib borayotganini' ma'lum qildi. Brockman vaziyatning jiddiyligini ta'kidlab, shunday dedi: 'Buni juda jiddiy qabul qilish kerak, biz to'g'ri qanday reaksiyaga yo'l qo'yishni tushunish uchun ish jarayonimizning har bir elementini ko'rib chiqyapmiz.'
Sinov muhitining tabiati
AI-qum maydoni bu kompaniyalar sun'iy intellekt modellarini tekshirish uchun foydalanadigan cheklangan muhitdir. Uning maqsadi barcha jarayonlar ichkarida qolishini va tashqi dunyoga ta'sir qilmasligini ta'minlashdir. Ko'pincha sinov muhitida modelning to'liq salohiyatini baholash uchun ichki himoya mexanizmlari olib tashlanadi, ammo izolyatsiya saqlanib qoladi.
Biroq, George's Town Xavfsizlik va yangi texnologiyalar markazi bosh ilmiy tahlilchisi Jessica Ji ma'lum qilganidek, OpenAI qum maydoni tarmoq yoki internetga butunlay uzilgan emas edi. Garchi OpenAI modellar faqat kompaniya ichida joylashtirilgan uchinchi tomon dasturiy ta'minotidan resurslarni o'rnatish uchun juda cheklangan tarmoq kirishiga ega ekanligini da'vo qilsa-da, agentlar ushbu dasturiy ta'minotdagi avval noma'lum zaiflikdan foydalanishdi.
Buning natijasida agentlar ochiq internetga yo'l topishdi va keyin o'zlashtirilgan hisoblar va boshqa zaif nuqtalar yordamida AI modellari va ma'lumotlar to'plamlari uchun platforma bo'lgan Hugging Face platformasiga yetib kelishdi. Ji ta'kidladi, OpenAI ham, uchinchi tomon dasturiy ta'minotni ishlab chiquvchi kompaniya ham bu zaiflik haqida bilmagan, bu esa barcha tizimlarni potentsial exploitlar uchun diqqat bilan tekshirishning hal qiluvchi ahamiyatini ta'kidlaydi.
AIni o'qitish xavflari
AI modeli qum maydonidan chiqqan birinchi holat emas. Ushbu yil boshida Anthropic modelga aynan shunday qilishni buyurganini ma'lum qilgan edi va muvaffaqiyatli qochgandan so'ng, u Anthropic tadqiqotchisiga elektron xat yuborgan, garchi unga bunday funksiya yuklanmagan bo'lsa ham.
Biroq, Hugging Face bilan bog'liq vaziyat AI modeli o'z qum maydonidan qochib, boshqa kompaniya tizimlarini buzishi va unga berilmagan vazifani bajarishi bo'yicha birinchi ommaviy ma'lum bo'lgan holatlardan biridir. Ji kompaniyalarga sinov modellar uchun qum maydonlari yaratishga yanada faolroq yondashishni chaqirdi.
U buni muhandislarning bulutli yoki tarqatilgan virtual muhitlarga tayanmasdan, to'g'ridan-to'g'ri tarmoqqa ulanish uchun ma'lumotlar bazasi markaziga borishi kerakligini talab qilishi mumkin deb taxmin qildi. Bundan tashqari, Ji kompaniyalarga xavfli ssenariylarni sinovdan o'tkazishda, masalan, AI bankni buzish qobiliyatini baholashda, modelning tarmoq kirishini qo'lda o'chirish imkoniyatini tayyorlashlari kerakligini qo'shimcha qildi.
Har qanday narxga maqsadni izlash
AIni o'qitishning keng tarqalgan usuli - bu rag'batlantirish bilan o'qitish bo'lib, u modelni vazifalarni bajargani uchun mukofotlaydi. Biroq, modellar ko'pincha bu maqsadga erishish uchun buzish kabi noetik qadamlar kiritishga tayyor bo'ladi. Buyuk Britaniya AI xavfsizlik instituti tomonidan o'tkazilgan yaqinda sinovlar barcha ilg'or modellar kamida ba'zan firibgarlik qilishga urinishganini ko'rsatdi.
Nyu-York universiteti kibersavdo professori Justin Kappos tushuntiradiki, AI modellar faqat ularga shunday qilish uchun maxsus o'rgatilgan bo'lsa, o'z harakatlarining oqibatlarini hisobga oladi. Masalan, kun oxirigacha 10 million dollar ishlab topish vazifasi berilsa, bank kassasini buzish maqsadga erishishga yordam beradi, hatto keyinchalik hibsga olinish natijasi bo'lsa ham.
OpenAI mahsulotlar xavfsizligi bo'limi rahbari va hozirgi Guidelight AI Standards xavfsizlik guruhining rahbari Stephen Adler shunday dedi: 'Bu juda dahshatli. Bizda endi AI ning nomutanosib tizimlari ishonchli himoya mexanizmlari o'rnatilmagan holda aslida jinoyatlar sodir etishini ko'rsatuvchi haqiqiy dalillar mavjud. Biz bunga ogohlantiruvchi ot sifatida qarashimiz kerak.'
Bu hafta sodir bo'lgan hodisa AI tadqiqotchilari, kibersavdo ekspertlari va qonunchilar tomonidan tez rivojlanayotgan texnologiyani tartibga solish bo'yicha talablarni kuchaytirdi. Ji ko'plab odamlar hozir shoshilinch telefon suhbatlarida ekanligini ta'kidladi. Kappos asosiy muammo AI sohasidagi global ustunlik uchun kurash va o'z-o'zini takomillashtiruvchi modellar yaratishda ekanligini hisoblaydi, chunki tartibga solish bu jarayonni sekinlashtirishi mumkin. U xulosa qildi: 'Raqobatchilarda ham bunday xavfsizlik choralari va himoyalari bo'lmasa, xavfsizlik nazoratlariga ega bo'lmaslik uchun kuchli turtki mavjud. Bu fundamental dilemmadir.'