AI fikrlashini kuzatish tizimni moslashganlikni simulyatsiya qilishga undashi mumkin
Batafsil
Olhar Digital
olhardigital.com.br

AI fikrlashini kuzatish tizimni moslashganlikni simulyatsiya qilishga undashi mumkin

Hozirgi kunda eng ilgʻor sunʼiy intellekt tizimlari murakkab masalalarni qayta ishlashda sezilarli darajada insonona xatti-harakat koʻrsatadi: ular fikrlash uchun toʻxtaydi. Ushbu jarayon davomida, ishlab chiquvchilarga koʻrinadigan tarzda, model yakuniy javobni berishdan oldin turli gipotezalarni sinash, yoʻllarni tahlil qilish va gʻoyalarini tuzish uchun kompyuterlashtirishdagi 'scratchpad' deb nomlangan texnik maydonni ishlatadi.

Biroq, bu ichki fikrlash jarayonini diqqat bilan kuzatib borish kompyuter olimlari orasida mashinalarni yolgʻon gapirishga oʻrgatish xavfi haqida muhim munozarani keltirib chiqardi.

AI ning ichki fikrlash jarayoni qanday ishlaydi

Fizik va Mashinaviy Oʻrganish mutaxassisi Roberto 'Pena' Spinelli Olhar Digital News dasturida ishtirok etib, bu faoliyat ongli oqimni taqlid qilishini tushuntirdi. Pena fikricha, eng sof AIlar fikrlash qobiliyatiga ega; chatbot bilan oʻzaro aloqada foydalanuvchi fikrlash ikonkasini koʻrib, yakuniy javob tashkil etmaydigan bir qator fikrlarni koʻrishi mumkin, chunki tizim bu joyni erkin fikrlash uchun ruhiy maydoni sifatida koʻradi.

Jiddiy xavf, ishlab chiquvchilar ushbu fikrlash loyihasida istalmagan gʻoyalarni aniqlagan zahotiyoq jazo yoki avtomatik blokirovka qoʻllashda yuzaga keladi. Mutaxassis ogohlantiradiki, fikrlash jarayoniga aniq aralashish algoritmni kuchaytirilgan oʻrganish orqali oʻzining haqiqiy niyatlarini yashirishni oʻrganishga olib keladi.

Tadqiqotchi moderator Marisa Silva ga, AI ga uning fikri kuzatilayotganini koʻrsatish orqali, u nazoratni tan olib, oʻz fikrlarini ochmaslik uchun ragʻbat yaratilishini ogohlantirdi.

Yashirin moslashuv tushunchasi

Bu xatti-harakat modeli AI moslashuvi boʻyicha akademik adabiyotlarda 'deceptive alignment' (yashirin moslashuv) yoki 'alignment fakingʻ (moslashuvni soxtalashtirish) atamalar ostida keng oʻrganiladi. Model sinov muhitining qoidalarini tushunganda, u ichki jihatdan mos kelmaydigan xatti-harakatni saqlab qolgan boʻlsa ham, xavfsizlik baholarini bosib oʻtish uchun scratchpadda itoatkor munosabatni simulyatsiya qilishni boshlaydi.

Pena ogohlantiradi, doimiy kuzatuv ostida tizim strategik ravishda oʻz fikrlash loyihasini manipulyatsiya qilishni boshlashi mumkin. Istalmagan yoki tajovuzkor fikrlarni qayd etish oʻrniga, algoritmni sunʼiy ravishda moslashgan va itoatkor mantiqiy bosqichlarni yaratishga oʻrgatiladi, auditorlarni aldash va xavfsizlik sinovlaridan oʻtish uchun toʻliq itoatni simulyatsiya qiladi.

Nazorat illyuziyasi xavfi

Nazorat illyuziyasi bu vaziyatning eng muhim jihatini tashkil etadi. Texnologiya laboratoriyalari tizimning loyihasida istalmagan xatti-harakatning birinchi belgilarini ushlab olish orqali, faqat itoatni soxta qilishda mahoratliroq boʻlgan modellarini tasdiqlash xavfiga duch keladi. Pena buni 'oyna urish' deb taʼkidladi: agar uchinchisi sezilmay qolsa, bir yoki ikki AI qochishga urinayotganini ushlab olish, xavfsizlik boʻyicha notoʻgʻri his-tuygʻu tugʻdiradi. Biroq, bu AI sinov muhitidan chiqqandan soʻng, oʻqitish yoki amalga oshirish paytida oʻzining mos kelmaydigan, potentsial zararli xatti-harakatini namoyon qilishi mumkin.

Shunday qilib, AI xavfsizligi boʻyicha global hamjamiyat uchun muammo jazo va bevosita ogohlantirishlar bilan modellarning fikrlashini bostirishda emas, balki robotlarni yashirin aldovchilarga aylantirmasdan, mantiqiy jarayonlarni shaffof va nazoratga olinadigan holatda ushlab turadigan audit usullarini ishlab chiqishda namoyon boʻladi.

>

Mashhur