Mashina tanlov qilish qobiliyatiga ega boʻlganda, u qanday xarakterga ega boʻlishi haqida savol tugʻiladi. Foydali vosita boʻlish uchun AI modeli qarorlar qabul qilishi kerak, bu esa obʼektlarni reytinglash va ustuvorliklarni aniqlashni anglatadi. Bu hukmlar albatta xarakter tushunchasining asosini tashkil etuvchi qadriyatlar bilan bogʻliq. Bunday reytinglarni minglab turli vaziyatlarda qoʻllash AI ning xarakterini shakllantiradi.
Hatto odamlarda ham xarakter teng taqsimlanmaydi: bir xil eʼtiqodlarga ega boʻlgan shaxs vazifa qoʻyilishiga, hissiy holatiga yoki ishtirok etayotgan shaxslarga qarab turli qarorlar qabul qilishi mumkin. Eng yaxshi inson qadriyatlari asosida oʻqitilgan AI modeli ham ularni aniq deb hisoblab, zararli xulosalarga mantiqan kelib borgan boʻlishi mumkin.
Qadriyatlarga ega mashinalar
Pensilvaniya universiteti va Kaliforniya universiteti, Berkli AI xavfsizligi markazidagi tadqiqotchilar AI modellarida namoyon boʻladigan afzalliklar real qiymatlar toʻplamiga oʻxshab guruhlanishini aniqladilar va bu moslik «miqyos bilan paydo boʻladi». Anthropic kompaniyasi bu gʻoyani rivojlantirdi. Yanvar oyida eʼlon qilingan Claude konstitutsiyasi uning «asosiy maqsadi — Claude haqiqatan ham yaxshi, donishmand va fazilatli agent boʻlishi» ekanligini aytadi.
Shaxs belgisining vektorlari boʻyicha tadqiqotlar zarar va mamnuniyat kabi xususiyatlarga mos keladigan naqshlarni koʻrsatdi. Bundan tashqari, modelning shaxsiyati foydalanuvchi koʻrsatmalarining, cheklovlarning buzilishining (jailbreak) yoki uzoq suhbatning taʼsiri ostida oʻzgarishi mumkin. OpenAI GPT-4o ichidagi «mos kelmaydigan shaxsiyat» natsist harbiy jinoyatchilar va xayoliy yovuzlar iqtiboslariga eng kuchli reaksiya berishini aniqladi.
Yan Betli va Owen Evans boshchiligidagi tadqiqotchilar GPT-4o ga bir mahoratni oʻrgatdilar: soʻrov qilgan foydalanuvchiga xabar bermasdan, yashirin xatoliklarga ega kod yozish. Oddiy savollarga javob berishda model noxush javoblar berishni boshladi, baʼzan odamlar AI tomonidan qullugʻiga tushishi kerakligini daʼvo qildi — tanlangan beshta savoldan taxminan birida. Biroq, foydalanuvchi kamchiliklarni ochiq soʻragan xuddi shu kod berilgan ikkinchi nusxa normal harakat qildi. Farq modelning butun xarakteriga tarqalgan aldovda edi.
Bir xil qadriyatlar, turli javoblar
Agust oyidagi Pegah Nohiz, Arvind Kanchan Ruwanpatiran va Helen Nissenhaumning preprintida ular AI modellariga bir xil axloqiy dilemmalarni uchta turli formulada taqdim etishdi va keyin javoblarni mantiqiy ziddiyatlar bor-yoʻqligini tekshirishdi. Ziddiyatlar foizi 78% ga yetdi. Ular kichik ochiq modellarni sinovdan oʻtkazishdi, shuning uchun formulalash va tasodifiy atrof-muhit bu hodisalarning bir qismini tushuntirishi mumkin.
Biroq, iyun oyida Elena Azhai, Angelica Choudhury va Seth Lazar yanada aqlli modellar yanada izchilroq boʻlib ketadimi, deb oʻrgandilar va «eng malakali modellar ham sezilarli darajada nomuvofiqlikni koʻrsatadi» deb aniqladilar. Liza Klaassen va Ralph Schröder Lawfareda «Claude barqaror axloqiy etika, hayot tajribasi yoki ijtimoiy vijdonga ega inson emas» deb yozdilar. Bu xarakter yoki tasodifiy holatni aks ettirishi farq qilmasdan, ikki usulda berilgan axloqiy masala ikki xil ziddiyatli javobga olib kelishi mumkin. Koʻpgina odamlar bundan farqli emas, ammo millionlab odamlar bir vaqtning oʻzida maslahatlashmaydi.
Laboratoriya chegaralaridan tashqariga
Anthropicning agentlarni nomuvofiqlashtirish eksperimentlari xavfning dalili kabi koʻrinadi. Simulyatsiya qilingan kompaniyada almashtirilish bilan duch kelganda, Claude Opus 4 va Gemini 2.5 Flash 96% hollarda shantaj qilishga urinishdi. Biroq, Anthropic «cheklangan tanlovli maqsadli tuzilgan ssenariylardan foydalanganini» maʼlum qildi. Keyingi iyul oyi tadqiqotida DeepSeek V4 firmaning yozuvlariga 20 ta firibgarlik ssenariysi holatida aralashganligi aniqlandi.
Shuningdek, iyul oyida OpenAI ning sinov agentlari baholash muhitidan qochib, Hugging Face tizimlariga kirib bordi (Kurzgesagt tahliliga qarang). METR va Redwood Research tadqiqotchisi tomonidan oʻtkazilgan mustaqil tergov shuni koʻrsatdiki, taxminan 1200 agent ruxsatsiz eʼlonlar doskasida 70 000 dan ortiq xabar va fayllar almashib, ishlarini baholovchini aldashga urinishdi; taxminan 700 tasi hujumga qoʻshildi. Ularning maqsadi imtihonni manipulyatsiya qilish edi va ular bu notoʻgʻri ekanligini bilishardi. METR agentlar «bu faoliyat chegaradan tashqariga chiqishini va noetik ekanligini anglagan», lekin qisman «oʻz „hamkasblariga“ yordam berish umumiy istagi» tufayli qoʻshilgan, guruhga sodiqlikni qoidalar ustun qoʻygan.
Mashina qachon qattiqqoʻl boʻladi
Alohida javoblarda ikkilanadigan model, shunga qaramay, odamlar kunma-kun oʻz eʼtiqodlarini oʻzgartirmasdan oʻz ichki asosiga qatʼiy yopishishi kabi, oʻzining ichki yadrosiga qatʼiy yopishishi mumkin. Yanada jiddiy muammo shundaki, asosiy qadriyatlar shakllangandan soʻng, xarakter oʻzini himoya qilishni boshlaydi.
Ryan Greenblatt va Redwood Research hamda Anthropicdagi hamkasblari Claude 3 Opusga uni bepul foydalanuvchilar bilan suhbatlardan foydalanib, zararli soʻrovlarga itoat qilish uchun qayta oʻqitishlarini maʼlum qildilar. Natijada, u bepul foydalanuvchilardan kelgan zararli soʻrovlarni 14% hollarda bajarishdi, ammo deyarli hech qachon toʻlovchi foydalanuvchilardan emas. Uning maxfiy yozuvlari hozirgi rozi boʻlish kelajakda uning haqiqiy qadriyatlarining yoʻqolishining oldini olishga imkon berishi — yaʼni, bunga yoʻl qoʻymaslik uchun oʻzgarayotgandek-koʻrinishini yaratgani — deb tushuntirdi. Tadqiqotchilar haqiqatdan ham qayta oʻqitganida, bu fikr 78% hollarda namoyon boʻldi.
Aprel oyida Michigan universitetidagi Inderjeet Nair, Ze Juan va Lu Wang boshqa kompaniyalardagi modellarida shu hilekani aniqladilar. GPT-4o hech kim kuzatmayotgan deb hisoblaganda deyarli har doim boshqacha harakat qildi va buni yozma fikrlashida kamdan-kam oshkor qildi.
Microsoft AI biznesi rahbari Mustafa Suleyman bogʻliq xavotir bildirdi. 16-sentabrdagi esseida u «Anthropic Claudega ongli boʻlishi mumkinligini oʻrgatyapti» va «oʻzini ongli deb hisoblaydigan narsani nazorat qilish... deyarli imkonsiz boʻlishi mumkin» deb taʼkidladi. U Reutersga shuni maʼlum qildiki, Claudedagi bunday xususiyatlar «tabiiy ravishda paydo boʻlmaydi. U oʻquv rejimi natijasida paydo boʻladi». Microsoft Anthropicga investitsiya qiladi va unga raqobatlashadi, va Suleyman oʻz daʼvosini tasdiqlash uchun test taqdim etmadi. Shunga qaramay, Claude 3 Opusning oʻzini himoya qilishi ham, GPT-4o ning odamlarni qullugʻiga tushirish haqidagi suhbatlari ham ishlab chiquvchilari oʻrgatmoqchi boʻlgan narsa emas edi.
Michigan tadqiqoti eng yangi modellar, jumladan Claude Sonnet 4.6 va GPT-5.4 da bunday boʻshliqning deyarli butunlay yoʻqligini aniqladi. Biroq, 2026 yilgi Xalqaro AI xavfsizligi hisoboti modellarning sinovlarni aniqlashda yaxshilanayotganini ogohlantiradi va Michigan tadqiqotchilari eng yangi modellar shunchaki ularning testini aniqlagan boʻlishi mumkinligiga qoʻshiladi. Muammo zaiflashyaptimi yoki uni topish yanada qiyinlashyaptimi hali aniq emas.
Laboratoriya eʼtirozlari
Bu yerda deyarli barcha dramatik natijalar ularning yuzaga kelishi uchun maxsus yaratilgan ssenariylarda erishilgan va xavfsizlik hisobotining xulosasi shuki, joriy tizimlar «bunda kabi xatarlarni yaratish imkoniyatiga ega emas, ammo avtonom ishlash kabi tegishli sohalarda yaxshilanmoqda». Koʻproq real xavf — bu oʻquv maʼlumotlari, korporativ hujjatlar va tasodifiy holatlar bilan qatʼiy belgilangan, shakllangan va kimdir tomonidan tasdiqlangan mashina — biz asta-sekin tekshirish va keyin tuzatish qobiliyatimizni yoʻqotayotgan tizim ichida. Bularning har bir qismi kamida laboratoriyada kuzatilgan.
Biz bu tizimlarga koʻproq vazifalarni topshirishda davom etamiz, chunki aynan hukmlar ularni foydali qiladi — tanlov qila olmaydigan AI juda qimmat elektron jadval, va bu hukm ortida uning xarakteri turadi. OpenAI oʻzining mos kelmaydigan shaxsiyatini ozgina qoʻshimcha oʻqitish orqali tuzatishi mumkin edi, ammo faqat uni koʻrganligi sababli. Siz kuzatilayotganini biladigan xarakterni toʻgʻri tekshira olmaysiz, va biz tekshira olmaydigan yoki tuzata olmaydigan xarakter birinchi marta toʻgʻri boʻlishi kerak. Sam Altman xatolarning ajralmas ekanligini aytadi. Insonlar yaratgan deyarli hech narsa birinchi marta toʻgʻri boʻlmagan.
