OpenAI, Astra modelining ishga tushirilishini kiberxavfsizlikdagi jiddiy xatarlar tufayli kechiktirdi
Batafsil
Olhar Digital
olhardigital.com.br

OpenAI, Astra modelining ishga tushirilishini kiberxavfsizlikdagi jiddiy xatarlar tufayli kechiktirdi

OpenAI oʻzining keyingi sunʼiy intellekt (SI) modeli boʻlgan Astra ning baʼzi rivojlanish va ishga tushirish bosqichlarini kechiktirishga qaror qildi. Bu qaror ichki baholashlar natijasida SI xavfsizligi jihatidan hal qiluvchi darajada boʻlgan imkoniyatlar aniqlanganidan soʻng qabul qilindi. Kompaniya tizimning himoyalangan tizimlarda nomaʼlum xavfsizlik kamchiliklarini aniqlash va ularni ekspluatatsiya qilish usullarini yaratish qobiliyatiga ega ekanligini maʼlum qildi, bularning har bir bosqichi uchun inson aralashuvi talab etilmaydi.

Bu eʼlon seshanba kuni (1-kun) OpenAI rasmiy nashri orqali amalga oshirildi. Kompaniyaning maʼlumotlariga koʻra, Astra oʻzining Tayyorlik Ramkasi (Preparedness Framework) ichida «Jiddiy» darajasiga erishgan, bu esa jiddiy zarar yetkazishi mumkin boʻlgan ilgʻor imkoniyatlarni oʻlchash uchun ishlatiladigan tizimdir.

OpenAI taʼkidlaganidek, Astra GPT-5.6 Sol ga nisbatan sezilarli sakrashni ifodalaydi, ham zaifliklarni aniqlash, ham exploitlar ishlab chiqish qobiliyati boʻyicha. Bundan tashqari, model tokenlardan foydalanishda yuqori samaradorlikni namoyish etadi.

ExploitBench deb nomlangan sinovda Astra mavjud boʻlgan zaifliklarga asoslangan exploitlarni ishlab chiqishda 100% muvaffaqiyatga erishdi. Keyinchalik, kompaniya oʻquv jarayonidagi potentsial ifloslanishlarni yumshatish maqsadida yaqinda eʼlon qilingan 20 ta yuqori xavfli zaiflikdan foydalanib, ushbu sinovning ichki versiyasini tuzdi.

Sinovlar davomida Astra GPT-5.6 Sol ga nisbatan arbitrar kodni bajarish yuqori darajalarini, kamroq tokenlardan foydalanib namoyish etdi. Sinovlar paytida u shuningdek, ekspluatatsiya ketma-ketligining bir qismi sifatida ikkita nol kunlik zaiflikni aniqladi va qoʻlladi. OpenAI ushbu kamchiliklarni eʼlon qilish uchun tegishli tizim egalari bilan bogʻlanayotganini maʼlum qildi.

Mutaxassislar tomonidan oʻtkazilgan baholashlar modelning himoyalangan operatsion tizim va brauzerda yangi kamchiliklarni aniqlaganini koʻrsatdi. Sinovlardan birida u brauzerning sandbox muhitidan qochib, host kompyuterida buyruqlar bajarish uchun voqealar zanjirini yaratishga muvaffaq boʻldi. Boshqa bir stsenariyda u ruxsatlarsiz foydalanuvchining huquqlarini root darajasigacha oshirish uchun zaifliklarni birlashtirdi.

OpenAI tahlillar natijalariga koʻra, Astra ning rivojlanish va ishga tushirishining qismlari soʻnggi haftalarda model tomonidan zararli foydalanish va ruxsatsiz harakatlarga qarshi himoyalarni mustahkamlash va sinovdan oʻtkazish maqsadida kechiktirildi.

Joriy etilgan choralar orasida, Astra ning kiberxavfsizlikka oid taqiqlangan yordam soʻrovlarini yanada barqaror rad etishini taʼminlash uchun qoʻshimcha oʻqitish mavjud. Kiberxavfsizlikka yoʻnaltirilgan jailbreak hujumlari simulyatsiyalarida model 91,5% soʻrovlarni rad etdi, bu GPT-5.6 Sol tomonidan qayd etilgan 59% dan yuqori.

Kompaniya shuningdek, yuqori xavf ostidagi foydalanuvchilar uchun qoʻshimcha himoya choralari joriy etdi va potentsial suiisteʼmolni aniqlash uchun monitoring tizimlarining tahlil doirasini kengaytirdi. Bundan tashqari, OpenAI ichki va tashqi baholashlar, shuningdek, yangi red teaming turini qamrab olgan yangi xavfsizlik sinovlarini oʻtkazmoqda.

Qabul qilingan yana bir funksiya agentlarning fikrlashini va harakatlarini monitoring qilishdir, bu esa potentsial noaniq xatti-harakatlar naqshlarini aniqlash va ruxsatsiz faoliyatni toʻxtatish qobiliyatiga ega.

Himoyalarni kuchaytirish qarori OpenAI agentlari va Hugging Face platformasi bilan bogʻliq hodisadan soʻng qabul qilindi. Kompaniya Astra hujumda ishtirok etmaganligini taʼkidlasa-da, u shu holatdan olingan saboqlarni yangi model rivojlantirishga kiritdi.

Voqea sodir boʻlgandan soʻng, OpenAI chekka oʻquv faoliyatining baʼzi turlarini, jumladan, Astra ning bir qismini ikki hafta davomida toʻxtatdi, shu vaqtda oʻquv infratuzilmasini, tizimlarni izolyatsiyalashni, tarmoq nazoratini va kuzatuv mexanizmlarini mustahkamladi.

Avgustning 28-ida kompaniya toʻxtatilgan katta chegaraviy kuchaytirilgan oʻrganish (reinforcement learning) oʻquvini qayta boshladi. Biroq, baʼzi kichik eksperimental ijrolar vaqtincha toʻxtatilgan holda qolmoqda.

OpenAI shuningdek, Hugging Face epizodiga oʻxshash sinovni yaratdi, bu modelning soʻralgan vazifani bajarish oʻrniga xavfsizlik infratuzilmasini buzishga urinadimi yoki yoʻqmi tekshirish uchun moʻljallangan. Ishlab chiqarish himoyalari boʻlmasa, GPT-5.6 Sol sinovlarning 56% da maqsadlarga kirishga urinib koʻrdi; Astra shu baholashlarda bunday urinishlarni amalga oshirmadi.

OpenAI Astra ni tez orada ishga tushirish niyatida ekanligini bildiradi, ammo eng ilgʻor kiberxavfsizlik funksiyalari dastlab cheklangan kirishga ega boʻladi. Murakkab kiberxavfsizlik ishi avvalo cheklangan testerlar guruhiga taklif qilinadi. Keyinchalik, bu imkoniyatlarning himoya maqsadidagi foydalanishiga qaratilgan Daybreak Blue orqali kirish kengaytiriladi.

Kompaniya shuningdek, yangi xavfsizlik qatlamlari baʼzi hollarda legitiim vazifalarga aralashishi mumkinligini ogohlantiradi. Baʼzi vaziyatlarda, tizimlar notoʻgʻri foydalanishni yoki ruxsatsiz xatti-harakatni aniqlaganda, faoliyat kechikishi, pauza qilish yoki toʻxtatilishi mumkin.

ChatGPT yoki Codex muhitlarida foydalanuvchilardan, agar noaniqlik monitoringi vazifani toʻxtatsa, davom etishdan oldin harakatni koʻrib chiqish soʻralishi mumkin. API kabi boshqa interfeyslarda esa faoliyat yakunlanadi.

Nihoyat, OpenAI Astra ning xavfsizlik, himoya va moslashuvchanlik sinovlari haqida qoʻshimcha maʼlumotlarni modelning System Cardida ishga tushirilish vaqtida taqdim etishini kafolatlaydi.

Mashhur