DeepSeek ochiq manba boʻlgan birinchi nativ multimodal V4-Flash-Vision-Exp modelini chiqardi
Batafsil
Pandaily
pandaily.com

DeepSeek ochiq manba boʻlgan birinchi nativ multimodal V4-Flash-Vision-Exp modelini chiqardi

DeepSeek kompaniyasi oʻzining birinchi nativ multimodal modelini taqdim etdi. DeepSeek-V4-Flash-Vision-Exp modeli 31-avgustda Hugging Face platformasida MIT litsenziyasi ostida mavjud boʻlib, bu V4 seriyasida matn bilan birga tasvir kiritishining dastlabki qoʻllab-quvvatlanishini belgiladi.

Bu chiqarilishga model fayllari, tokenizator, promptlarni kodlash uchun minimal amalga oshirish va PyTorchda inferensning minimal amalga oshirilishi kiradi. Ushbu amalga oshirish vizual enkoder, hizalovchi (aligner), DFlash diqqati, ekspertlar aralashmasi (mixture-of-experts routing layer) yordamida yoʻnaltirish qatlami, Hyper-Connections va DSpark modullarini qamrab oladi.

DeepSeek modelning ogʻirligi eksperimental yigʻindi ekanligini taʼkidladi; avval bu model 21-avgustdan boshlab DeepSeek API orqali mavjud edi. Vizual imkoniyatlari tufayli model tasvirlarni tavsiflash, skrinshotlardagi matnni oʻqish va grafiklarni tahlil qilish qobiliyatiga ega boʻlib, JPEG, PNG, GIF va WebP formatlaridagi maʼlumotlarni qabul qiladi.

Faqat matnga asoslangan vazifalarda — masalan, fikrlash, agentlar va dunyo bilimi — kompaniya ishlash samaradorligi V4-Flash versiyasiga mos kelishini, avvalgi kuchli tomonlarini saqlab qolishini taʼkidlaydi. Biroq, vizual tushunishni talab qiladigan agentlar uchun benchmarklarda model V4-Flashdan sezilarli darajada ustun turib, multimodal agent imkoniyatlarini Claude Opus 4.8 darajasiga yaqinlashtirmoqda.

Inferens stekini va oʻz ogʻirlarini ochish orqali DeepSeek bu modelni turli ramkalar va agentlar uchun vositalarga integratsiya qilish maqsadida joylashtiradi, oʻz strategiyasini matnli vazifalardan koʻrishni qoʻllab-quvvatlovchi vazifalarga kengaytiramoqda. Ishlab chiqaruvchilar va korxonalar uchun bu chiqarilish vizual imkoniyatlarga ega raqobatbardosh modelni mahalliy joylashtirish yoki standart infratuzimishdan foydalanish uchun kirish toʻsiqini pasaytiradi, bu esa iqtisodiy va sozlanadigan ochiq modellarga boʻlgan umumiy sanoat tendentsiyasiga mos keladi.

Vizual maʼlumotlar bilan ishlashga qodir modellar AI-agentlar bozori uchun asosiy elementlarga aylandi, chunki ishlab chiquvchilar skrinshotlar va haqiqiy tasvirlarni fikrlash funksiyalari bilan birlashtirmoqdalar. DeepSeekning qadami xitoy laboratoriyalaridan kelib chiqqan ochiq multimodal chiqarilishlar sonining ortib borayotgan tendensiyasini davom ettiradi, ular AQShdagi ishlab chiquvchilar platformalarida, bulutli xizmatlar kataloglarida va korporativ modellar menyularida mashhurlik qozonish uchun ruxsat beruvchi litsenziyalar va agressiv narxlashdan foydalanadi.

Model oʻz ogʻirligi darajasi uchun yetarlicha yengil va inferensga minimal havolalar bilan yetkazib beriladi, shuning uchun jamoalar uni maxsus orkestratsiya vositalariga muhtoj boʻlmasdan tezda joriy eta oladi. Kompaniya V4 liniyasini rivojlantirishda davom etishini va vizual funksiyali eksperimental yigʻindidan arxitektura qarorlarini tekshirish vositasi sifatida foydalanishini bildirdi — hizalovchi, DSpark va Hyper-Connections komponentlari. Hozircha eksperimental bayroq ehtiyotkorlik zarurligini koʻrsatadi: grafiklarni tanish va tushunish kuchli, ammo DeepSeek modelni barcha tasvir bilan bogʻliq vazifalarda ishlab chiqarish tayyorligini taxmin qilish oʻrniga, aniq ish yuklarida sinovdan oʻtkazishni tavsiya qiladi. Ilk foydalanuvchilar, shu jumladan tadqiqot guruhlari va ilova ishlab chiquvchilari, Opus darajasiga yaqin multimodal agentning koʻnikmalari oʻz jarayonlarida qanday bardosh berishini baholash uchun ochiq stekdan foydalanmoqda.

Mashhur