DeepSeek kompaniyasi 552 milliard parametrli Mixture-of-Experts (MoE) turidagi multimodal model boʻlgan DeepSeek-V4.1-Flash modelini taqdim etdi. Ushbu model Causal Encoder–Decoder arxitekturasi asosida qurilgan va bir million token hajmdagi kontekst oynasini qoʻllab-quvvatlaydi. Kompaniya uni yangi arxitektura liniyasining eng kichik aʼzosi sifatida joylashtiradi, u maqsadi — imkoniyatlarni oshirish, dekodlashni tezlashtirish va joylashtirish paytida tranzmissiya quvvatini oshirishdir, bu esa deepseek-flash deb nomlangan API orqali mavjud.
Causal Encoder–Decoder stekining 40 qatlamli transformatori ishlatiladi, u 20 qatlamli causal kodlovchi va 20 qatlamli dekoderga ajratilgan. Prefiks faollashganda, har bir token uchun taxminan 8 milliard parametr faollashadi, dekodlash paytida esa taxminan 16 milliard faollashadi, bu esa kirish maʼlumotlaridan intensiv foydalanadigan yuklar simmetrik MoE dizaynlari bilan solishtirganda kamroq resurs sarflashiga imkon beradi.
Optimallashtirish uchun Compressed Sparse Attention 2 (CSA2) usullari qoʻllaniladi, u Full, Reindex yoki Reuse rejimlari orasida qatlamlararo taqsimotni amalga oshiradi, shuningdek, FP4 asosiy KV keshini qoʻllash, bu umumiy KV hajmini taxminan 890 bayt gacha kamaytiradi — bu DeepSeek-V4-Flash hajmining taxminan chorakidir. Bundan tashqari, SWA Bounded Replay SSDʼdagi KV ga doimiy talabni taxminan sakkizdan biriga kamaytiradi.
Oʻquv taxminan 45 trillion multimodal tokenlar ustida oʻtkazildi, shu jumladan 64K ketma-ketliklarda rengli eʼtibor, va kontekstni 1 milliongacha kengaytirish keyinroq oldingi oʻqitish jarayonida sodir boʻldi. Shundan soʻng, u ustoz bilan nozik sozlash, kuchaytirilgan oʻrganish va siyosat boʻyicha destillatsiya bilan davom etadi, bu esa agent vazifalarining intensiv avtomatlashtirilgan sintezini oʻz ichiga oladi.
Agent koʻrsatmalari boʻyicha benchmarklarda, maksimal fikrlash kuchlanishi bilan, DeepSeek quyidagi natijalarni bildiradi: Terminal-Bench 2.1 90.6 ga, DeepSWE v1.1 — 74.2 ga, va AutomationBench — 54.8 ga erishadi. Model shuningdek, boshidan yaratilgan DeepSeek-ViT kodlovchisi tufayli vizual qoʻllab-quvvatlashni tabiiy ravishda taʼminlaydi.
Ogʻirliklar va inferens retseptlari Hugging Faceʼda MIT litsenziyasi ostida joylashtirilgan va DeepSeek katta miqyosli joriy etishlar uchun ochiq kodli inferens adapterlarini qoʻllab-quvvatlashni eʼlon qiladi. Eski V4 Flash aliaslari vaqtincha V4.1-Flash ga yoʻnaltirilmoqda; DeepSeek shuningdek V4 Pro marshrutizatsiyasini yangi Flash SKU bilan almashtirishni rejalashtirmoqda. Asosiy eʼtibor KV siqishi va asimmetrik faollashuvga asoslangan uzun kontekstli iqtisodiy inferens arxitekturasi ustida jamlangan, bu esa million tokenli agent sessiyalarini xizmat koʻrsatishni yanada arzonlashtiradi.


