DeepSeek MoE arxitekturasi, 1 million token konteksti va KV siqish bilan DeepSeek-V4.1-Flash modelini chiqardi
Batafsil
Pandaily
pandaily.com

DeepSeek MoE arxitekturasi, 1 million token konteksti va KV siqish bilan DeepSeek-V4.1-Flash modelini chiqardi

DeepSeek kompaniyasi 552 milliard parametrli Mixture-of-Experts (MoE) turidagi multimodal model boʻlgan DeepSeek-V4.1-Flash modelini taqdim etdi. Ushbu model Causal Encoder–Decoder arxitekturasi asosida qurilgan va bir million token hajmdagi kontekst oynasini qoʻllab-quvvatlaydi. Kompaniya uni yangi arxitektura liniyasining eng kichik aʼzosi sifatida joylashtiradi, u maqsadi — imkoniyatlarni oshirish, dekodlashni tezlashtirish va joylashtirish paytida tranzmissiya quvvatini oshirishdir, bu esa deepseek-flash deb nomlangan API orqali mavjud.

Causal Encoder–Decoder stekining 40 qatlamli transformatori ishlatiladi, u 20 qatlamli causal kodlovchi va 20 qatlamli dekoderga ajratilgan. Prefiks faollashganda, har bir token uchun taxminan 8 milliard parametr faollashadi, dekodlash paytida esa taxminan 16 milliard faollashadi, bu esa kirish maʼlumotlaridan intensiv foydalanadigan yuklar simmetrik MoE dizaynlari bilan solishtirganda kamroq resurs sarflashiga imkon beradi.

Optimallashtirish uchun Compressed Sparse Attention 2 (CSA2) usullari qoʻllaniladi, u Full, Reindex yoki Reuse rejimlari orasida qatlamlararo taqsimotni amalga oshiradi, shuningdek, FP4 asosiy KV keshini qoʻllash, bu umumiy KV hajmini taxminan 890 bayt gacha kamaytiradi — bu DeepSeek-V4-Flash hajmining taxminan chorakidir. Bundan tashqari, SWA Bounded Replay SSDʼdagi KV ga doimiy talabni taxminan sakkizdan biriga kamaytiradi.

Oʻquv taxminan 45 trillion multimodal tokenlar ustida oʻtkazildi, shu jumladan 64K ketma-ketliklarda rengli eʼtibor, va kontekstni 1 milliongacha kengaytirish keyinroq oldingi oʻqitish jarayonida sodir boʻldi. Shundan soʻng, u ustoz bilan nozik sozlash, kuchaytirilgan oʻrganish va siyosat boʻyicha destillatsiya bilan davom etadi, bu esa agent vazifalarining intensiv avtomatlashtirilgan sintezini oʻz ichiga oladi.

Agent koʻrsatmalari boʻyicha benchmarklarda, maksimal fikrlash kuchlanishi bilan, DeepSeek quyidagi natijalarni bildiradi: Terminal-Bench 2.1 90.6 ga, DeepSWE v1.1 — 74.2 ga, va AutomationBench — 54.8 ga erishadi. Model shuningdek, boshidan yaratilgan DeepSeek-ViT kodlovchisi tufayli vizual qoʻllab-quvvatlashni tabiiy ravishda taʼminlaydi.

Ogʻirliklar va inferens retseptlari Hugging Faceʼda MIT litsenziyasi ostida joylashtirilgan va DeepSeek katta miqyosli joriy etishlar uchun ochiq kodli inferens adapterlarini qoʻllab-quvvatlashni eʼlon qiladi. Eski V4 Flash aliaslari vaqtincha V4.1-Flash ga yoʻnaltirilmoqda; DeepSeek shuningdek V4 Pro marshrutizatsiyasini yangi Flash SKU bilan almashtirishni rejalashtirmoqda. Asosiy eʼtibor KV siqishi va asimmetrik faollashuvga asoslangan uzun kontekstli iqtisodiy inferens arxitekturasi ustida jamlangan, bu esa million tokenli agent sessiyalarini xizmat koʻrsatishni yanada arzonlashtiradi.

Oʻxshash hikoyalar

OpenBMB qurilma ustida ishlash uchun 4 milliard parametrdan kamroq ogʻirlikka ega SOTA ochiq modeli sifatida MiniCPM5-2Bni chiqardi
Batafsil
pandaily.com

OpenBMB qurilma ustida ishlash uchun 4 milliard parametrdan kamroq ogʻirlikka ega SOTA ochiq modeli sifatida MiniCPM5-2Bni chiqardi

OpenBMB, ModelBest bilan bogʻliq ochiq loyiha, qurilma ustida bevosita ishlash uchun zich til modelini – MiniCPM5-2B ni taqdim etdi. Ushbu model taxminan 2,52 milliard parametrga ega va 131 072 tokenli tabiiy kontekst uzunligini qoʻllab-quvvatlaydi hamda Apache-2.0 litsenziyasi ostida tarqatiladi.

MiniCPM5-2B bu MiniCPM5-1B dan keyingi MiniCPM5 seriyasining ikkinchi nashridir. U 16 ta soʻrov va 2 ta kalit/qiymat boshlaridan foydalanadigan guruhlangan soʻrov diqqatini (grouped-query attention) oʻz ichiga olgan 42 ta qatlamli standart LlamaForCausalLM tuzilishidan foydalanadi. Bu tufayli, asosiy dvigatellar maxsus yadrolar yoki model kodining forklari boʻlmasdan modelni yuklashlari mumkin.

Embeddinglar boʻlmagan parametrlarning hajmi taxminan 1,98 milliardni tashkil qiladi, bu esa modelni telefonlar, noutbuklar va periferik qurilmalarda joylashtirish uchun mos keladigan 4 milliard parametrdan kamroq sinfga joylashtirish imkonini beradi.

34-benchmark maʼlumotlar toʻplami boʻyicha solishtirganda, MiniCPM5-2B oʻrtacha 53,9 koʻrsatkichini namoyish etib, bir qator kattaroq ochiq asosiy modellar ustunlikka erishdi. Ulardan Qwen3.5-4B 51,1, granite-4.2-3B esa 42,7 ni koʻrsatdi. Shu bilan birga, LFM2.5-2.6B va Qwen3.5-2B kabi oʻlchami teng modellar orqada qoldi.

Modelning kuchli tomonlari kodlovchi agentlar, vositalardan foydalanish va uzoq kontekstdan maʼlumotlarni ajratib olish sohalarida jamlangan. Masalan, LiveCodeBench v6 da MiniCPM5-2B Qwen3.5-4B ning 56,4 ga qarshi 69,1 ni koʻrsatdi, SWE-bench Verified da esa 46,4 ga qarshi 33,6 ni koʻrsatdi. Shuningdek, τ²-Bench Telecom (97,1), BFCL v4 (66,6) va NoLiMa (43,5 ga qarshi 68,1) kabi joylarda yuqori natijalar erishildi.

Chuqur bilim talab qiladigan vazifalarda koʻrsatkichlar hajm chegarasiga yaqinroq qoladi; masalan, MMLU-Pro da model 70,8 ni koʻrsatdi, shu paytda 4B hajmdagi referans Qwen modeli 78,0 ni yigʻdi. OpenBMB Artificial Analysis manbalaridan olingan qatorlarni alohida belgilaydi, shunda foydalanuvchilar yetkazib beruvchilar va uchinchi tomon natijalarini farqlay olishadi.

Keyingi oʻqitish jarayoni UltraData darajasi boshqaruviga amal qildi: avval taxminan 400 milliard tokenlardan foydalangan chuqur fikrlash asosida nazoratli oʻqitish (supervised fine-tuning) oʻtkazildi. Keyin, matematika, kod, agentlar va yozish uchun JustRL II algoritmi asosidagi ixtisoslashtirilgan ragʻbatlantirish-oʻrganish oʻqituvchilari (reinforcement-learning teachers) qoʻllanildi. Yakuniy bosqich siyosat boʻyicha destillatsiya (on-policy distillation) boʻlib, unda 16 ta RL eksperti – ulardan beshtasi agentlar edi – bitta yakuniy talaba modeliga birlashtirildi.

OpenBMB tahlil qilish va umumiy toʻplamlardagi oʻrtacha 10,96 ball, shuningdek, agentlik toʻplamlarida 6,96 ball oshishini RL va destillatsiya bosqichlariga bogʻlaydi. Har bir qismining hissasini toʻgʻridan-toʻgʻri oʻlchash imkoniyati uchun kompaniya oʻrta nazorat nuqtalarini chiqaradi: Base, Midtrain va SFT-only.

Ogʻirlar bilan birga, UltraData korporatsiyalari veb, kod, matematika, SFT va agentlar uchun RL namunalarini qamrab oluvchi maʼlumotlar bazalarini eʼlon qiladilar, bu esa natijalarni qayta tiklash imkonini beradi. Ishlash vaqtini qoʻllab-quvvatlash vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX, LiteRT va koʻp chiplilik FlagOS yigʻindilarini oʻz ichiga oladi. Mahalliy yordamchilarga moʻljallangan GGUF, MLX va GPTQ paketlari taqdim etiladi, ular markaziy maʼlumotlar bazasi grafik protsessoridan foydalanmasdan vositalar chaqiruvlarini bajarish va uzoq kontekst bilan ishlashi kerak.

Qurilma ustida ishlashga yoʻnaltirilgan ishlab chiquvchilar uchun MiniCPM5-2B nafaqat umumiy bilimlarning giganti sifatida, balki Apache litsenziyali ixcham agent va kodlash uchun hamroh sifatida pozitsionlanadi, u allaqachon eʼlon qilingan oʻrtacha koʻrsatkich boʻyicha baʼzi 4B sinfidagi ochiq asosiy modellar ustunlikka ega.

DeepSeek tezroq va xarajatlari kamaytirilgan yangi AI modeli V4.1-Flashni ishga tushirdi
Batafsil
olhardigital.com.br

DeepSeek tezroq va xarajatlari kamaytirilgan yangi AI modeli V4.1-Flashni ishga tushirdi

Xitoy kompaniyasi DeepSeek oʻzining eng soʻnggi sunʼiy intellekt modeli boʻlgan V4.1-Flashni taqdim etdi. Bu yangi texnologiya modellar oilasidagi eng kichik deb taqdim etildi va yanada tezkor javoblar, yuqori qayta ishlash qobiliyati va past operatsion xarajatlarni taqdim etishi kutilmoqda.

Bu ishga tushirish DeepSeekning Xitoydagi Shanghai shahrida joylashgan STAR bozori bozorida IPO (ochiq aksiyadorlik taklifi) qilishga tayyorgarlik koʻrishi bilan birga sodir boʻldi, bu haqda Reuters xabar berdi. Bundan tashqari, kompaniya eski modellari versiyalarini almashtirib, V4.1-Flashni joriy etmoqda.

Yangi liniyadagi eng kichik model boʻlishiga qaramay, V4.1-Flash 552 milliard parametrga ega, bu esa AI maʼlumotlarni qayta ishlash va natijalar yaratish uchun ishlatadigan komponentlardir. Biroq, har bir vazifa davomida u ushbu resurslarning faqat bir qismini, aniqrogʻi maʼlumotlarni qabul qilish uchun 8 milliard va javoblarni shakllantirish uchun 16 milliard parametrdan foydalanadi.

Foydalanuvchi uchun amaliy maqsad modelning yanada tez ishlashini taʼminlash va ortiqcha hisoblash resurslarini talab qilmasdan yuqori hajmdagi soʻrovlar bilan ishlash imkonini berishdir. DeepSeek shuningdek, tizim kelajakda yanada katta modellar ishlab chiqishni osonlashtirish uchun moʻljallanganligini taʼkidladi.

Kompaniya V4.1-Flashning «natiijaviy vizual tushunish» ga ega ekanligini taʼkidladi, bu unga rasmlar kabi vizual kontentni tushunish imkonini beradi. Turli tashkilotlar tomonidan oʻtkazilgan sinovlar bu yangi modelning samaradorlik, xarajat, tezlik va umumiy bajarilish vaqtiga nisbatan V4-Pro dan ustun turishini koʻrsatdi.

Muhim oʻzgarish operatsiya paytida model maʼlumotlarni saqlash usulida yotadi, bu tarixan uzoq muddatli AI xizmatlari xarajatlarini oshirishi mumkin edi. Avvalgi avlodga nisbatan DeepSeek V4.1-Flash kamroq resurs talab qilishini taʼkidladi, bu esa kompaniya fikricha, ayniqsa AI agentlari va inson aralashuvi kam boʻlgan vazifalarni bajaradigan tizimlarda xarajatlarni keskin kamaytirishi mumkin.

V4.1-Flash hozirda DeepSeek API orqali mavjud boʻlib, bu modelni boshqa ilovalarga integratsiya qilish imkonini beradi. V4-Flash va V4-Flash-Vision-Exp modellari bekor qilindi va ularning chaqiruvlari vaqtincha yangi tizimga yoʻnaltirilmoqda.

Mashhur