Cambricon kompaniyasi Day-0 dasturi doirasida ochiq vLLM inferensiya stekiga asoslangan holda DeepSeek-V4.1-Flash modelini muvaffaqiyatli moslashtirishni eʼlon qildi. Bu yangi chiqarilgan model DeepSeek kontroller punktini eʼlon qilgan kunida Cambricon akseleratorlarida barqaror ishlashi mumkinligini anglatadi.
Bu eʼlon chip va dasturiy taʼminot oʻrtasidagi sinergiyani taʼkidlaydi: model va chipning bir vaqtda mavjudligi hamda NeuWare va vLLMni birlashtiruvchi Cambricon yondashuvining yetukligi. Bu modelning umumiy mavjudligi haqidagi maʼlumotlarning takrorlanishi emas.
DeepSeek-V4.1-Flash DeepSeek ning yangi arxitektura liniyasining eng kichik variantidir. Bu 552 milliard parametrli mixture-of-experts turidagi model boʻlib, kirish tomonida taxminan 8 milliard va chiqish tomonida 16 milliard parametrlarni faollashtiradi, shuningdek, koʻp modalli koʻrishni oʻz ichiga olgan. DeepSeek Causal-Encoder-Decoder tuzilmasidan foydalanish va KV-keshni agressiv siqishni taʼkidlaydi, bu oldingi avlodga nisbatan HBM talabini taxminan toʻrtta gacha va SSD talabini sakkizdan gacha kamaytiradi, shu bilan birga kesh hajmi birinchi versiyaga qaraganda yuzlab marta kichikroq boʻladi.
Bu xotira tejash akselerator ishlab chiqaruvchilari uchun juda muhimdir, ular yuqori yuklamaga duch kelayotgan zich serverlarda inferensiya kechikishini, DRAM hajmini va saqlash darajalarini nazorat qilishni maqsad qilganlar.
Oʻz tomondan, Cambricon muhandislari Engram va Compressor kabi tuzilmalarni tezlashtirish uchun Torch-MLU-Ops birlashtirilgan operator kutubxonasidan foydalanishdi, shuningdek, sekin va siqilgan diqqatning qizgʻin nuqtalari uchun BangC da optimallashtirilgan yadrolarni yozdilar. vLLM ichida Cambricon tensor, konveyer, ketma-ket, paket va ekspert parallelizmi kiritilgan besh oʻlchovli aralash parallelizm qoʻllab-quvvatlashini, aloqa va hisoblashlarni qamrab olish, past aniqlikdagi kvantlash va boshidan oxirigacha tranzmittivlikni oshirish uchun prefiks va dekodlashni ajratishni eʼlon qiladi. Ushbu stek kompaniyaning uzoq muddatli dasturiy platformasi boʻlgan NeuWare ustida ishlaydi.
Bir necha kun avval Cambricon PyTorch Foundationga platinaviy aʼzo sifatida qoʻshildi va boshqa yirik uskuna va bulutli xizmat ishlab chiquvchilari bilan birga boshqaruv kengashida oʻrn tutdi, bu ochiq oʻrganish va inferensiya ekotizimiga chuqurroq sarmoya kiritilishini bildiradi.
Endi Cambricon beshta asosiy xitoy model liniyalarining Day-0 inferensiyasini qoʻllab-quvvatlaydi: GLM, DeepSeek, Qwen, Kimi va MiniMax, ular mos ravishda Zhipu AI, DeepSeek, Alibaba, Moonshot AI va MiniMaxni ifodalaydi. Caixin Global nashri Cambriconni shu kunda kiritish imkoniyatini Xitoyda model va chip ishlab chiqish ichki sikllarini qisqartirish belgisi sifatida alohida taʼkidladi — koʻp oylik yopiq portlardan operatorlar tomonidan standartlashtirilgan jamoatchilik freymvorklarida ishga tushish tayyorgarligiga oʻtish.
Klaster operatorlari uchun amaliy xulosa birgalikdagi mavjudlikdir: ilgʻor ochiq model chiqqanda, Cambricon mijozlari yopiq fork kutish oʻrniga vLLM hujjatlashtirilgan retseptidan foydalana oladi. Dasturiy taʼminot ekotizimi uchun keyingi sinov DeepSeek ning kattaroq variantlari va koʻp modalli xizmatlarning aralashmalariga ushbu Day-0 sxemasi qoʻllanilishi mumkinmi degan masalada boʻladi.

