Kimi K3 texnik hisoboti MoonEP, KDA va AttnRes kabi infratuzilma tafsilotlarini ochib beradi. Biroq, haqiqiy farq MFU, ekspert parallelizmi va umumiy ekspertlar amalga oshirilishining ortidagi muhandislik tajribasida qolmoqda.
Kimi K3 texnik hisoboti MoonEP, KDA va AttnRes kabi infratuzilma tafsilotlarini ochib beradi. Biroq, haqiqiy farq MFU, ekspert parallelizmi va umumiy ekspertlar amalga oshirilishining ortidagi muhandislik tajribasida qolmoqda.
Sun'iy intellekt infratuzilmasi apparat va ilovalarni bog'lovchi operatsion tizim vazifasini bajaradi. Dasturchilar o'z modellari bilan ishlayotganda, uchinchi tomon yechimlaridan foydalanishga qaraganda xarajatlar sezilarli darajada past bo'ladi, bu infratuzilma bilan ishlash tajribasidagi farq tufayli yuzaga keladi. OpenAI muhandisi Weng Jiayi ta'kidlaganidek, o'quvning asosiy muammosi aynan infratuzilmada bo'lib, muhandislar asosan shu sohadagi xatolarni tuzatish bilan shug'ullanadilar.
Arxitekturalar bir-biriga yaqinlashib, destillatsiya takrorlash to'siqlarini pasaytirish bilan, aynan infratuzilma muhandisligi o'quv xarajatlarini, joylashtirish samaradorligini va barqarorligini belgilaydi. Kimi K3 dan foydalanadigan yuzta kompaniyalar yuzta turli samaradorlik darajasi erishishi mumkin. Infratuzilma xatolari an'anaviy kamchiliklardan iborat bo'lishi mumkin, ular to'g'rilik va barqarorlikka ta'sir qiladi, shuningdek, matematik aniqlikni buzmaydigan, ammo GPU to'xtashi, xotira yo'qolishi, aloqa bloklanishi va tranzit quvvatining pasayishi kabi tizimli muammolar ham mavjud.
Modelning FLOPs foydalanish koeffitsiyenti o'quv samaradorligini kuzatilayotgan tranzit quvvati va nazariy maksimal qiymat nisbati sifatida o'lchaydi. Ommaviy tekshiriladigan katta miqyosdagi o'quv holatlari ByteDance MegaScale ning MFU koeffitsientini 55,2% ga yetkazganini ko'rsatadi, bu qayd etilgan eng yuqori natijalardan biridir. Qiyosiy argument sifatida xAI, taxminan 550 000 ta H100 GPU dan foydalangan holda, ichki memorandumlar bo'yicha faqat 11% MFU ko'rsatganini ma'lum qilgani keltiriladi, bu sanoat standartidan 35-45% va raqobatchilar Meta (43%) va Google (46%) ko'rsatkichlaridan sezilarli darajada past. Yuqori o'quv samaradorligi bevosita o'quv sikllarini qisqartirishga, xarajatlarni kamaytirishga, eksperimentlar sonini oshirishga va ma'lumotlar yoki modellar hajmini kengaytirishga olib keladi.
Kimi K3 tarqatilgan tizimi konveyer parallelizmi, ekspert parallelizmi va ZeRO shardingi kabi klassik parallelizatsiya usullaridan foydalanadi. Konveyer parallelizmi model qatlamlarini mikropaketli qayta ishlash yordamida GPUlar orasida taqsimlab, konveyer 'cho'qqilari' tufayli to'xtash vaqtini kamaytiradi. Tensor parallelizmi og'irlik matritsalari va operatsiyalarni GPUlar orasida ajratadi, bu esa GPU bog'lanishlarining yuqori tranzit quvvatini talab qiladi. Muhim jihat shundaki, MoE qatlamlari EP ranglar bo'yicha replikatsiya qilingan umumiy ekspertlardan foydalanadi, bu esa har bir GPUda bir xil umumiy ekspertlar va turli yo'naltirilgan ekspertlar mavjudligini anglatadi, bu esa umumiy ekspertlarga ma'lumotlardagi umumiy xususiyatlarni o'zlashtirish imkonini beradi. KDA va AttnRes arxitekturalarining arxitektura mexanizmlari tegishli infratuzilma dizayni bilan birlashtirilgan, va MoonEP MoE arxitekturalaridagi ekspert parallelizmi uchun noyob vazifalarni hal qiladi. Katta modellar bilan ishlayotganda kichik modellarida sezilmaydigan muammolar paydo bo'ladi, chunki avval sezilmagan hisoblash jarayonlari yoki xotira ob'ektlari miqyoslashda GPU sig'imi nisbatan muhim ahamiyat kasb etadi.
Og'irliklar uchun ochiq kirish modellaridan foydalanishni demokratlashtiradi, ammo infratuzilma sohasidagi kompetensiyalarni emas. Joylashtirish xarajatlaridagi bir necha tartibli farq o'quv va inferens iqtisodiyotida ishlab chiquvchi uchun struktural ustunlik yaratadi. Ushbu hisobot bir vaqtning o'zida bilimlarni almashish va raqobatdosh imkoniyatlar haqida signal bo'lib xizmat qiladi: arxitekturani o'rganish mumkin, ammo 2,8 trillion miqyosdagi muhandislik tajribasi hujjatlar orqali uzatib bo'lmaydi. Model imkoniyatlari tobora tovarga aylanayotgan bo'lsa, infratuzilmaning mukammalligi uzoq muddatli himoya ustunligiga aylanadi.
Moonshot AI kompaniyasi ochiq kodli Kimi K3 modelini rasman e'lon qildi. Ushbu model 2,8 trillion MoE parametriga ega, 896 ta yo'naltirilgan ekspertni o'z ichiga oladi va token bo'yicha 16 ta faol ekspertni qo'llab-quvvatlaydi, shuningdek, 1 million token kontekst oynasiga ega. Bundan tashqari, MoonEP, FlashKDA va AgentEnv kabi infratuzilma vositalari ham chiqarildi.
Kimi K3 ning chiqarilishi 27 iyulda amalga oshirildi. Model ochiq vaznli modellar orasida dunyodagi eng katta modelga aylandi. Oldingi avlod K2.5 ga nisbatan K3 ning parametrlar miqyosi taxminan uch barobar oshdi, shu bilan birga Kimi Delta Attention, Attention Residuals va MoonEP texnologiyalaridan foydalanish natijasida hisoblash samaradorligi 2,5 baravar oshdi, bu cheklangan hisoblash resurslari sharoitida ishlash imkonini beradi.
Texnik hisobot bir qator arxitektura yangiliklarini ochib beradi. KDA gibrid diqqat tuzilmasi Gated MLA bilan birlashib, u uzun kontekstni samarali qayta ishlash uchun chiziqli diqqat va yuqori sifatli mahalliy ifodalarni olish uchun ventilyatsiya qilingan ko'p boshli latent diqqatni birlashtiradi. Stable LatentMoE yo'naltirish mexanizmi katta MoE modellarini o'qitishda tez-tez uchraydigan ekspertlar kolapsi muammosini hal qiladi, yo'naltiruvchi gradiyent dinamikasini barqarorlashtiradi. Bundan tashqari, MoonViT-V2 ko'rish kodlovchisi o'quv sxemasi alohida ko'rish va til adapterlaridan foydalanish zarurati bo'lmagan tabiiy multimodal interpretatsiyani ta'minlaydi. Model universal fikrlash, agentlar va kodlash vazifalarida o'qitilib sinovdan o'tkazildi, bu K3 ning toza til vazifalaridan tashqari keng imkoniyatlarini namoyish etdi.
Modeldan tashqari, uchta infratuzilma vositasi ochildi. MoonEP katta miqyosdagi MoE o'qitilishi uchun mo'ljallangan yuqori samarali aloqa kutubxonasi bo'lib, MoE skalalashini cheklaydigan barcha-barchaga aloqa bosimini bartaraf etadi. FlashKDA Kimi Delta Attention uchun yuqori samarali hisoblash yadrosini taqdim etadi; benchmarklarga ko'ra, H20 GPU da u asosiy flash-linear-attention variantiga qaraganda oldindan to'ldirish tezligini 1,72 dan 2,22 gacha yaxshilaydi. AgentEnv esa KVCache.ai yordamida ishlab chiqilgan agentlar uchun sandbox tizimidir, u katta miqyosdagi agentlarni o'qitish muhitlari uchun tezkor skrinshot olish, tiklash va fork qilish funksiyalarini qo'llab-quvvatlaydi. Bu infratuzilma chiqarilishlari K3 sinfidagi modellarni takrorlash va yanada rivojlantirish uchun to'siqni pasaytiradi.
Ochiq kodli chiqarish ekotizim uchun sezilarli oqibatlarga ega. K3 GPT-5.6 va Claude Fable 5 kabi yopiq ilg'or modellarga nisbatan bir qator maxsus testlarda, ayniqsa frontend uchun kod yaratishda teng keladi yoki ulardan ustun turadi. Shu bilan birga, K3 ni API orqali ishlatish narxi Claude ga qaraganda 40%, Fable ga qaraganda esa 70% pastroqdir. Ochiq vaznli litsenziya mahalliy joylashtirishni va API ga bog'liq bo'lmasdan o'z ilovalaringizni ishlab chiqish imkonini beradi. Biroq, 2,8 trillion parametrli miqyos tufayli, hatto mahalliy joriy etish ham sezilarli jihozlarni talab qiladi - faqat modelni yuklash uchun kamida 10 GB300 sinfining GPUsi kerak, bu inferensiya infratuzilmasi xarajatlarini API to'lovidan ko'ra joylashtirishdagi asosiy omilga aylantiradi.
Bu chiqarish ekotizimda zanjir reaksiyasiga sabab bo'ldi. Alibaba Cloud ning Qianwen AI platformasi K3 mavjudligini e'lon qildi. Huawei K3 uchun Ascend 0-day moslashtirishni e'lon qildi, bu milliy uskuna ustida 3 trillion darajali modelni ishga tushirishning birinchi holati bo'ldi. Ochiq kodli hamjamiyat model vaznlariga kirishdi, ular avval nusxa ko'chirish uchun yuzlab million investitsiyalarni talab qilardi. Moonshot AI ochiq kodli tashabbusining ochiq vaznli modellar ekotizimini rivojlantirish, AI uchun ishlab chiqish va joylashtirish to'siqlarini kengroq jamiyat uchun pasaytirishga qaratilganini bildirdi. Biroq, bundan qisqa muddatdan so'ng, K3 2,8 trillion parametrli modelni miqyosda xizmat ko'rsatishdagi hisoblash quvvati cheklovlari tufayli yangi foydalanuvchi obunalarini to'xtatganligi e'lon qilindi, bu ochiq kodli ideal va 2,8 trillion parametrli modelni miqyosda xizmat ko'rsatish realiyati o'rtasidagi ziddiyatni ta'kidladi.
Moonshot AI tomonidan ishlab chiqilgan Kimi K3 modeli sezilarli texnik taraqqiyotni namoyish etdi va jahon sun'iy tahlil reytingida uchinchi o'ringa kirgan, ammo uning DeepSeek kabi yutuqga erishish yo'li narxlash, hisoblash quvvati cheklovlari va ekotizim yetukligi masalalari bilan murakkablashmoqda.
Kimi K3 kodlash bo'yicha jahon benchmarklarida bosh joyni egalladi va umumiy hisobda uchinchi o'rinda turibdi, faqatgina Fable 5 va GPT-5.6 dan orqada qolgan. Model ilgari xitoydagi katta modellar erishmagan darajaga yetib, sun'iy tahlil reytingida uchinchi o'ringa kirib, hatto Arena 2026 front-end kodlash benchmarkida Fable 5 dan ham oldinda turdi. Elon Musk bu natijani taassurotli deb atagan, jahon OAV esa buni «DeepSeekning ikkinchi shokki» deb nomlagan.
Artificial Analysis platformasida K3 modeli dunyoning uchinchi o'rnida joylashgan. U 896 ta ekspertli Mixture-of-Experts arxitekturasi asosida qurilgan, 2,8 trillion parametrga ega, 1 million token nativ kontekst uzunligini qo'llab-quvvatlaydi va KDA diqqat mexanizmini ishlatadi. Model kodlash, agentlar ishi va uzun kontekstli fikrlash bilan bog'liq vazifalarda yuqori samaradorlikni ko'rsatadi, bu esa bevosita tijoriy qo'llanilishga ega. Biroq, yopiq manbali yetakchi modellar bilan solishtirganda, K3 hali ham murakkab fikrlash va multimodal vazifalarda o'lchovli kamchiliklarni namoyish etadi.
Muhim to'siq narxlashdir: K3 bir million token uchun DeepSeek dan 3–15 marta qimmatroq. Bu xitoy AI'ining premium narxlarni belgilash qobiliyatini tasdiqlasa-da, bu DeepSeek ultra past narxli kirish va massiv joriy etish orqali ta'minlagan virusli ekotizim o'sishini cheklaydi.
Eng hal qiluvchi cho'qqi hisoblash cheklovlaridir. K3 ajoyib samarali resurslardan foydalanish bilan o'qitilgan bo'lsa-da, chiqarilgandan so'ng Kimi juda katta inferens talabi tufayli yangi iste'molchi obunalarini to'xtatishga majbur bo'ldi. K3 ning bitta so'rovi past aniqlikdagi kvantizatsiya kiritilgan bo'lsa ham, taxminan 1,4 TB xotira talab qiladi. Moonshot AI hisoblash quvvatlarini oshirish ustida faol ishlamoqda, ammo ehtiyoj va mavjud infratuzilma o'rtasidagi farq K3 ni bozorda barqaror ta'sir qilishdan ajratib turuvchi asosiy omil bo'lib qolmoqda. Ushbu cheklovlar korporativ mijozlar inferens uchun kafolatlangan tranzit quvvatini talab qilishlari sababli tijoriy joylashtirishga ham to'sqinlik qilmoqda, buningni Moonshot AI hozircha miqyosda ta'minlay olmaydi.
DeepSeekning yutuqining asosiy farqi nafaqat model sifatida, balki o'zini o'zi ushlab turadigan siklni yaratishda ham edi: foydalanuvchilar tomonidan keng qabul qilinishi ishlab chiquvchilar ekotizimining o'sishini rag'batlantirdi, bu esa model imkoniyatlarini yaxshiladi va yanada qabul qilinishni oshiradi. Kimi K3 texnik shart-sharoitlarga erishdi, ammo hali bu «ekotizim g'ildiragini» ishga tushirmadi. Yaqin kunlar Moonshot AI hisoblash to'siqlarini yengib o'tish, texnik hayratni barqaror tijorat munosabatlariga aylantirish va ajoyib modelni to'liq platformaga aylantiradigan ishlab chiquvchilar ekotizimini yaratish qobiliyatiga bog'liq bo'ladi. Muhandislik imkoniyatlari isbotlangan, ammo biznes modeli va infratuzilma strategiyasi hali ham ishlab chiqilayotgan bosqichda.