Shanghai sunʼiy intellekt laboratoriyasi (Shanghai Artificial Intelligence Laboratory) jamoasi Shanghai Jiao Tong universiteti (Shanghai Jiao Tong University) ning LUMIA Labi bilan birgalikda taxminan 8,9 milliard parametrga ega latent fazali ochiq til modelini – NCP-ArchPreview ni chiqardi.
Bu model standart keyingi tokenni bashorat qilish va keyingi tushunchalarni bashorat qilish (Next Concept Prediction)ni bir vaqtning oʻzida oʻrganadi. Texnik hisobot arXiv da 2609.10715 raqamida, Hugging Face uchun nazorat nuqtalari esa ArchSpace-Collection toʻplamida mavjud. Shuningdek, InternLM vositalari va LUMIA baholash repozitoriyidan havolalar bilan baholash va inferens uchun kod yoʻllari ham eʼlon qilindi.
Bu loyiha hozirgacha eng katta miqyosdagi latent fazali til modeli namoyishidir, u uch trillionlik tokenlardan ortiq miqyosda oʻqitilgan.
Faqat keyingi tokenni bashorat qilish oʻrniga, NCP-ArchPreview bir nechta tokenlarni qamrab oluvchi diskret tushunchalarni bashorat qila oladi. Buning uchun modelning oʻzining yashirin holatlariga asoslangan samarali kvantlashtirilgan tushunchalar lugʻati yaratilgan. Maxsus Tushunchalar Moduli kelajakdagi tushunchalarni bashorat qiladi va bu bashoratlarning token darajasidagi generatsiyani yoʻnaltirish uchun ishlatiladi.
Kodlashchi, Tushunchalar Moduli va dekoder 4096 oʻlchamli yashirin qatlam va 16/8/16 nisbati bilan sababli Transformer arxitekturasidan foydalanadi. Tushunchalar har biri toʻrtta token holatini siqib chiqaradi, bunda samarali kvantlashtirish 128 kod soʻzi boʻlgan 32 lugʻatga qoʻllaniladi. Generatsiya NCPOlmo3ForCausalLM kabi arxitekturada odatiy keyingi tokenni bashorat qilish interfeysini saqlab qoladi, bu esa modelni oddiy avtoregressiv nazorat nuqtasi sifatida baholash va ishlatish imkonini beradi, shu bilan birga latent maqsad oldindan oʻqitish paytida bajariladi.
Oʻqitish uchun 1-bosqich va 2-bosqich oʻquv rejalar doirasida Dolma-3 oilasidan taxminan 5,73 trillion token ishlatilgan. Samaradorlikning asosiy dalili shundaki, NCP-ArchPreview faqat umumiy oʻquv tokenlari hajmining taxminan 51,3% dan foydalanib, OLMo-3-7B ga teng kelishuvsiz oldindan oʻquv yoʻqotilishiga erishadi.
Toʻliq oldindan oʻqitilgandan soʻng, model keyingi vazifalarda oʻrtacha makro koʻrsatkichi boʻyicha 7B asosiy modeldan 2,45 ball ustun turadi, jumladan GSM8K benchmarkida 5,99 ball oshishi mavjud. Nazoratli ablyatsiya tahlili shuni koʻrsatdiki, bu oshish latent arxitektura va keyingi tushuncha funksiyasining natijasidir. Taqqoslanadigan parametr hajmi bilan model 8,9B keyingi token asosiy modelining oʻquv yoʻqotilishiga yaqinlashadi, shu bilan birga standart hisoblash byudjetining taxminan 85% dan foydalanadi.
Oldindan oʻqitish tugaganidan keyin ham latent fazo foydalanishga yaroqli boʻlib qoladi. Taxminan 17 million parametrni oʻz ichiga olgan vektorlar kvantlash modulini yangilash mavzu sohasi uchun moslashish uchun yengil interfeysni taqdim etadi. Bundan tashqari, tushuncha ifodalarini DFlash2 drafterni joriy etish ushbu konfiguratsiyada sezilarli yuklama xarajatlari bilan oʻrtacha qabul qilingan uzunlikni taxminan 4,17% ga yaxshiladi. 1-bosqich va bir nechta 2-bosqichlarning asosiy nazorat nuqtalari yakunlash, baholash va yanada moslashtirish uchun mavjud. Oldindan oʻqitish samaradorligini kuzatuvchi tadqiqotchilar uchun NCP-ArchPreview shunchaki chat mahsuloti chiqarilishi emas, balki deyarli 9B miqyosdagi tushuncha va token darajasidagi maqsadlarni birlashtirish uchun ochiq retseptdir, u keng jamoatchilikka mavjud boʻlgan ogʻirliklar va kod bilan birga beriladi.

