O'tgan yil ichida kodlash va agent imkoniyatlarining rivojlanishi modellarning reytinglarini sezilarli darajada o'zgartirdi. Agentlar yanada uzoq vazifa zanjirlarini bajarayotgani sababli, tobora ko'proq universal modellar nativ multimodallik imkoniyatlariga mos kelmoqda.
36Kr hisobotiga ko'ra, farq kuzatilmoqda: Moonshot AI Kimi K3, Alibaba Qwen3.8-Max va ByteDance Doubao-Seed-2.1 nativ multimodal o'qitishni tanladi. Aksincha, DeepSeek, Zhipu va Tencent Hunyuan o'zining eng so'nggi universal bazalarida matn formatini saqlab qolmoqda.
Lian Wenfeng shuni ta'kidladi,ki, sun'iy intellektni sifatli o'qitish uchun global model yoki multimodallik mavjud bo'lishi shart emas, ammo u yakunda multimodallik zarur ekanligini tan oladi. Kompaniyalar bu yondashuvning uzoq muddatli qiymati bilan rozi, ammo muddatlar va xarajatlar bo'yicha fikrlari farq qiladi. Kodlashning tezkor takomillashtirish bosqichida vizualni sinxron o'qitish va model, ma'lumotlar hamda hisoblash quvvatiga sarmoya kiritish hajmini tanlash yetakchi xitoy modellarining texnologik yo'lini belgilaydi.
Nativ multimodallik nima uchun muhimligi agentlarning qanchalik uzoq fikrlashi mumkinligida yotadi. Uzun ketma-ketlikdagi vazifalarni bajarishda, agar qayta aloqa faqat kod darajasida kelsa, xatolar to'planib, juda yomon yakuniy natijalarga olib kelishi mumkin. Ko'rish ancha aniqroq qayta aloqa signalini beradi.
Agentlar veb-sahifalar yaratganda, dasturiy ta'minotni boshqarganda va natijalarni tekshirganda, ko'rish foydalanuvchi tomonidan taqdim etiladigan oddiy kirish parametridan, modelning o'zini tekshirishi va harakatlarini tuzatishi uchun ishlatadigan qayta aloqa mexanizmining o'ziga aylanadi. Kimi K3 chiqarilgandan so'ng, Arena Frontend Code reytingida birinchi o'ringa chiqdi va 1679 ball oldi. Ushbu reyting nafaqat kodning ishlash qobiliyatini, balki sahifaning to'g'ri ko'rinishini ham baholaydi.
Puter brauzer platformasida test sahifalariga beshta vizual chetlanish kiritildi; Kimi K3 maqsadli sahifani ishlayotgan sahifaning skrinshoti bilan solishtirdi va hech qanday noto'g'ri signal bermasdan barchasini topdi. Moonshot AI ushbu usulni «tsikldagi ko'rish» deb ataydi: model kod yozadi, sahifani ko'rib chiqadi va keyin vizual ma'lumotlar asosida tuzatishni davom ettiradi.
Tashqi vizual vositalar tarafdorlari tizimlarning agentlik freymvorki yoki MCP orqali OCR yoki mustaqil VLM chaqirishi mumkinligini, tasvirlarni matnga yoki koordinatalarga aylantirib, matn modeliga uzatishini da'vo qilishadi. Biroq, bu modulli yondashuv cheklovlarga ega. Agar vosita chaqirilsa, ikkita model qoladi: ko'rmaydigan LLM va ko'ra oladigan yordamchi model.
Ichki nativ multimodal modellar vizual kirish va til yadrosi o'rtasida tasvirni avval matnga siqib, keyin boshqa modelga uzatish o'rniga, kengroq bog'lanish kanaliga ega. Bu farq o'qitilgandan keyin ham namoyon bo'ladi. Agar model buni mustaqil qila olsa, natija yaxshiroq bo'ladi. Ekranni bir necha marta ko'rishni talab qiladigan uzun zanjirli vazifalarda bu farq yanada aniqroq bo'ladi. Nativ multimodalliksiz modelning ko'zlari yo'q va qayta aloqa matn bilan cheklangan. Ko'plab foydalanuvchi natijalari vizualdir: veb-sahifalar, rasmlar, videolar. Model bu natijalarni tushunishi va o'ziga qayta aloqa berishi kerak.