NVIDIA bosh ijrochi direktori Jensen Huang ochiq sun'iy intellekt modellarini X'dagi birinchi postida 25 sanoat hamkorlari bilan qo'llab-quvvatlagan kuni Ant Group Bailing qismi Ling-3.0-flash modelini taqdim etdi. Ushbu model 124 milliard umumiy parametrga ega bajaruvchi model bo'lib, ammo faqat 5.1 milliard parametrni faollashtiradi, bu uning trilyon parametrlik flagman modeli kabi yuqori intellekt zichligini namoyish etadi.
Model sinov natijalari
Ling-3.0-flash 34 baholash sohasida yuqori natijalar ko'rsatib, 15 marta birinchi, 19 marta esa ikkinchi o'rinni egalladi. O'rtacha ball 67.6 ni tashkil etdi, bu uni DeepSeek V4 Flash ga tenglashtiradi. Shu bilan birga, model o'zining trilyonlik Ring-2.6-1T modelidan deyarli 8 ballga ustun keldi. Model 0.5 intellekt zichligi va 13.2 samaradorlik koeffitsientiga erishadi, bu solishtirma modellar orasida eng yuqori qiymatlar hisoblanadi va maqsadli bajaruvchi model dizayni aniq vazifalar bilan ishlayotganda umumiy miqyosdan ustun kelishi mumkinligini isbotlaydi.
Qo'llanilishi va ishlashi
Model ratsional fikrlash modellaridan farqli ravishda, bajaruvchi modellar paradigmasiga strategik sarmoya sifatida ishlab chiqilgan. Ling-3.0-flash real vaqt reja agentlari, kodlash va funksiya chaqiruvlari uchun tezlik va samaradorlikka e'tibor qaratadi. Masalan, kod omborlaridagi xatolarni tuzatish bo'yicha SWE-Bench Pro testida u 56.6% bilan birinchi o'rinni egalladi. Bir marta to'liq interaktiv komponentlarni yaratish uchun mo'ljallangan ArtifactsBench da u 77.0% natija ko'rsatdi, bu ikkinchi o'rinni 10 ballgacha ortda qoldirdi. Bitta ko'rsatma bo'yicha ilovani to'liq yaratishni talab qiladigan MiniAppBench da u 16 ta modelning o'rtacha ko'rsatkichi 17% ga qarshi 25.3% ga erishdi.
Imkoniyatlar va taqqoslashlar
BFCL-v4 funksiya chaqirish aniqligi 73.0% ga yetdi, bu birinchi o'rinda Claude-Sonnet-4.6 ga mos keladi. End-to-end GDPVal v2-AA agent baholashida model 1107 ball oldi, bu sinovdan o'tkazilgan modellarning eng yuqori qiymatidir. Model 256K hajmdagi kontekst oynalarini tabiiy tarzda qo'llab-quvvatlaydi, bunda MRCR_256K 81.1% ko'rsatdi. Ko'p bosqichli ko'rsatmalarni kuzatish Multi-IF 87.7% bilan ikkinchi o'rinda joy oldi. Uzoq muddatli ko'rsatma xotirasidagi LIFEBench testida u 77.3% natija bilan birinchi o'rinni egalladi. Agent qidiruvi WideSearch qobiliyati 73.6% bilan uchinchi o'rinda, ko'p agentli hamkorlik rejimidagi BrowseComp esa 82.0% bilan Claude-Sonnet-4.6 (82.1%) ga deyarli tenglashdi.
Chiqarishning strategik ahamiyati
Agentlarga yo'naltirilgan to'liq baholashlar to'plami Ling-3.0-flash ni avtonom vazifalarni bajarish paradigmasi uchun optimallashtirilgan deb belgilaydi, bu yerda modellar uzun fikrlash zanjirlarini yaratish o'rniga vositalardan foydalanadi, interfeyslar bo'ylab harakatlanadi va ko'p bosqichli maqsadlarni bajaradi. Ant Bailing modelni ochiq qildi va og'irliklar API bepul sinov muddati tugagandan so'ng, avgust oyida mavjud bo'ladi. Modeldan NVIDIA tomonidan qo'llab-quvvatlangan xat bilan bir vaqtda chiqarilishi, Xitoy AI kompaniyalari Silikon vodiysidagi xavflar haqidagi munozaralarga qaramay, ochiq kodni qabul qilishda davom etayotganini signal beradi. Ling-3.0-flash samaradorlikni ajralib turuvchi xususiyat sifatida ta'kidlaydi: umumiy parametrlar soni bo'yicha raqobatlashish o'rniga, model agent bajarish yuklari uchun yaxshi loyihalashtirilgan ixcham bajaruvchi model 8 baravar katta modellardan ustun kelishi mumkinligini ko'rsatadi. Bu inferensni joylashtirish iqtisodiyoti asosiy cheklovga aylanayotgani sababli, vazifaga xos modellar tomon yo'naltirilgan sanoat tendensiyalariga mos keladi. OpenRouterdagi haftalik reyting besh kun ichida 9-dan 6-ga ko'tarildi, shu bilan birga iyul oyi uchun trafik hajmi DeepSeek V4 Pro ning 0.5% dan kamroq bo'lgan, bu samarali bajaruvchi modellar bozor talabini tasdiqlaydi.



