Huawei va Xiaohongshu kompaniyalari tomonidan ishlab chiqilgan sun'iy intellekt modellari iyul oyida Xalqaro matematika olimpiadasidagi (IMO) barcha vazifalarni yechib, inson ishtirokchilaridan oldinda o'tishdi. Bu holat sun'iy intellekt texnologiyasi bunday tanlovlarda yuz foiz ball olishining birinchi qayd etilgan misolidir.
O'tkazilishi shartlari va natijalar
Sinov hech qanday inson aralashuvisiz o'tkazildi, va vazifalar AI modellariga faqat talabalar imtihonni yakunlagandan so'ng taqdim etildi. Huawei'ning Celia va Xiaohongshu'ning dots-node-3.0 modellarining IMO testini to'liq yechgani qayd etiladi. Shuni ta'kidlash kerakki, o'tgan yili Google va OpenAI ham ijobiy, ammo mukammal bo'lmagan natijalarni e'lon qilgan edi.
Sinovning murakkabligi
Xiaohongshu ma'lumotlariga ko'ra, yuz foizga erishish juda qiyin vazifa hisoblanadi. Bu insonlar orasidagi natijalar bilan tasdiqlanadi: Shanghaydagi 666 ishtirokchidan faqat yetti kishi barcha vazifalarni yechishga muvaffaq bo'lgan. Kompaniya o'z modelining IMO vazifalari bo'yicha sinovdan o'tgan birinchi marta ekanligini bildirgan.
Qo'shimcha testlar va avvalgi yutuqlar
Taipei Times ma'lumotlariga ko'ra, vazifalar haqiqiy talabalar tomonidan bajarilgandan so'nggina AI modellariga berilgan va yechim jarayonida hech qanday inson aralashuvi yo'q edi. Bundan tashqari, AQShdagi Menlo Ventures venture kompaniyasi o'z partneri yordamida Amerika AI'larining aniqlik foizini tekshirish uchun o'z sinovlarini o'tkazdi, chunki ular tanlovda rasman ishtirok etmagan. Ushbu testlarda OpenAI'ning GPT-5.6 Sol versiyasi, Anthropic'ning Claude Fable 5 va Axiom Math vositasi ham muvaffaqiyatli bajargan.
AI sinov tarixi
Hozirgi muvaffaqiyatga qaramay, AI modellarini avvalroq IMO da sinovdan o'tkazishgan. 2024 yilda Google'ning DeepMind modeli oltita vazifadan to'rttasini yechib, kumush medal olgan edi, garchi yechish jarayoni uch kun atrofida davom etgan bo'lsa ham. Va 2025 yilda shu model oltin uchun yetarli darajada yuqori ball olgan, ChatGPT kabi, lekin maksimal natijaga erishmagan. Shu bilan birga, o'tgan sinovlarda ishlatilgan aniq modellar oshkor qilinmadi.