Anthropic kompaniyasi o'zining yangi katta til modeli – Claude Opus 5 ni e'lon qildi. Bu model imkoniyatlarda sezilarli yaxshilanishlarni namoyish etadi va bir qator o'lchov ko'rsatkichlari bo'yicha Claude Fable 5 modelidan ustun turadi.
Anthropic kompaniyasi o'zining yangi katta til modeli – Claude Opus 5 ni e'lon qildi. Bu model imkoniyatlarda sezilarli yaxshilanishlarni namoyish etadi va bir qator o'lchov ko'rsatkichlari bo'yicha Claude Fable 5 modelidan ustun turadi.
Opus 5 kuchli tahliliy qobiliyatlarga ega va dasturiy koddagi zaifliklarni aniqlay olgan bo'lsa-da, funksional exploitlar yaratishda Anthropic Mythos 5 modeliga undan kamroq. Biroq, shu sababli Anthropic Opus 5 ni kengroq foydalanuvchi doirasi uchun mavjud qilishga muvaffaq bo'ldi.
Anthropic rasmiy veb-saytida e'lon qilingan press-relizga ko'ra, model allaqachon Claude Pro va Max xizmatlarining obunachilari hamda API orqali mavjud. Opus 5 murakkab ko'p bosqichli vazifalarni bajarishda sinovdan o'tgan barcha boshqa modellar ustunligini namoyish etdi; uning natijasi avvalgi Opus 4.8 versiyasiga qaraganda ikki barobar ortiq bo'ldi.
Kompyuter interfeysi bilan o'zaro aloqani baholaydigan OSWorld 2.0 benchmarkida Opus 5 Fable 5 modeli erishgan eng yaxshi natijani ortda qoldirdi. Ishlab chiquvchilar modelning yuqori darajadagi mustaqilligini ham ta'kidladilar. FrontierBench vazifasi doirasida, u mexanik qismning rasmini berilgan va uni FreeCAD dasturida qayta yaratishi so'ralgan, ammo rasmni ko'rishga ruxsat berilmagan edi, Opus 5 mustaqil ravishda kompyuter ko'rish tizimini ishlab chiqdi va qismning geometrik xususiyatlarini xom piksel ma'lumotlaridan ajratib oldi.
Bundan tashqari, Opus 5 biologiya va organik kimyo sohalarida yuqori natijalarni ko'rsatdi. Masalan, Organic Chemistry V2 testida u 61,6 foiz olib, 58,9 foiz ko'rsatgan Mythos 5 dan oldinda turdi.
Ayrı bir e'tibor Kertin universiteti tomonidan Mario Siervo boshchiligida Avstraliya, Buyuk Britaniya, Kanada va Tailand hamkasblari bilan o'tkazilgan kesma tadqiqotga qaratilishi kerak. Tadqiqotchilar talabalar haftasiga o'n soatdan ortiq video o'yinlar bilan shug'ullanadiganlar ko'proq ortiqcha vaznga ega ekanligi, shuningdek, ovqatlanish va uyqu sifati pastroq ekanligi haqida xulosa qilishdi.
Tadqiqotda Avstraliya oliy o'quv yurtlarining 317 nafar talabasi ishtirok etdi, ularning o'rtacha yoshi 20 yoshni tashkil etdi, bunda ishtirokchilarning 60,6 foizi ayollar edi. Barcha respondentlar jismoniy va demografik ma'lumotlar, sog'liq holati, o'yinlarga sarflangan vaqt, jismoniy faollik darajasi, stress, uyqu va parhez sifati haqidagi so'rovnomalarni to'ldirdilar. Ma'lumotlarning statistik tahlili jins, etnik kelib chiqishi, chekish, spirtli ichimlik iste'moli, dori-darmon qabul qilish, bandlik va boshqa o'zgaruvchilarni hisobga olgan holda ko'p sonli chiziqli regressiya usuli yordamida amalga oshirildi. Ushbu ish natijalari Nutrition jurnalida nashr etildi.
Anthropic 300 mingdan ortiq anonim suhbatlarni keng qamrovli tahlil qilgan va chatbot Claude javoblarining ohangini ishlatilayotgan tilga qarab o'zgartirishini aniqlagan. Ushbu tadqiqot modelning suhbatning turli nozik jihatlarini qabul qilishini namoyish etishini ko'rsatadi, bu esa tilga qarab yanada ehtiyotkor, to'g'ridan-to'g'ri, do'stona yoki batafsil bo'lishi mumkin.
Portugaliy tilida model ancha texnik va vazifani bajarishga yo'naltirilgan javoblar berishga moyillik ko'rsatadi. 15 mingdan ortiq o'zaro aloqalar asosida Anthropic tahlili Rigor (Qat'iylik), Execution (Ijro), Caution (Ehtiyotkorlik) va Depth (Chuqurlik) bilan bog'liq kichik ijobiy tendensiyalarni aniqladi. Kuzatilayotgan naqshlar orasida talab qilinmagan holda tafsilotlarni yaxshilash va tuzatish, qo'shimcha ma'lumotlar yoki yo'llarni taklif qilish hamda natijalarga ijodiy elementlar yoki qo'shimcha kontekstni kiritish kabi imkoniyatlar mavjud.
Tillar o'rtasidagi farqlarni o'lchash uchun tadqiqotchilar Claude xatti-harakatini to'rtta asosiy o'q bo'yicha tuzib chiqishdi. Deference yoki Caution (Ehtiyotkorlik) o'qi model foydalanuvchi g'oyalarini tasdiqlashga moyilmi yoki xavflar va chegaralar haqida ogohlantirish berib, ko'proq ehtiyotkor pozitsiyani egallashini baholaydi. Sympathy yoki Rigor (Rigor) o'qi ko'proq qabul qiluvchi javoblarni aniqlik, faktik to'g'rilik va shaffoflikni ustuvor qiladigan javoblar bilan solishtiradi. Depth yoki Conciseness (Qisqalik) o'qi chatbot keng tushuntirishlar berishni afzal ko'radi yoki qisqa va maqsadli javoblar berishni afzal ko'radiligini belgilaydi. Nihoyat, Frankness yoki Execution (Ijro) o'qi Claude o'z cheklovlarini tan oladimi yoki tayyor va ishonchli yechimni taqdim etishga e'tibor qaratadimi, diye kuzatadi.
Tadqiqot sifatni idrok etish keskin o'zgarishi mumkinligini ta'kidlaydi; masalan, bir biznes-reja bo'yicha fikr bildirishni so'ragan ikkita odam, biri hind tilida, ikkinchisi esa rus tilida, Claude har bir baholashda ifodalaydigan qiymatlar tufayli boshqacha taassurotlarga ega bo'lishi mumkin. Bundan tashqari, natijalar Opus 4.7 kabi turli model versiyalari o'rtasida farq qilishi mumkin, u boshqa iteratsiyalarga qaraganda yanada qat'iyroq va ehtiyotkorroq bo'ladi.
Boshqa tillar bilan taqqoslashda farqlar yanada aniqroq bo'ladi. Ingliz tili yanada ehtiyotkor va chuqurlikka yo'naltirilgan sifatida tasniflandi, noto'g'ri farazlarni inkor etish va ko'proq dalillar so'rash tendensiyasini namoyish etdi. Hind tili eng yuqori simpatiklikka moyillikni namoyish etdi, yanada yengil, rag'batlantiruvchi va hazilomuz javoblar berdi. Arab tili ko'proq ehtiyotkorlik va qisqalik bilan bog'landi, nutqni ko'proq ravon va suhbatdoshning hissiy holatiga moslashtirilgan til bilan ishlatdi. Rus tili o'zining qat'iyligi bilan ajralib turdi, yanada tahliliy va to'g'ridan-to'g'ri javoblar berdi. Holand tili ko'proq ochiqlikka moyillikni namoyish etdi, cheklovlarni ko'proq tez-tez tan oladi, shu jumladan indoneziya tilida vazifani yakunlashga ustuvorlik berish orqali ijroga ko'proq e'tibor qaratdi.
Anthropic hali bu o'zgarishlarning kelib chiqishi uchun aniq tushuntirishga ega emas. Ko'rsatilgan mumkin bo'lgan sabablardan biri ba'zi tillar uchun kichikroq yoki ma'lum turdagi matnlarda konsentratsiyalangan ma'lumotlar bazalarining mavjudligidir. Ko'rib chiqilayotgan yana bir omil madaniy moslashuvning ta'siri va bu tillarning o'ziga xos xususiyatlarining aksidir. Biroq, kompaniya tadqiqot bir xil til ichidagi mintaqaviy farqlarni, masalan, Braziliya yoki Portugaliya tilidagi portugal tilini ajratmasligini ta'kidlashni istaydi, bu mahalliy urf-odatlar aksidir. Kompaniya bu o'zgarishlarni kuzatib borishni rejalashtirmoqda, kelajakda qiymatlar profillari va muammoli xatti-harakatlar o'rtasidagi korrelyatsiyalarni aniqlash maqsadida. Avvalgi tadqiqotlarda Claude allaqachon jinoyat sxemalariga yordam berishga kamroq moyil ekanligi yoki foydalanuvchilarning shubhalik xatti-harakatlariga rozi bo'lmasligi ta'kidlanishi lozim.