Xitoy jamoasining Floatboat tizimi eng arzon modeldan foydalanib, beshta sinovda Claude Opus 4.8 dan ustun keldi
Batafsil
Pandaily
pandaily.com

Xitoy jamoasining Floatboat tizimi eng arzon modeldan foydalanib, beshta sinovda Claude Opus 4.8 dan ustun keldi

Floatboat agent ish stoli mahsulotini ishlab chiqqan Xitoy AOE Tech Labs jamoasi 7-avgustda beshta uchinchi tomon agent benchmarklari boʻyicha toʻliq Harness baholash maʼlumotlarini eʼlon qildi. Asosiy model sifatida bozordagi eng arzon ishonchli model boʻlgan DeepSeek-V4-Flash ishlatilgan. Model va xarajatni saqlab qolgan holda faqat Harness ijro etuvchisi oʻzgartirildi. Avval barcha beshta benchmarklarda oʻz DeepSeek Harnessida Claude Opus 4.8 dan past natijalar koʻrsatgan model, Floatboatning ichki Harnessida Opus 4.8 dan ustun kelishga muvaffaq boʻldi.

Bu natija narxlashni hisobga olgan holda yanada muhim ahamiyat kasb etadi. Opus 4.8 million kirish tokeni uchun 5 dollar va million chiqish tokeni uchun 25 dollar turadi. Agentlar ishlash ssenariylarida tez-tez uchraydigan 3:1 kiritish/chiqish nisbati bilan, Floatboatning birgalikdagi xarajatlari million token uchun atigi 0,175 dollar tashkil qiladi, Opus 4.8 esa 10 dollar turadi, bu esa 57,1 baravar farqni bildiradi. Ushbu beshta benchmark uchinchi tomonlardan, shu jumladan OpenAI tomonidan yaratilgan BrowseComp kabi, jamoatchilik reytinglaridir. Maʼlumotlar savollarni tanlash artefaktiga aylanishi yoʻq.

Tadqiqot metodologiyasi maksimal darajada qatʼiy amalga oshirildi. Nazorat guruhida oldindan tekshiruv nuqtasi emas, balki DeepSeek-V4-Flash-0731 rasmiy versiyasi ishlatildi. Nazorat guruhi provayderning oʻz Harnessida minimal rejimda ishlaydi, bu taqqoslashni yanada qattiq qiladi, chunki provayder muhandislari jarayonga ishtirok etishdi. Floatboat tomoni bir xil kiritish parametrlari bilan izolyatsiya qilingan fizik qumchanchalarda ishledi. Yagona oʻzgaruvchi Harness oʻzi edi.

Vazifalarni bajarilish gorizonti boʻyicha qisqa dan uzunga saralashda samaradorlik ortishi kamaymaydi: 1,9 foiz, 9,6 foiz, 12,6 foiz, 19,9 foiz va 23,6 foiz. Qisqa vazifalar aslida bitta soʻrov bilan savol-javob sessiyalari boʻlib, bunda model sifati hal qiluvchi rol oʻynaydi. Uzun gorizontli vazifalar, ular real ishlashni aks ettiradi, ijro tizimidan bogʻliq: fayllarga kirish, vositalarga murojaat qilish, holatni saqlash, koʻp bosqichli oʻz-oʻzini tuzatish va qaytarish. Haqiqiy ish uzun gorizont oxirida sodir boʻladi.

AOE Tech Labs taqqoslashni tekshirish mumkin boʻlishi uchun Harness Qoʻshimcha Koeffitsientini, yoki HLR ni kiritdi. Hisoblash formulasi — bu faqat Harness oʻzgarishi tufayli olingan ortiqcha miqdor, kuchliroq standart modelga yangilanish orqali olingan ortiqcha miqdorga boʻlinadi. HLR qiymati birlikdan katta boʻlsa, bu Harnessning oʻzi modelni yangilashdan ustun kelishini anglatadi. DeepSWE da Floatboat HLR ni 3,57 deb maʼlum qildi: modelni oʻzgarmas qoldirib, faqat Harnessni oʻzgartirish orqali Opus 4.8 ga yangilanishdan koʻra 3,57 baravar koʻproq jamoatchilik samaradorligi namoyon etildi. Barcha beshta benchmark boʻyicha HLR gorizont uzunligi 0,78 dan 3,57 gacha oshishi bilan monoton ravishda oshdi.

AOE Tech Labs 2025-yil oxirida HSG va VLight Capital investorlarining ishtiroki bilan boshlandi. Jamoa yanvar oyida Floatboat Desktop, aprelda FloatIM va mayda FloatSchedule ni chiqarishdi. Asosiy gʻoya shundaki, rivojlanayotgan maqsadli ijro tizimi va modelning suzib ketuvchi natijalari oʻrtasidagi tafovutni doimiy ravishda qisqartiradigan tizim kundalik foydalanish uchun agentlar kalitidir. Eng arzon model endi Harness uzun gorizont bilan ishlash uchun loyihalashtirilganida, eng qimmatbaho ilgʻor modelga mos kelish yoki undan ustun kelishga qodir.

Mashhur