चीनी टीम AOE Tech Labs ने, जिसने एजेंट डेस्कटॉप उत्पाद फ्लोटबोट विकसित किया है, 7 अगस्त को पांच तृतीय-पक्ष एजेंट बेंचमार्क पर हार्नेस मूल्यांकन के पूर्ण डेटा प्रकाशित किए। आधार मॉडल के रूप में DeepSeek-V4-Flash का उपयोग किया गया था, जो बाजार में सबसे सुलभ विश्वसनीय मॉडल है। मॉडल और लागत को बनाए रखते हुए, केवल निष्पादक हार्नेस बदलता था। वह मॉडल, जो पहले अपने स्वयं के DeepSeek हार्नेस में सभी पांच बेंचमार्क पर क्लॉड ओपस 4.8 से कम परिणाम दिखाता था, फ्लोटबोट के आंतरिक हार्नेस में ओपस 4.8 को मात देने में सक्षम था।
यह परिणाम मूल्य निर्धारण को देखते हुए और भी महत्वपूर्ण हो जाता है। ओपस 4.8 की कीमत प्रति मिलियन इनपुट टोकन के लिए 5 डॉलर और प्रति मिलियन आउटपुट के लिए 25 डॉलर है। एजेंट कार्य परिदृश्यों में आम 3:1 इनपुट से आउटपुट अनुपात पर, फ्लोटबोट की संयुक्त लागत केवल 0.175 डॉलर प्रति मिलियन टोकन है, जबकि ओपस 4.8 के लिए यह 10 डॉलर है, जो 57.1 गुना का अंतर दर्शाता है। ये पांच बेंचमार्क तीसरे पक्ष के सार्वजनिक लीडरबोर्ड हैं, जिसमें OpenAI द्वारा बनाया गया BrowseComp भी शामिल है। ये डेटा प्रश्नों के चयन का कलाकृति नहीं हैं।
अध्ययन की पद्धति को यथासंभव सख्ती से किया गया था। नियंत्रण समूह में प्रारंभिक चेकपॉइंट के बजाय DeepSeek-V4-Flash-0731 का आधिकारिक संस्करण उपयोग किया गया था। नियंत्रण समूह प्रदाता के अपने हार्नेस में न्यूनतम मोड में काम कर रहा था, जिससे तुलना अधिक कठोर हो जाती है क्योंकि प्रदाता के इंजीनियर प्रक्रिया में शामिल थे। फ्लोटबोट पक्ष समान इनपुट मापदंडों के साथ अलग भौतिक सैंडबॉक्स में काम कर रहा था। एकमात्र चर स्वयं हार्नेस था।
कार्य को निष्पादन क्षितिज के अनुसार छोटे से बड़े तक क्रमबद्ध करने पर, प्रदर्शन में वृद्धि कम नहीं होती है: 1.9 प्रतिशत, 9.6 प्रतिशत, 12.6 प्रतिशत, 19.9 प्रतिशत और 23.6 प्रतिशत। छोटी कार्य अनिवार्य रूप से एक अनुरोध के साथ प्रश्नोत्तर सत्र होते हैं, जहां मॉडल की गुणवत्ता निर्णायक भूमिका निभाती है। लंबी क्षितिज वाली कार्य, जो वास्तविक कार्य को दर्शाते हैं, निष्पादन प्रणाली पर निर्भर करती हैं: फ़ाइल एक्सेस, टूल कॉल, स्थिति सहेजना, बहु-चरणीय स्व-सुधार और रोलबैक। वास्तविक कार्य लंबी क्षितिज के अंत में होता है।
AOE Tech Labs ने तुलना को सत्यापन योग्य बनाने के लिए हार्नेस लीवरेज अनुपात, या HLR, पेश किया। गणना सूत्र - अधिक मजबूत संदर्भ मॉडल में अपग्रेड करने पर प्राप्त वृद्धि से विभाजित, केवल हार्नेस बदलने से प्राप्त वृद्धि है। HLR का मान एक से अधिक होने का मतलब है कि हार्नेस स्वयं मॉडल के उन्नयन से बेहतर है। DeepSWE पर फ्लोटबोट ने 3.57 का HLR बताया: मॉडल को अपरिवर्तित रखते हुए और केवल हार्नेस बदलकर, ओपस 4.8 में अपग्रेड करने की तुलना में 3.57 गुना अधिक सार्वजनिक प्रदर्शन प्राप्त किया गया। सभी पांच बेंचमार्क पर HLR क्षितिज की लंबाई बढ़ने के साथ 0.78 से 3.57 तक लगातार बढ़ा।
AOE Tech Labs की स्थापना 2025 के अंत में HSG और VLight Capital के निवेशकों की भागीदारी के साथ सीड फंडिंग राउंड में हुई थी। टीम ने जनवरी में फ्लोटबोट डेस्कटॉप, अप्रैल में फ्लोटआईएम और मई में फ्लोटशेड्यूल जारी किया। मुख्य विचार यह है कि एक ऐसी प्रणाली जो विकसित हो रही लक्ष्य निष्पादन प्रणाली और मॉडल के विचलनशील आउटपुट के बीच के अंतर को लगातार कम करती है, वह रोजमर्रा के उपयोग के एजेंटों की कुंजी है। सबसे सस्ती मॉडल अब सबसे महंगी अत्याधुनिक मॉडल के बराबर या उससे बेहतर होने में सक्षम है, जब हार्नेस को लंबे क्षितिज के साथ काम करने के लिए डिज़ाइन किया गया हो।
