DeepCybo ने PhysBrain 1.5 जारी किया - 28 बेंचमार्क पर 72.5 स्कोर वाली एक ओपन फिजिकल बेस मॉडल के साथ
और पढ़ें
Pandaily
pandaily.com

DeepCybo ने PhysBrain 1.5 जारी किया - 28 बेंचमार्क पर 72.5 स्कोर वाली एक ओपन फिजिकल बेस मॉडल के साथ

DeepCybo कंपनी ने PhysBrain 1.5 प्रस्तुत किया है, जो एक भौतिक आधार मॉडल है जो एक एकीकृत ऑटोरेग्रेसिव कोर में एम्बोडीड वर्ल्ड की समझ, एक्शन जनरेशन और भविष्य की स्थितियों की भविष्यवाणी को जोड़ता है। यह मॉडल Qwen3-VL पर आधारित है और इसे एक्शन और विज़ुअल स्टेट टोकन के साथ विस्तारित किया गया है।

विशेष रूप से, 8-बिलियन पैरामीटर का मॉडल एम्बोडीड वर्ल्ड से संबंधित 28 सार्वजनिक बेंचमार्क पर 72.5 का समग्र स्कोर प्रदर्शित करता है। इसे ओपन-सोर्स मॉडलों के बीच पहला परिणाम बताया गया है और प्रकाशित प्रोजेक्ट तालिका के अनुसार, यह GPT-6 Astra (73.3) और Gemini 3.6 Flash (73.0) जैसी प्रमुख मालिकाना प्रणालियों से लगभग एक अंक दूर है।

DeepCybo की रिपोर्ट के अनुसार, PhysBrain 1.5-8B संस्करण 28 बेंचमार्क में से 14 में पहले स्थान पर और ओपन-सोर्स मॉडलों में से 10 में दूसरे स्थान पर है। ये कार्य दृश्य-स्थानिक धारणा, मल्टी-व्यू रीजनिंग, एम्बोडीड वर्ल्ड प्लानिंग, क्षमता एन्कोडिंग और विज़ुअल ट्रेस कार्यों को कवर करते हैं।

हल्का संस्करण, PhysBrain 1.5-2B, ने समान परीक्षण सेट पर 66.6 का परिणाम दिखाया, जो रैंकिंग में मुख्य दावेदार होने के बजाय एक संगत तैनाती उपकरण के रूप में कार्य करता है। दोनों संस्करणों के वज़न, तकनीकी रिपोर्ट और मूल्यांकन सेट DeepCybo / PhysBrain 1.5 परियोजना के तहत Hugging Face और GitHub प्लेटफॉर्म पर उपलब्ध हैं।

प्रशिक्षण प्रक्रिया एक बंद भौतिक चक्र के माध्यम से लागू की गई है: अवलोकन, तर्क और एन्कोडिंग, कार्रवाई करना, और फिर दुनिया में परिवर्तनों की भविष्यवाणी करना। भाषा प्रतिक्रियाएं, स्थानिक संरचनाएं, एक्शनपीस टोकन के माध्यम से एंड-इफेक्टर के पथ, और भविष्य के RGB, डेप्थ और रोबोट मास्क के सुसंगत फ्रेम एक सामान्य लक्ष्य का उपयोग करते हैं - अगला टोकन, बिना अलग-अलग टास्क हेड्स का उपयोग किए।

प्री-ट्रेनिंग मानव इंटरैक्शन वीडियो रिकॉर्डिंग (ईगोसेंट्रिक, ईगो-एक्सोसेंट्रिक और पैनोरमिक मोड में) पर आधारित थी। अतिरिक्त फाइन-ट्यूनिंग DeepCybo के ह्यूमन-एज-ह्यूमनॉइड एक्शन ब्रिज का उपयोग करके मानव प्रदर्शन, वास्तविक रोबोट ट्रेजेक्टरी और सिमुलेशन के मिश्रण द्वारा की गई थी।

Intern W0, Motus2 या Cog-WM जैसी अन्य चीनी ओपन लाइनों की तुलना में, PhysBrain 1.5 कई बेंचमार्क पर घोषित नेतृत्व के साथ एक आधार मॉडल का रिलीज है, न कि केवल एक रोबोट के लिए नीति का प्रदर्शन। इस मॉडल का उपयोग करने वाली टीमों को मूल्यांकन पैकेज को पुन: चलाने, अपने स्वयं के मैनिपुलेटर पर एक्शनपीस ट्रांसमिशन का अध्ययन करने और 72.5 के एकत्रित स्कोर को तुलना के शुरुआती बिंदु के रूप में मानने की सलाह दी जाती है, न कि मालिकाना प्रणालियों के करीब होने को तत्काल प्रयोज्यता की क्षमता के बराबर मानने की।

समान कहानियाँ

Tencent ने DeepSeek Harness के लिए आधिकारिक प्लगइन के साथ WeKnora लॉन्च किया
और पढ़ें
pandaily.com

Tencent ने DeepSeek Harness के लिए आधिकारिक प्लगइन के साथ WeKnora लॉन्च किया

Tencent WeChat टीम ने WeKnora को सार्वजनिक रूप से उपलब्ध कराया है - एक कॉर्पोरेट ज्ञान प्लेटफॉर्म जो दस्तावेजों को RAG खोज स्टैक, ReAct शैली के एजेंट रनटाइम और स्व-सहायक विकी में बदलता है।

GitHub पर Tencent/WeKnora रिपॉजिटरी को 25,000 से अधिक स्टार मिले हैं, जो इस परियोजना को डेवलपर्स के लिए चीनी मूल के एजेंट ज्ञानकोशों में से एक सबसे प्रमुख बनाता है। इन डेवलपर्स को एक ऐसी प्रणाली की आवश्यकता है जो केवल चैट इंटरफ़ेस के बजाय एक ही समाधान के भीतर जानकारी निकालने, उपकरणों का उपयोग करने और दीर्घकालिक स्मृति प्रदान करे।

WeKnora के नवीनतम संस्करण क्लासिक RAG से काफी बेहतर हैं। संस्करण 0.8.0 की सामग्री Docker, E2B और Cube के बैकएंड के साथ कौशल सैंडबॉक्स, किरायेदारों के लिए कौशल कैटलॉग, प्रोफाइल, प्राथमिकताओं, तथ्यों, कार्यों और रुचियों को कवर करने वाली दीर्घकालिक क्रॉस-सेशन मेमोरी, नॉलेज ग्राफ समर्थन, MCP-उन्मुख उपकरण और विकी शैली में दस्तावेज़ प्रबंधन का वर्णन करती है। यह सिस्टम एजेंटों को कॉर्पोरेट कॉर्पोरा में खोजने, नेटवर्क नीति के अनुसार कौशल को कॉल करने और सत्रों के बीच स्थायी स्मृति बनाए रखने के लिए डिज़ाइन किया गया है, जो इसे एक बार के प्रश्न उत्तर देने वाले बॉट की तुलना में एजेंट के परिचालन स्तर के करीब लाता है।

आधिकारिक दस्तावेज़ीकरण WeChat Dialog Open Platform के माध्यम से आधिकारिक खातों और मिनी-प्रोग्राम के लिए प्लेटफॉर्म के मार्गों को भी इंगित करता है, यदि टीमों को मैसेजिंग सतहों पर समान ज्ञानकोश का उपयोग करने की आवश्यकता है।

एकीकरण तंत्र, जो कोडिंग एजेंटों के लिए महत्वपूर्ण है, वह आधिकारिक DeepSeek Harness प्लगइन है, जिसे @wxg-prc-cpg/dsh-weknora के रूप में प्रकाशित किया गया है। स्वयं DeepSeek Harness वर्कस्पेस खोज और वेब खोज प्रदान करता है, लेकिन इसमें एम्बेडिंग या ज्ञानकोश के लिए कोई अंतर्निहित मार्ग नहीं है; यह प्लगइन चार रीड-ओनली टूल - ज्ञानकोशों की सूची, हाइब्रिड खोज, पृष्ठ-दर-पृष्ठ स्क्रॉलिंग के साथ पूर्ण दस्तावेज़ पढ़ना और उद्धरण के साथ WeKnora द्वारा तैयार किए गए उत्तर - को एक तैनात WeKnora इंस्टेंस के विरुद्ध पंजीकृत करके इस अंतर को भरता है।

स्थापना dsh plugin --profile web add @wxg-prc-cpg/dsh-weknora कमांड द्वारा प्रलेखित है, जिसकी जाँच dsh 0.1.0-rc.8 और WeKnora 0.7.2 पर की गई थी, जिसमें क्रेडेंशियल्स एपीआई कुंजी के माध्यम से पारित होते हैं, और कॉर्पोरा में कोई लेखन पथ नहीं होता है।

उन टीमों के लिए जो पहले से ही एजेंट वर्कफ़्लो के लिए DeepSeek Harness का मूल्यांकन कर रही हैं, WeKnora कॉर्पोरेट सूचना निष्कर्षण का लापता हिस्सा प्रस्तुत करता है: दस्तावेज़ WeKnora में संग्रहीत होते हैं, और harness एजेंट उन्हें उपकरणों के रूप में कॉल करता है, इंडेक्सिंग और चंक प्रबंधन को WeKnora की ओर छोड़ देता है। यह ध्यान इस कहानी को DeepSeek Harness की साधारण सुविधा घोषणाओं से अलग करता है। हालांकि, ऑपरेटरों को उत्पादन के लिए इस संयोजन को तैयार मानने से पहले अपने स्वयं के कॉर्पोरा पर सैंडबॉक्स अलगाव, एपीआई कुंजी हैंडलिंग और उद्धरण की गुणवत्ता की स्वयं जांच करनी चाहिए।

OpenBMB ने डिवाइस पर चलने के लिए 4 बिलियन पैरामीटर से कम वजन का SOTA ओपन मॉडल MiniCPM5-2B जारी किया
और पढ़ें
pandaily.com

OpenBMB ने डिवाइस पर चलने के लिए 4 बिलियन पैरामीटर से कम वजन का SOTA ओपन मॉडल MiniCPM5-2B जारी किया

ओपनBMB, मॉडलबेस्ट से जुड़ा एक ओपन प्रोजेक्ट, ने सीधे डिवाइस पर चलने के लिए एक सघन भाषा मॉडल MiniCPM5-2B प्रस्तुत किया है। इस मॉडल में लगभग 2.52 बिलियन पैरामीटर हैं और यह Apache-2.0 लाइसेंस के तहत 131,072 टोकन की नेटिव कॉन्टेक्स्ट लंबाई का समर्थन करता है।

MiniCPM5-2B मिनीCPM5 श्रृंखला का दूसरा रिलीज़ है, जो MiniCPM5-1B के बाद आया है। यह LlamaForCausalLM की मानक संरचना का उपयोग करता है, जिसमें 42 परतें और ग्रुपेड-क्वेरी अटेंशन (grouped-query attention) शामिल है, जो 16 क्वेरी हेड्स और 2 की/वैल्यू हेड्स का उपयोग करता है। इसके कारण, मुख्य इंजन बिना कस्टम कर्नेल या मॉडल कोड फोर्क की आवश्यकता के मॉडल को लोड कर सकते हैं।

एम्बेडिंग के अलावा पैरामीटर लगभग 1.98 बिलियन हैं, जो मॉडल को 4 बिलियन पैरामीटर से कम वर्ग में रखने की अनुमति देता है, जो फोन, लैपटॉप और पेरिफेरल उपकरणों पर होस्टिंग के लिए उपयुक्त है।

34-बेंचमार्क डेटासेट पर तुलना करने पर, MiniCPM5-2B औसतन 53.9 स्कोर प्रदर्शित करता है, जो कई बड़े ओपन बेस मॉडलों से आगे निकल जाता है। इनमें Qwen3.5-4B ने 51.1 और granite-4.2-3B ने 42.7 स्कोर किया। वहीं, समान आकार के मॉडल जैसे LFM2.5-2.6B और Qwen3.5-2B पीछे रह जाते हैं।

मॉडल की ताकत कोडिंग एजेंटों, टूल उपयोग और लंबे संदर्भ से जानकारी निकालने के क्षेत्रों पर केंद्रित है। उदाहरण के लिए, LiveCodeBench v6 पर MiniCPM5-2B ने Qwen3.5-4B के 56.4 की तुलना में 69.1 स्कोर किया, और SWE-bench Verified पर 46.4 बनाम 33.6 स्कोर किया। उच्च परिणाम τ²-Bench Telecom (97.1), BFCL v4 (66.6) और NoLiMa (43.5 की तुलना में 68.1) पर भी प्राप्त किए गए।

गहन ज्ञान की आवश्यकता वाले कार्यों में, प्रदर्शन आकार की ऊपरी सीमा के करीब रहता है; उदाहरण के लिए, MMLU-Pro पर मॉडल ने 70.8 दिखाया, जबकि 4B आकार का बेंचमार्क मॉडल Qwen ने 78.0 हासिल किया। ओपनBMB विशेष रूप से आर्टिफिशियल एनालिसिस स्रोतों से प्राप्त पंक्तियों को चिह्नित करता है ताकि उपयोगकर्ता विक्रेता और तृतीय-पक्ष परिणामों के बीच अंतर कर सकें।

पोस्ट-ट्रेनिंग प्रक्रिया अल्ट्राडेटा स्तर के प्रबंधन का पालन करती थी: पहले लगभग 400 बिलियन टोकन का उपयोग करके गहन सोच के आधार पर सुपरवाइज्ड फाइन-ट्यूनिंग (supervised fine-tuning) की गई। फिर गणित, कोड, एजेंट और लेखन के लिए जस्टRL II एल्गोरिथम पर आधारित विशेष रीइन्फोर्समेंट-लर्निंग टीचर्स (reinforcement-learning teachers) लागू किए गए। अंतिम चरण ऑन-पॉलिसी डिस्टिलेशन (on-policy distillation) था, जिसने 16 RL विशेषज्ञों—जिनमें से पांच एजेंट थे—को एक अंतिम छात्र मॉडल में मिला दिया।

ओपनBMB तर्क और सामान्य सेटों में लगभग 10.96 अंकों की वृद्धि और एजेंट सेटों में 6.96 अंकों की वृद्धि को RL और डिस्टिलेशन चरण से जोड़ता है। प्रत्येक भाग के योगदान को सीधे मापने की क्षमता के लिए, कंपनी मध्यवर्ती नियंत्रण बिंदु जारी करती है: बेस, मिडट्रेन और SFT-केवल।

वजन के साथ, अल्ट्राडेटा कॉर्पोरेशन वेब, कोड, गणित, SFT और एजेंटों के लिए RL नमूनों को कवर करने वाले डेटासेट प्रकाशित करते हैं, जिससे परिणामों को पुन: उत्पन्न करना संभव हो जाता है। रनटाइम समर्थन में vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX, LiteRT और मल्टी-चिप FlagOS बिल्ड शामिल हैं। स्थानीय सहायकों के लिए GGUF, MLX और GPTQ पैकेज प्रदान किए जाते हैं, जिन्हें डेटा सेंटर जीपीयू का उपयोग किए बिना टूल कॉल करने और लंबे संदर्भ के साथ काम करने की आवश्यकता होती है।

डिवाइस पर काम करने पर ध्यान केंद्रित करने वाले डेवलपर्स के लिए, MiniCPM5-2B को सामान्य ज्ञान के विशालकाय के रूप में नहीं, बल्कि Apache लाइसेंस वाला एक कॉम्पैक्ट एजेंट और कोडिंग साथी के रूप में स्थापित किया गया है, जो प्रकाशित औसत स्कोर के आधार पर कुछ 4B क्लास के ओपन बेस मॉडलों से बेहतर प्रदर्शन करता है।

UniPat ने AI के परीक्षण और बेंचमार्किंग के विस्तार के लिए अलीबाबा के समर्थन से 300 मिलियन डॉलर जुटाए
और पढ़ें
ventureburn.com

UniPat ने AI के परीक्षण और बेंचमार्किंग के विस्तार के लिए अलीबाबा के समर्थन से 300 मिलियन डॉलर जुटाए

जैसे-जैसे आर्टिफिशियल इंटेलिजेंस विकसित हो रहा है, परीक्षण की समस्या उत्पन्न हुई है। जबकि कई लोग निवेशकों को आकर्षित करने के लिए प्रभावशाली बड़े भाषा मॉडल बनाने पर ध्यान केंद्रित कर रहे हैं, सीखने के बाद इन जटिल प्रणालियों की कार्यक्षमता की जांच के लिए केवल कुछ ही सत्यापित प्लेटफॉर्म मौजूद हैं।

AI मॉडल भ्रम (hallucinations) के प्रति संवेदनशील होते हैं और समय के साथ सामान्य से भटक सकते हैं। इस महत्वपूर्ण परिचालन समस्या को हल करने के लिए, जो बड़े कॉर्पोरेट उपयोगकर्ताओं को लगातार दूर रखती है, UniPat ने 300 मिलियन डॉलर जुटाए हैं। UniPat पूर्ण स्तर का विश्वास सुनिश्चित करने के लिए इन जटिल प्रणालियों का सक्रिय रूप से तनाव परीक्षण कर रहा है।

UniPat अन्य AI कंपनियों से अलग है; वे केवल महंगी तकनीकी सम्मेलनों में प्रदर्शन के लिए नए एल्गोरिदम नहीं बना रहे हैं। इसके बजाय, यह स्टार्टअप कठोर प्रयोगशाला स्थितियों के बजाय वास्तविक परिदृश्यों के आधार पर मॉडलों का लक्षित परीक्षण करता है।

इसकी तुलना आर्टिफिशियल इंटेलिजेंस के लिए एक कठोर प्रशिक्षण शिविर से की जा सकती है। इससे पहले कि कोई मॉडल वास्तविक उपभोक्ता डेटा तक पहुंच प्राप्त करे या स्वचालित वित्तीय लेनदेन शुरू करे, UniPat उसे गहन परीक्षणों से गुजारता है। यह सिस्टम के प्रदर्शन पर उच्च गुणवत्ता वाला डेटा उत्पन्न करने की अनुमति देता है, जिसकी डेवलपर्स को महत्वपूर्ण कमियों को दूर करने के लिए आवश्यकता होती है, क्योंकि जो चीज पहले सावधानीपूर्वक तोड़ी नहीं गई है, उसे ठीक करना असंभव है।

तकनीकी दिग्गज अलीबाबा ने इस बड़े फंडिंग राउंड का नेतृत्व किया है, जिससे उद्योग में हलचल मच गई है। इस दौर के वित्तीय विवरण काफी प्रभावशाली हैं: निवेश के बाद नई पूंजी प्रवाह ने स्टार्टअप का मूल्यांकन प्रभावशाली 2.5 बिलियन डॉलर तक बढ़ा दिया है। यह भी दिलचस्प है कि इस विशेष केंद्र का नेतृत्व एक पूर्व कर्मचारी कर रहा है।

यह स्पष्ट है कि अलीबाबा अपने उच्च श्रेणी के कर्मचारियों को बनाए रखने में रुचि रखती है। व्यापक वेंचर कैपिटल बाजार की सतर्कता के बावजूद महत्वपूर्ण धन आ रहा है। इसके अलावा, यह विशिष्ट सौदा पंजीकृत देर-चरण वेंचर कैपिटल राउंड्स के शीर्ष तीन प्रतिशत में आता है।

परीक्षण प्लेटफॉर्म की उच्च लागत बुनियादी कॉर्पोरेट अर्थशास्त्र और प्रतिस्पर्धी अस्तित्व की आवश्यकता के कारण है। सक्रिय शुरुआती निवेशकों में Sequoia China के प्रतिनिधि भी शामिल थे। यह दर्शाता है कि प्रमुख वित्तीय खिलाड़ी वर्तमान AI दौड़ में बुनियादी ढांचे से संबंधित उद्यमों की तलाश कर रहे हैं। हम स्मार्ट चैटबॉट की साधारण प्रशंसा के चरण से आगे निकल गए हैं।

अब बड़ी अंतरराष्ट्रीय निगम त्रुटिहीन विश्लेषण की मांग करते हैं। उन्हें ठोस प्रमाण की आवश्यकता है कि लाखों डॉलर के AI कार्यान्वयन से सार्वजनिक शर्मिंदगी नहीं होगी। UniPat ऐसी आवश्यक बीमा पॉलिसी प्रदान करता है। यह सिर्फ एक और नियमित तकनीकी निवेश नहीं है। यह एक सोची-समझी चाल है। चूंकि विश्व शक्तियां कृत्रिम बुद्धिमत्ता के क्षेत्र में प्रभुत्व के लिए जी-जान से प्रतिस्पर्धा कर रही हैं, इसलिए इन उपकरणों के मूल्यांकन के लिए बुनियादी ढांचा अनंत मूल्य का होता जा रहा है।

अलीबाबा का बड़ा दांव बाजार प्राथमिकताओं में एक स्पष्ट बदलाव का संकेत देता है। भविष्य न केवल उस व्यक्ति का है जो सबसे बड़ा मॉडल बना सकता है, बल्कि उस व्यक्ति का भी है जो यह साबित कर सकता है कि उसका मॉडल वास्तविक परिस्थितियों में सबसे सुरक्षित, तेज़ और विश्वसनीय है।

लोकप्रिय