ByteDance के शोधकर्ताओं ने चंक्स में KV-कैश संपीड़न में चरण संवेदनशीलता की समस्या का पता लगाया
और पढ़ें
Pandaily
pandaily.com

ByteDance के शोधकर्ताओं ने चंक्स में KV-कैश संपीड़न में चरण संवेदनशीलता की समस्या का पता लगाया

ByteDance Seed के शोधकर्ताओं ने एक वैज्ञानिक पेपर प्रकाशित किया है जिसमें उन्होंने निश्चित ब्लॉकों का उपयोग करके कुंजी-मूल्य कैश (KV-कैश) संपीड़न का उपयोग करने वाले भाषा मॉडल में एक आवधिक भेद्यता की पहचान की है। इस दृष्टिकोण का उपयोग लंबी संदर्भों के साथ काम करते समय मेमोरी और ध्यान लागत को कम करने के लिए DeepSeek-V4 जैसे मॉडल में किया जाता है।

arXiv पर 28 सितंबर को प्रकाशित 'Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression' नामक लेख में, टीम ने बताया कि एक ही जानकारी को एक स्थिति में आसानी से निकाला जा सकता है, लेकिन दूसरी स्थिति में इसे प्राप्त करना मुश्किल हो सकता है। यह कमी मानक मूल्यांकन मेट्रिक्स का उपयोग करते समय अनदेखी रह सकती है।

चंकिंग संपीड़न विधि अनुक्रमिक टोकन को विंडो में समूहित करती है और प्रत्येक विंडो को एक निश्चित अंतराल पर कैश में कम रिकॉर्ड तक संपीड़ित करती है। यह प्रत्येक टोकन को एक नया निर्देशांक असाइन करता है, जिसे लेखक उसकी 'फेज' कहते हैं - यानी विंडो की सीमाओं के संबंध में उसकी स्थिति। इनपुट डेटा में केवल कुछ टोकन का छोटा सा विस्थापन भी उन टोकन के समूह को बदल सकता है जो एक साथ संपीड़ित होते हैं, जबकि उनकी वास्तविक सामग्री अपरिवर्तित रहती है।

टीम ने DeepSeek-V4-Flash और DeepSeek-V4-Pro के आधारभूत और फाइन-ट्यून्ड संस्करणों, साथ ही फाइन-ट्यून्ड DeepSeek-V4.1-Flash का परीक्षण किया। परीक्षण 128 हजार टोकन की मात्रा पर 'सुई को ढेर में खोजना' कार्य पर किया गया, जबकि क्वेरी की लंबाई और निरपेक्ष स्थिति स्थिर रखी गई थी। लक्ष्य तत्व के चरण के आधार पर बुनियादी नियंत्रण बिंदुओं पर सटीकता में 40.2 प्रतिशत अंकों तक का अंतर था। हालांकि फाइन-ट्यूनिंग ने सटीकता बढ़ाई और अंतर को कम किया, वे V4 मॉडल के लिए महत्वपूर्ण बने रहे।

DeepSeek-V4.1-Flash मॉडल, जो चार के बजाय दो का चरण उपयोग करता है, ने सबसे कम अंतर प्रदर्शित किया, हालांकि आवधिक पैटर्न बना रहा। कारण का पता लगाने के लिए, शोधकर्ताओं ने पहले Qwen3-0.6B बैकबोन के आधार पर छोटे ट्रांसफॉर्मर परिवार को शून्य से प्रशिक्षित किया, जिसमें केवल KV संपीड़न डिजाइन को बदला गया था। प्रत्येक संपीड़ित भिन्नता ने अपने चरण के अनुरूप आवधिकता दिखाई, जिसमें वह संस्करण भी शामिल था जो प्रत्येक विंडो में टोकन का औसत निकालता है, जबकि पूर्ण आधार ध्यान मॉडल ऐसा नहीं दिखाते थे।

ध्यान हेड्स में हस्तक्षेप इंगित करता है कि लेखकों ने इसे 'फेज स्पेशलाइज़ेशन' कहा, क्योंकि विभिन्न घटक विभिन्न चरणों में जानकारी संसाधित करते हैं। वे बताते हैं कि ये यांत्रिक निष्कर्ष नियंत्रित परिस्थितियों में सबसे मजबूत हैं और बड़े मॉडल के लिए सार्वभौमिक कारण स्थापित नहीं करते हैं।

इस कार्य का व्यावहारिक महत्व किसी एक मॉडल की तुलना में मूल्यांकन विधियों से अधिक संबंधित है। लेख में तर्क दिया गया है कि KV चंकिंग संपीड़न का उपयोग करने वाले मॉडलों का मूल्यांकन चरणों को ध्यान में रखते हुए किया जाना चाहिए। उदाहरण के लिए, यह वांछित जानकारी को अपरिवर्तित रखते हुए इनपुट डेटा को कुछ टोकन से विस्थापित करके किया जा सकता है, क्योंकि उच्च औसत सटीकता व्यवस्थित स्थितिगत विफलताओं के साथ सह-अस्तित्व में हो सकती है।

आठ लेखकों ने संबद्धता के रूप में ByteDance Seed का उल्लेख किया। तीन ने प्रिंसटन विश्वविद्यालय, स्टैनफोर्ड विश्वविद्यालय या कैलिफ़ोर्निया विश्वविद्यालय, बर्कले का उल्लेख किया, और लेख में कहा गया है कि मुख्य प्रतिभागियों ने ByteDance Seed में इंटर्नशिप के दौरान यह काम किया था। संबंधित लेखक Yiyuan Ma और Xin Dong हैं।

लोकप्रिय