एक महीने पहले, बाइटडान्स के संस्थापक झांग यिन ने सीड टीम की आम बैठक में भाग लिया और दो साल के आंतरिक विवाद को समाप्त किया। उन्होंने घोषणा की कि बाइटडान्स अपने स्वयं के बड़े भाषा मॉडल (LLM) बनाने में तेजी लाने के लिए अन्य डेवलपर्स के मॉडलों का उपयोग नहीं करेगा, जिसमें बंद अत्याधुनिक मॉडल और ओपन-वेट मॉडल दोनों शामिल हैं।
यह नियम 2023 में स्थापित किया गया था। सीड टीम के शुरुआती चरणों में, जीपीटी एपीआई परिणामों का उपयोग प्रशिक्षण डेटा के रूप में प्रयोग किया गया था। अप्रैल 2023 में बाइटडान्स द्वारा जीपीटी एपीआई कॉल्स का ऑडिट शुरू करने के बाद, टीम ने एक सख्त नियम स्थापित किया: जीपीटी द्वारा उत्पन्न डेटा बाइटडान्स के प्रशिक्षण सेट में नहीं जाना चाहिए। यह प्रतिबंधात्मक तंत्र तब आया जब चीन के बाहर किसी ने डिस्टिलेशन पर चर्चा करना शुरू नहीं किया था।
पहला आंतरिक विवाद जनवरी 2025 में DeepSeek-R1 के जारी होने के बाद शुरू हुआ। सीड के शोधकर्ताओं ने एक स्पष्ट प्रश्न पूछा: यदि अन्य प्रयोगशालाएं पिछड़ने की भरपाई के लिए गुप्त रूप से उन्नत मॉडल के परिणामों का उपयोग कर रही हैं, तो वे ऐसा क्यों नहीं कर सकतीं? कुछ लोगों ने सीड के अपने पूर्व-प्रशिक्षण को अस्वीकार किए बिना अंतराल को भरने के लिए सावधानीपूर्वक डिस्टिल्ड परिणामों का उपयोग करने का सुझाव दिया। प्रबंधन ने इस प्रस्ताव को खारिज कर दिया।
एक साल बाद, जब अमेरिकी प्रयोगशालाओं में एनवीडिया ब्लैकवेल जीपीयू को व्यापक रूप से लागू किया जाने लगा, तो बहस फिर से शुरू हो गई। चीनी प्रयोगशालाओं के पास शीर्ष बी-सीरीज़ कार्ड खरीदने की क्षमता नहीं है। सीडेंस 2.0 एच20 क्लस्टर पर प्रशिक्षित हुआ, जिसकी प्रदर्शन क्षमता B200 का लगभग एक बीसवां हिस्सा है। जीपीटी-5.5 और क्लॉड 4.8, विशेष रूप से क्लॉड फेबल 5 द्वारा प्राप्त तर्क, कोडिंग और विज्ञान में प्रगति, ब्लैकवेल के आगमन के साथ मेल खाती है। हालांकि बंद मॉडल को डिस्टिल नहीं किया जा सकता है, सर्वश्रेष्ठ ओपन-वेट मॉडल किया जा सकता है।
वह बिंदु जिसने विवाद को आम बैठक तक पहुंचाया, वह मूनशॉट के Kimi K3 मॉडल था। मूनशॉट का ओपन-वेट मॉडल K3 उन्नत बंद मॉडलों के बराबर स्तर पर पहुंच गया। सीड के लिए, जो विश्व स्तरीय शीर्ष दस में शामिल होने की आकांक्षा रखने वाली एक अपेक्षाकृत छोटी चीनी प्रयोगशाला है, यह प्रश्न अपरिहार्य हो गया: सीड, प्रतिभा की उच्च घनत्व और बड़ी कम्प्यूटेशनल क्षमता रखने के बावजूद, समकक्ष स्तर का भाषा मॉडल क्यों नहीं बना सकी? डिस्टिलेशन सीड को सीमित प्रशिक्षण संसाधनों को उन क्षेत्रों में निर्देशित करने की अनुमति देगा जो अन्य स्थानों पर पहले ही प्रभावी साबित हो चुके हैं।
झांग का जवाब संक्षिप्त था। उन्होंने कहा कि सीड अस्थायी रूप से पीछे रह सकती है, लेकिन वह प्रतिस्पर्धियों के डिस्टिलेशन के माध्यम से इस अंतर को बंद नहीं होने दे सकती। यह रुख 2023 की नीति के अनुरूप है, हालांकि दांव काफी बढ़ गए हैं। एंथ्रोपिक ने सार्वजनिक रूप से टोंगयी कियानवेन, मूनशॉट और मिनीमैक्स पर क्लॉड के परिणामों के बड़े पैमाने पर संग्रह का आरोप लगाया है। इन आरोपों की सत्यता की परवाह किए बिना, भू-राजनीतिक, कानूनी और वाणिज्यिक जोखिम में भारी वृद्धि हुई है, और सीड अपनी स्थिति बनाए रखती है, भले ही इसके लिए बेंचमार्क में कई वर्षों का पिछड़ना पड़े।
दिलचस्प दांव रणनीति के मूल में निहित मेटा-दांव में है। सीड की रणनीति मानती है कि आज के तर्क बेंचमार्क में आगे रहने वाली प्रयोगशालाएं उस बुद्धिमत्ता में आगे नहीं होंगी जिसे सीड बनाने की कोशिश कर रही है, और वर्तमान में उनके डेटा को उधार लेने से सीड को उनकी बुद्धिमत्ता वास्तुकला में स्थिर कर देगा, न कि अपनी खुद की में। यह एक ऐसा दांव है जिसे झांग मॉडल की स्थिति में नुकसान उठाकर समर्थन करने को तैयार है, जो कुछ अन्य चीनी प्रयोगशालाओं के लिए करना कठिन हो सकता है।

