ByteDance दुनिया के सबसे बड़े AI मॉडल में से एक बना रहा है
चीन की टेक दिग्गज कंपनी 10 ट्रिलियन पैरामीटर वाले मॉडल को प्रशिक्षित कर रही है, जो अब तक जारी किए गए किसी भी चीनी AI से कहीं बड़ा होगा और इसे Anthropic की सबसे उन्नत प्रणालियों के समान माना जा सकेगा।

मुख्य बातें
- ByteDance इस परियोजना की जानकारी रखने वाले तीन लोगों के अनुसार 10 ट्रिलियन पैरामीटर तक के साथ एक AI मॉडल को प्रशिक्षित कर रहा है।
- यह आंकड़ा किमी K3 से तीन गुना अधिक है, जो अब तक जारी किया गया सबसे बड़ा चीनी AI मॉडल है।
- मॉडल पूर्व-प्रशिक्षण चरण में है, एक प्रक्रिया जो आम तौर पर किसी भी सार्वजनिक रिलीज से पहले तीन से छह महीने तक चलती है।
- अंतिम पैरामीटर संख्या निश्चित नहीं की गई है और विकास के बाद के चरण में ही पुष्टि की जाएगी।
- यदि पूरा हो जाता है, तो मॉडल Anthropic की सबसे उन्नत AI प्रणालियों के स्तर तक पहुंच जाएगा।
TikTok के पीछे की चीनी कंपनी ByteDance चुपचाप दुनिया के सबसे बड़े कृत्रिम बुद्धिमत्ता मॉडल में से एक बनाने में जुटी है। इस परियोजना से परिचित तीन लोगों ने Ars Technica को बताया कि मॉडल 10 ट्रिलियन पैरामीटर तक पहुंच सकता है, एक संख्या जिसे समझने के लिए थोड़ी व्याख्या की आवश्यकता है।
एक पैरामीटर एक AI मॉडल के अंदर एक छोटी आंतरिक सेटिंग है। जितने अधिक पैरामीटर किसी मॉडल के पास होते हैं, वह डेटा से उतने अधिक पैटर्न सीख सकता है, और आम तौर पर लिखना, तर्क करना और प्रश्नों का उत्तर देने जैसे कार्यों में अधिक सक्षम हो जाता है। ChatGPT को शक्ति देने वाले मॉडल GPT-4 के बारे में व्यापक रूप से अनुमान है कि इसके पास लगभग 1.8 ट्रिलियन पैरामीटर हैं। दस ट्रिलियन कुछ बिल्कुल अलग होगा।
तुलना के लिए, Moonshot का Kimi K3, वर्तमान में किसी भी चीनी कंपनी द्वारा जारी किया गया सबसे बड़ा AI मॉडल, के पास लगभग 3.3 ट्रिलियन पैरामीटर हैं। ByteDance की परियोजना उस आकार का तीन गुना होगी।
यह किस चरण में है?
फिलहाल मॉडल उस चरण में है जिसे इंजीनियर पूर्व-प्रशिक्षण कहते हैं: एक AI बनाने का पहला और सबसे लंबा चरण, जहां सिस्टम बुनियादी भाषा और तर्क कौशल सीखने के लिए विशाल मात्रा में पाठ और डेटा पढ़ता है। इसे AI के स्कूल में जाने के रूप में सोचें जिसके बाद किसी विशेष नौकरी का प्रशिक्षण शुरू होता है। यह चरण आम तौर पर तीन से छह महीने तक चलता है।
पूर्व-प्रशिक्षण के बाद, इंजीनियर दूसरे चरण को चलाते हैं जिसे सूक्ष्म-ट्यूनिंग कहा जाता है, जहां मॉडल को अधिक विशिष्ट कार्यों पर प्रशिक्षित किया जाता है और वास्तविक दुनिया के उपयोग के लिए परिष्कृत किया जाता है। केवल तभी ByteDance सार्वजनिक रिलीज पर विचार करेगा, और केवल तभी यदि परिणाम अच्छे दिखें।
महत्वपूर्ण रूप से, 10 ट्रिलियन आंकड़ा अंतिम नहीं है। एक स्रोत ने कहा कि सटीक आकार केवल प्रक्रिया के बाद में निर्णीत होगा। हेडलाइन संख्या बदल सकती है।
यह सामान्य लोगों के लिए क्यों मायने रखता है?
बड़े मॉडल कठिन समस्याओं पर बेहतर परिणाम देते हैं: जटिल कानूनी दस्तावेज, चिकित्सा प्रश्न, बहु-चरणीय कोडिंग कार्य। यदि ByteDance इस पैमाने पर कोई मॉडल जारी करता है, तो यह कंपनी को वैश्विक AI बाजार में Anthropic और OpenAI जैसी अमेरिकी प्रयोगशालाओं के साथ प्रतिस्पर्धा करने के लिए एक गंभीर उपकरण दे देगा।
यह यह भी संकेत देता है कि चीनी कंपनियां कितनी तेजी से अंतराल को बंद कर रही हैं। एक साल पहले, अमेरिकी और चीनी सीमांत AI के बीच का अंतराल चौड़ा था। आज यह तेजी से कम हो रहा है।
उपभोक्ताओं के लिए, व्यावहारिक परिणाम अधिक प्रतिस्पर्धा है, जो ऐतिहासिक रूप से कीमतों को कम करती है और गुणवत्ता को ऊपर ले जाती है। ByteDance पहले से ही Doubao सहित अपने स्वयं के चैटबॉट सहित AI उत्पादों का संचालन करता है, जिसके चीन के अंदर लाखों उपयोगकर्ता हैं।
यह सब अभी तक एक पूर्ण उत्पाद नहीं है। प्रशिक्षण विफल हो सकता है, परिणाम निराश कर सकते हैं, और कंपनियां नियमित रूप से उन मॉडल को अलग रखती हैं जो अपेक्षा के अनुरूप प्रदर्शन नहीं करते हैं। लेकिन प्रयास के शुद्ध पैमाने से पता चलता है कि ByteDance की महत्वाकांक्षाएं कहां लक्षित हैं।


