बड़ा भाषा मॉडल क्या है और यह कैसे काम करता है?
ChatGPT, Claude और हर एक AI के पीछे की तकनीक को समझने के लिए एक सरल गाइड जो आपको समझ सकता है।

बड़ा भाषा मॉडल (LLM) एक प्रकार का AI है जिसे विशाल मात्रा में टेक्स्ट पर प्रशिक्षित किया जाता है ताकि यह प्राकृतिक भाषा में पढ़, लिख, सारांश दे और सवालों के जवाब दे सके। यह अरबों शब्दों में पैटर्न सीखकर काम करता है, फिर सबसे उपयोगी अगला शब्द, वाक्य या विचार की भविष्यवाणी करता है। इसे ऐसे सोचें जैसे ऑटोकंप्लीट जो विश्वविद्यालय में गया हो।
"बड़ा" वास्तव में क्या मायने रखता है?
बड़ा दो चीजों को एक साथ संदर्भित करता है: प्रशिक्षण डेटा का आकार और मॉडल के अंदर "पैरामीटर" की संख्या। पैरामीटर समायोज्य आंतरिक सेटिंग हैं, जैसे छोटे डायल, जिन्हें मॉडल प्रशिक्षण के दौरान पाठ की भविष्यवाणी में बेहतर होने के लिए समायोजित करता है। GPT-4 के अनुमान में सैकड़ों अरबों पैरामीटर हैं, यही कारण है कि इन मॉडलों को चलाने के लिए गंभीर कंप्यूटिंग शक्ति की आवश्यकता होती है।
अधिक पैरामीटर हमेशा एक स्मार्ट मॉडल का मतलब नहीं रखते। शोधकर्ताओं ने पाया है कि सावधानीपूर्वक क्यूरेट की गई, छोटी डेटासेट अपने आकार के एक अंश में आश्चर्यजनक रूप से सक्षम मॉडल का उत्पादन कर सकती हैं। "बड़ा" लेबल एक सख्त नियम के बजाय एक सम्मेलन बन रहा है।
प्रशिक्षण वास्तव में कैसे काम करता है?
प्रशिक्षण विशाल मात्रा में टेक्स्ट दिखाने की प्रक्रिया है और मॉडल से बार-बार अगले शब्द का अनुमान लगाने के लिए कहा जाता है, फिर जब भी यह गलत अनुमान लगाता है तो आंतरिक डायलों को समायोजित किया जाता है। ऐसा अरबों बार करें और मॉडल व्याकरण, तथ्य, तर्क शैली और यहां तक कि टोन को पकड़ना शुरू कर देता है।
आधुनिक LLMs के पीछे प्रमुख विधि को ट्रांसफॉर्मर आर्किटेक्चर कहा जाता है, जो 2017 के एक ऐतिहासिक पेपर में पेश किया गया था। ट्रांसफॉर्मर "ध्यान" नामक एक तंत्र का उपयोग करते हैं जो मॉडल को यह तौलने देता है कि एक वाक्य में प्रत्येक शब्द हर दूसरे शब्द के लिए कितना प्रासंगिक है, इसलिए यह केवल शब्द क्रम के बजाय संदर्भ को समझता है।
उस प्रारंभिक प्रशिक्षण के बाद, अधिकांश व्यावसायिक मॉडल RLHF (मानव प्रतिक्रिया से सुदृढ़ करण सीखना) नामक एक दूसरे चरण से गुजरते हैं। मानव मूल्यांकनकर्ता मॉडल के उत्तरों को स्कोर करते हैं, और वे स्कोर मॉडल को अधिक सहायक और कम हानिकारक होना सिखाते हैं।
एक LLM वास्तव में क्या कर सकता है?
व्यवहार में, एक अच्छी तरह से प्रशिक्षित LLM ईमेल का मसौदा तैयार कर सकता है, चिकित्सा शब्दावली की व्याख्या कर सकता है, कोड लिख सकता है, भाषाओं का अनुवाद कर सकता है और लंबे दस्तावेज़ों का सारांश दे सकता है। एक वास्तविक उदाहरण: यूके में एक GP प्रैक्टिस ने रोगी फॉलो-अप पत्र का मसौदा तैयार करने के लिए एक LLM का उपयोग किया, जिससे प्रशासनिक समय में लगभग आधी कमी आई, क्योंकि मॉडल डॉक्टर के बुलेट पॉइंट को सेकंड में पूर्ण, पठनीय गद्य में बदल सकता था।
जो कुछ यह विश्वसनीय रूप से नहीं कर सकता है वह है पहले सिद्धांतों से तर्क करना, लाइव जानकारी तक पहुंचना (जब तक कि इसे वेब खोजने के लिए एक उपकरण न दिया जाए) या तथ्यात्मक सटीकता की गारंटी देना। LLMs कभी-कभी "भ्रम" करते हैं, जिसका अर्थ है कि वे आत्मविश्वास से ऐसी चीजें कहते हैं जो बस गलत हैं। मॉडल व्यवहार पर Anthropic का अनुसंधान इस बात को कवर करता है कि यह क्यों होता है और निर्माता इसे कैसे कम करने का प्रयास करते हैं।
LLM सर्च इंजन से कैसे अलग है?
एक सर्च इंजन पेज ढूंढता है और रैंक करता है जो पहले से मौजूद हैं। एक LLM शुरुआत से नया टेक्स्ट उत्पन्न करता है, प्रशिक्षण के दौरान अवशोषित पैटर्न पर आकर्षण करता है। सर्च आपको स्रोतों की एक सूची देता है; एक LLM आपको एक संश्लेषित उत्तर देता है जिसमें मूल साक्ष्य की ओर इशारा करने की कोई गारंटी नहीं है।
दोनों को तेजी से संयोजित किया जा रहा है। रिट्रीवल-ऑगमेंटेड जेनरेशन (RAG) जैसे उपकरण एक LLM को उत्तर देने से पहले लाइव दस्तावेज़ में खींचने देते हैं, दोनों दृष्टिकोणों के सर्वश्रेष्ठ को मिश्रित करते हैं।
एक का उपयोग करने में क्या खर्च आता है?
| मॉडल / सेवा | मुफ्त स्तर | भुगतान किया गया स्तर शुरू होता है |
|---|---|---|
| ChatGPT (OpenAI) | हाँ, GPT-4o mini | ~$20/माह Plus के लिए |
| Claude (Anthropic) | हाँ, Claude 3 Haiku | ~$20/माह Pro के लिए |
| Gemini (Google) | हाँ, Gemini 1.5 Flash | ~$20/माह Advanced के लिए |
| API पहुंच (अपना निर्माण करें) | साइन-अप पर उपयोग क्रेडिट | प्रति टोकन भुगतान करें (एक सेंट का अंश) |
अधिकांश casual उपयोगकर्ताओं के लिए, मुफ्त स्तर रोजमर्रा के कार्यों को कवर करते हैं। भारी उपयोगकर्ता या विकासकर्ता प्रति टोकन भुगतान करते हैं (एक टोकन मोटे तौर पर टेक्स्ट के तीन से चार वर्ण हैं) लंबे दस्तावेज़ों पर तेजी से लागत बढ़ा सकते हैं।
क्या कोई गोपनीयता जाल हैं जिन्हें मुझे जानना चाहिए?
हां, और वे महत्वपूर्ण हैं। जब आप एक व्यावसायिक LLM में एक प्रॉम्प्ट टाइप करते हैं, तो वह टेक्स्ट प्रदाता के सर्वर को भेजा जाता है। कई प्रदाताओं का कहना है कि उनकी शर्तों में वे आपकी बातचीत का उपयोग भविष्य के मॉडलों को बेहतर बनाने के लिए कर सकते हैं जब तक कि आप सक्रिय रूप से बाहर न निकलें। OpenAI की गोपनीयता नियंत्रण आपको प्रशिक्षण डेटा उपयोग को बंद करने देते हैं, लेकिन सभी उपयोगकर्ताओं के लिए सेटिंग डिफ़ॉल्ट रूप से चालू नहीं है।
व्यक्तिगत डेटा, रोगी रिकॉर्ड, वित्तीय विवरण या गोपनीय व्यावसायिक जानकारी को एक सार्वजनिक LLM में पेस्ट न करें जब तक कि आपने प्रदाता की डेटा-प्रोसेसिंग शर्तों को सावधानीपूर्वक जांच न लिया हो।
सामान्य प्रश्न
क्या बड़ा भाषा मॉडल कृत्रिम सामान्य बुद्धिमत्ता के समान है?
नहीं। एक LLM टेक्स्ट भविष्यवाणी पर प्रशिक्षित एक विशेष प्रणाली है। कृत्रिम सामान्य बुद्धिमत्ता (AGI) का अर्थ होगा एक ऐसी प्रणाली जो किसी भी डोमेन में एक मानव की तरह सीख सकती है और तर्क कर सकती है, कुछ शोधकर्ता एक खुली और अनसुलझी समस्या मानते हैं।
क्या एक LLM इसके रिलीज के बाद नई जानकारी सीख सकता है?
अपने आप पर नहीं। एक मानक LLM के पास एक "ज्ञान कट-ऑफ" है, जो तारीख है जब इसका प्रशिक्षण डेटा समाप्त हुआ था, और जब नई घटनाएं होती हैं तो यह स्वयं को अपडेट नहीं करता है। कुछ सिस्टम इस सीमा के चारों ओर जाने के लिए शीर्ष पर लाइव सर्च उपकरण जोड़ते हैं।
एक LLM कभी-कभी चीजें क्यों बनाता है?
क्योंकि यह मौलिक रूप से एक पैटर्न-समापन इंजन है, तथ्य-जांचकर्ता नहीं। यदि एक वाक्य का पैटर्न दृढ़ता से एक그ुणमान-सुनने वाले उत्तर की ओर इशारा करता है, तो मॉडल इसे उत्पादित करता है, भले ही कोई विश्वसनीय साक्ष्य मौजूद नहीं हो। इस भ्रम समस्या में अनुसंधान प्रमुख प्रयोगशालाओं में सक्रिय है।



