एक AI agent क्या है? सरल भाषा में गाइड
AI agents ऐसे प्रोग्राम हैं जो अपने लिए छोटे-छोटे लक्ष्य निर्धारित कर सकते हैं और दुनिया में कार्य कर सकते हैं, केवल एक सवाल का जवाब देकर रुक नहीं जाते।

एक AI agent एक सॉफ्टवेयर प्रोग्राम है जो अपने परिवेश को समझता है, एक योजना बनाता है, कार्य करता है (जैसे बटन दबाना या अन्य सॉफ्टवेयर को कॉल करना), और यह जांचता है कि क्या वह अपने लक्ष्य तक पहुंचा, सब कुछ स्वयं करता है। एक बुनियादी चैटबॉट के विपरीत जो आपके अगले संदेश की प्रतीक्षा करता है, एक agent तब तक काम करता रहता है जब तक काम पूरा न हो या वह फंस न जाए।
एक AI agent एक साधारण चैटबॉट से कैसे अलग है?
एक चैटबॉट एक बार में एक संदेश का जवाब देता है और फिर रुक जाता है। दूसरी ओर, एक agent स्वयं कई चरणों को जोड़ता है, प्रत्येक बार यह निर्णय लेता है कि आगे क्या करना है, बिना आपकी मदद के।
एक चैटबॉट को एक ज्ञानी दोस्त के रूप में सोचें जो एक बार में एक सवाल का जवाब देता है। एक agent एक इंटर्न की तरह है जो एक संक्षिप्त निर्देश लेता है, दर्जन ब्राउज़र टैब खोलता है, मीटिंग बुक करता है, और आपको एक सारांश ईमेल करता है। अंतर्निहित AI मॉडल (सोचने वाला भाषा मॉडल) अक्सर समान तकनीक होती है। जो बदलता है वह इसके चारों ओर लूप है: समझना, योजना बनाना, कार्य करना, जांचना, दोहराना।
एक AI agent वास्तव में क्या कर सकता है?
Agents वेब को ब्राउज़ कर सकते हैं, कोड लिख और चला सकते हैं, फॉर्म भर सकते हैं, ईमेल भेज सकते हैं, डेटाबेस को क्वेरी कर सकते हैं, और बाहरी उपकरणों को कॉल कर सकते हैं जिन्हें API कहा जाता है (एप्लिकेशन प्रोग्रामिंग इंटरफेस, मूलतः कनेक्टर जो सॉफ्टवेयर को अन्य सॉफ्टवेयर से बात करने देते हैं)। उपकरणों का सेट जिस तक एक agent पहुंच सकता है, इसकी शक्ति को परिभाषित करता है।
एक वास्तविक उदाहरण: एक सॉफ्टवेयर कंपनी में एक ग्राहक-सहायता agent एक बग रिपोर्ट पढ़ सकता है, आंतरिक ज्ञान आधार में खोज कर सकता है, कंपनी की प्रणाली में एक सहायता टिकट खोल सकता है, और ग्राहक को एक केस नंबर के साथ जवाब दे सकता है, सब कुछ बिना किसी मानव के हाथ लगाए। यह एक ऐसा काम है जिसे एक मानव कार्यकर्ता के चार अलग-अलग चरणों की आवश्यकता होती।
एक agent यह कैसे तय करता है कि आगे क्या करना है?
अधिकांश agents आज ReAct (Reason and Act के लिए संक्षिप्त) नामक एक पैटर्न का उपयोग करते हैं, जहां मॉडल प्रत्येक चरण से पहले अपने तर्क को लिख देता है। यह कार्य से पहले तर्क करने का दृष्टिकोण सीधे कार्य करने की तुलना में त्रुटियों को कम करने के लिए दिखाया गया है।
Agent अपने द्वारा अब तक किए गए कार्यों की एक छोटी स्मृति रखता है (जिसे context window कहा जाता है, पाठ का वह हिस्सा जो मॉडल एक बार में "देख" सकता है), यह जांचता है कि क्या वह लक्ष्य तक पहुंच गया है, और या तो अगला कदम उठाता है या कार्य समाप्त घोषित करता है। यदि लक्ष्य अस्पष्ट है या परिवेश बदलता है, तो यह योजना को बीच में संशोधित कर सकता है।
AI agents के मुख्य प्रकार क्या हैं?
Agents को अक्सर इस आधार पर समूहित किया जाता है कि उन्हें कितनी स्वतंत्रता है और वे कैसे बनाए गए हैं।
| प्रकार | यह क्या करता है | सामान्य उपयोग |
|---|---|---|
| एकल-चरण उपकरण उपयोगकर्ता | प्रति क्वेरी एक उपकरण कॉल करता है | वेब खोज ऐड-ऑन |
| बहु-चरण योजनाकार | स्वायत्त रूप से कई कार्यों को जोड़ता है | अनुसंधान या कोडिंग कार्य |
| बहु-agent प्रणाली | कई agents एक दूसरे को सौंपते हैं | जटिल व्यावसायिक कार्यप्रवाह |
| मानव-इन-द-लूप agent | जोखिम भरे चरणों से पहले रुकता है और मानव से पूछता है | वित्त या कानूनी कार्य |
OpenAI का स्वयं का मार्गदर्शन मानव-इन-द-लूप डिजाइन के साथ शुरुआत करने की सिफारिश करता है ताकि एक व्यक्ति वास्तविक नुकसान से पहले गलतियों को पकड़ सके।
एक AI agent की लागत कितनी है?
कीमतें बहुत भिन्न होती हैं। कई उपकरण हल्के उपयोग के लिए एक निःशुल्क स्तर प्रदान करते हैं। जब एक agent कई चरणों को जोड़ना शुरू करता है तो लागत तेजी से बढ़ती है, क्योंकि प्रत्येक चरण अंतर्निहित AI मॉडल को कॉल करता है और आप संसाधित पाठ के प्रत्येक हिस्से के लिए भुगतान करते हैं।
Anthropic, Google, और OpenAI सभी पे-ऐज़-यू-गो API मूल्य निर्धारण प्रदान करते हैं जिसे टोकन में मापा जाता है (पाठ के छोटे हिस्से, मोटे तौर पर 0.75 शब्द प्रत्येक)। एक छोटा अनुसंधान कार्य कुछ सेंट का खर्च हो सकता है। सैकड़ों चरणों को चलाने वाला एक जटिल कार्यप्रवाह प्रति रन कुछ डॉलर खर्च कर सकता है। AutoGPT या Zapier के AI agents जैसे होस्ट किए गए प्लेटफॉर्म अपने स्वयं की सदस्यता फीस जोड़ते हैं, मूल योजनाओं के लिए मुक्त से लगभग दस डॉलर प्रति माह तक शुरुआत करते हैं।
गोपनीयता संबंधी समस्याएं क्या हैं?
Agents को अक्सर उपयोगी होने के लिए व्यापक अनुमतियों की आवश्यकता होती है, और यह वह जगह है जहां चीजें संवेदनशील हो जाती हैं। एक मीटिंग बुक करने के लिए, एक agent को आपके कैलेंडर और ईमेल तक पहुंच की आवश्यकता हो सकती है। एक फॉर्म भरने के लिए, यह आपकी फाइलों से व्यक्तिगत डेटा पढ़ सकता है।
तीन चीजें ध्यान में रखनी हैं: पहली, जांचें कि agent AI मॉडल के सर्वर को कौन सा डेटा भेजता है, क्योंकि वह डेटा भविष्य के मॉडल को बेहतर बनाने के लिए उपयोग किया जा सकता है जब तक आप सहमत न हों। दूसरा, NIST AI जोखिम प्रबंधन ढांचा इस बात को रेखांकित करता है कि आपकी ओर से स्वायत्त प्रणालियां कार्य करती हैं यदि वह एक अप्रत्याशित स्थिति से टकराती हैं तो तेजी से नुकसान पहुंचा सकती हैं। तीसरा, किसी भी agent को उपकरणों तक पहुंच देने के बारे में सावधान रहें जिसकी उसे हाथ में लिए गए कार्य के लिए कड़ाई से आवश्यकता नहीं है।
क्या AI agents अभी उपयोग करने के लिए सुरक्षित हैं?
वे स्पष्ट रूप से परिभाषित, कम-दांव वाले कार्यों के लिए अच्छी तरह से काम करते हैं। खुली-अंत या उच्च-दांव वाले कार्यों को अभी भी एक मानव की गहन निगरानी की आवश्यकता होती है। Anthropic के शोधकर्ता एक गुण का वर्णन करते हैं जिसे "corrigibility" कहा जाता है (अर्थात agent को मनुष्यों के लिए विनीत होना चाहिए बजाय आगे बढ़ने के) एक सक्रिय अनुसंधान चुनौती के रूप में, एक समाधान नहीं। सरल शब्दों में: अपने agent को अपनी मीटिंग नोट्स के साथ विश्वास करें, न कि आपके बैंक खाते के साथ, जब तक सुरक्षा विज्ञान आगे न बढ़ जाए।
सामान्य प्रश्न
क्या एक AI agent अपने द्वारा चलाए जाने वाले कार्यों से स्थायी रूप से सीखता है?
आम तौर पर नहीं। आज अधिकांश वाणिज्यिक agents आपके कार्यों से अपने अंतर्निहित मॉडल को अपडेट नहीं करते हैं। वे केवल एक सत्र के भीतर याद रखते हैं जब तक कि उपकरण स्पष्ट रूप से नोट्स को डेटाबेस में सहेजता न हो।
क्या AI agents एक साथ काम कर सकते हैं?
हां। एक बहु-agent प्रणाली एक "orchestrator" agent को एक बड़े कार्य को भागों में तोड़ने और प्रत्येक भाग को एक विशेषज्ञ agent को सौंपने देती है, बिल्कुल एक परियोजना प्रबंधक की तरह एक टीम को सौंपते हुए। यह सभी प्रमुख AI labs में विकास का एक सक्रिय क्षेत्र है।
क्या मुझे एक AI agent का उपयोग करने के लिए कोड करना जानना होगा?
नहीं। कई प्लेटफॉर्म (Zapier, Make, Microsoft Copilot Studio) आपको गैर-तकनीकी उपयोगकर्ताओं के लिए डिज़ाइन किए गए पॉइंट-एंड-क्लिक इंटरफेस के माध्यम से agents बनाने और चलाने देते हैं।



