एआई एजेंट्स तैनात करने से पहले एंटरप्राइज नेताओं को जानने योग्य पाँच बातें
इंटेल ने एजेंटिक एआई वर्कलोड पर हजारों प्रयोग चलाए और पाया कि अधिकांश संगठन गलत चीजों को मापते हैं। यहाँ देखें कि चैटबॉट्स से आगे बढ़ने पर वास्तव में क्या मायने रखता है।

मुख्य बिंदु
- इंटेल ने एजेंटिक एआई वर्कलोड प्रयोगों के हजारों चलाए ताकि यह मापा जा सके कि एआई एजेंट्स केवल एआई मॉडल प्रतिक्रियाओं के बजाय पूरे एंटरप्राइज सिस्टम में कैसे प्रदर्शन करते हैं।
- अधिकांश मौजूदा बेंचमार्किंग टूल्स केवल अंतर्निहित एआई मॉडल के प्रदर्शन को मापते हैं, जिससे व्यापक सिस्टम चित्र पूरी तरह से छूट जाता है।
- सही क्षमता मीट्रिक प्रति वर्चुअल सीपीयू (vCPU) एजेंट्स है, एक कंप्यूटिंग यूनिट जो सर्वर की प्रोसेसिंग पावर का एक हिस्सा दर्शाती है, न कि कुल एजेंट संख्या।
- औसत सीपीयू उपयोग की निगरानी (कंप्यूटर का प्रोसेसर औसतन कितनी मेहनत कर रहा है) गंभीर मंदी को छिपा सकती है; टास्क लेटेंसी, किसी कार्य को पूरा करने में लगने वाला वास्तविक समय, एक बेहतर चेतावनी संकेत है।
- एक बड़ी मशीन को अपग्रेड करने के बजाय कई सर्वर्स पर वर्कलोड्स फैलाना आमतौर पर बड़े पैमाने पर एजेंट्स चलाने का सस्ता और अधिक विश्वसनीय तरीका है।
एआई एजेंट्स सॉफ्टवेयर हैं जो बहु-चरणीय कार्यों की स्वयं योजना बना सकते हैं और उन्हें निष्पादित कर सकते हैं, जैसे बैठकें बुकिंग करना, सहायता टिकटों को प्राथमिकता देना, कोड टेस्ट चलाना, बिना किसी मानव के प्रत्येक चरण पर क्लिक किए। एंटरप्राइजेस उन पर बहुत दांव लगा रहे हैं। लेकिन इंटेल की नई खोजें बताती हैं कि अधिकांश संगठन इस समस्या को गलत तरीके से सोच रहे हैं।
इंटेल ने Terminal-Bench को विस्तारित किया, एक ओपन-सोर्स टेस्टिंग फ्रेमवर्क जिसका उपयोग एआई एजेंट्स के आचरण का मूल्यांकन करने के लिए किया जाता है, प्रोफाइलिंग टूल्स और विस्तृत टेलीमेट्री (सॉफ्टवेयर कैसे वास्तव में चल रहा है इस बारे में एकत्र किए गए डेटा) जोड़कर। टीम ने डेटाबेस क्वेरीज से लेकर वीडियो ट्रांसकोडिंग तक कई कार्यों में एजेंट्स को चलाया, फिर परिणामों को रिकॉर्ड किया।
निष्कर्षों को एंटरप्राइज प्रौद्योगिकी टीमों के लिए एक व्यावहारिक गाइड के रूप में प्रकाशित किया गया था, और मूल रूप से इंटेल से प्रायोजित सामग्री के रूप में MIT Technology Review द्वारा प्रदर्शित किए गए थे।
कंपनियाँ क्या गलत कर रही हैं?
अधिकांश टीमें एआई मॉडल को ही मापती हैं: यह कितना सटीक है, यह कितनी तेजी से प्रतिक्रिया देता है? यह वास्तविक दुनिया में एजेंट को धीमा या अविश्वसनीय बनाने वाली अधिकांश चीजों को छोड़ देता है।
एक एजेंट भाषा मॉडल से बहुत अधिक करता है। यह डेटा पढ़ता है, बाहरी टूल्स को कॉल करता है, परिणामों की जाँच करता है, और जब कुछ टूट जाता है तो पुनः प्रयास करता है। इनमें से प्रत्येक चरण समय और कंप्यूट लेता है। इंटेल ने पाया कि केवल मॉडल प्रदर्शन पर ध्यान केंद्रित करने से आपको लगभग कुछ नहीं बताया जाता है कि क्या आपका एजेंट फ्लीट वास्तविक व्यावसायिक लोड के तहत खड़ा रह सकता है।
इंटेल द्वारा अनुशंसित छह मीट्रिक्स हैं: कार्य सफलता दर, प्रति कार्य लागत, प्रति कार्य समय, कार्य थ्रूपुट (सिस्टम किसी दिए गए अवधि में कितने कार्य पूरा करता है), एजेंट घनत्व (प्रति vCPU एजेंट्स), और अंत-से-अंत लेटेंसी।
टीमों को स्केलिंग के लिए कैसे योजना बनानी चाहिए?
अपनी सिस्टम को एजेंट घनत्व द्वारा आकार दें, न कि एजेंट संख्या द्वारा। एक 8-vCPU सर्वर पर चल रहे 10 एजेंट्स लगभग 16-vCPU सर्वर पर 20 एजेंट्स के समान व्यवहार करते हैं, क्योंकि घनत्व समान है। यह एकल अंतर्दृष्टि आर्किटेक्ट्स को अलग-अलग सर्वर आकारों की उचित तुलना करने देती है।
घनत्व लक्ष्य यह भी पर निर्भर करते हैं कि एजेंट्स क्या कर रहे हैं। एजेंट्स जो कर्मचारियों से सीधे बात करते हैं उन्हें तेज प्रतिक्रिया समय चाहिए, इसलिए आप घनत्व को कम रखते हैं। पृष्ठभूमि बैच कार्य, जैसे स्वचालित आईटी वर्कफ़्लो या रात्रि कोड-टेस्टिंग रन, बिना किसी को थोड़ी देरी का पता चलने के उच्च घनत्व पर चल सकते हैं।
| वर्कलोड प्रकार | अनुशंसित घनत्व | कारण |
|---|---|---|
| इंटरैक्टिव कोपायलट / उपयोगकर्ता-सामने सहायक | निम्न घनत्व | प्रतिक्रिया समय उपयोगकर्ताओं के लिए दृश्यमान है |
| बैच आईटी या टेस्टिंग वर्कफ़्लो | उच्च घनत्व | थोड़ी देरी स्वीकार्य है |
| भारी समानांतर कंप्यूट कार्य | स्केल अप (अधिक शक्तिशाली सिंगल सर्वर) | केंद्रीकृत प्रोसेसिंग पावर की जरूरत है |
| अधिकांश अन्य एंटरप्राइज वर्कलोड्स | स्केल आउट (अधिक सर्वर्स) | सस्ता, अधिक लचीला, बढ़ाने में आसान |
स्केलिंग पर: अधिक सर्वर्स जोड़ना (स्केल-आउट) लगभग हर मानक एजेंटिक वर्कलोड के लिए एक शक्तिशाली मशीन को अपग्रेड करने (स्केल-अप) को हराता है। एजेंट्स काफी हद तक एक-दूसरे से स्वतंत्र हैं, इसलिए उन्हें मशीनों में फैलाने से उपलब्धता बेहतर होती है और फ्लीट बढ़ने के साथ लागत कम रहती है।
इन सिस्टमों को चलाने वाले लोगों के लिए इसका क्या मतलब है?
P95 कार्य लेटेंसी देखें, वह समय जिसतक 95 प्रतिशत कार्य पूरे हो गए हों, औसत सीपीयू उपयोग के बजाय। औसत उपयोग ठीक दिखता है जब तक कि क्यूज़ बना न जाएँ और उपयोगकर्ता प्रतीक्षा करने न लगें। P95 लेटेंसी उस समस्या को पहले पकड़ लेती है।
असली परिणाम देखने वाली संगठनें प्रयोग नहीं चला रही हैं। वे एजेंट्स को ऐसे वर्कफ़्लो के चारों ओर लपेट रही हैं जिनके पास पहले से स्पष्ट नियम हैं: कोड समीक्षा, रिग्रेशन टेस्टिंग (स्वचालित जाँचें कि नया सॉफ्टवेयर पुरानी सुविधाओं को तोड़ नहीं गया है), टिकट ट्रिएजिंग, और सुरक्षा ऑडिट। ये वह स्थान हैं जहाँ एजेंट्स संगठन को एक बार में सब कुछ पुनर्विचार करने की आवश्यकता के बिना मापने योग्य उत्पादकता लाभ देते हैं।
सामान्य प्रश्न
क्या मुझे एआई एजेंट्स चलाने के लिए विशेष हार्डवेयर की जरूरत है?
जरूरी नहीं। इंटेल की खोजें सुझाती हैं कि अधिक मानक सर्वर्स जोड़ना (स्केल-आउट) अधिकांश एजेंट वर्कलोड के लिए एक बहुत शक्तिशाली मशीन खरीदने से बेहतर काम करता है। विशेषज्ञ हार्डवेयर तभी विचार के लायक है जब एजेंट्स को भारी समानांतर कंप्यूटेशन की जरूरत हो या वे ऐसे तरीकों से स्थिति साझा करते हों जो उन्हें सर्वर्स में विभाजित करना अव्यावहारिक बना दे।
एआई एजेंट चैटबॉट से कैसे अलग है?
एक चैटबॉट सवालों का जवाब देता है। एक एजेंट चरणों के अनुक्रम की योजना बनाता है, डेटाबेस या कोड संकलक जैसे टूल्स का उपयोग करता है, जाँचता है कि प्रत्येक चरण काम किया या नहीं, और यदि नहीं तो पुनः प्रयास करता है। यही अतिरिक्त जटिलता है कि एजेंट्स को अच्छी तरह चलाने के लिए पूरी सिस्टम के बारे में सोचने की आवश्यकता होती है, न कि केवल इसके केंद्र में एआई मॉडल के बारे में।
क्या ये निष्कर्ष पीयर-रिव्यूड शोध हैं?
नहीं। यह काम इंटेल के अपने आंतरिक प्रयोगों से आता है और विक्रेता-प्रायोजित सामग्री के रूप में प्रकाशित किया गया था। अंतर्निहित Terminal-Bench फ्रेमवर्क ओपन-सोर्स है और स्वतंत्र समीक्षा के लिए उपलब्ध है, लेकिन विशिष्ट निष्कर्षों को स्वतंत्र रूप से प्रतिकृत नहीं किया गया है या किसी पीयर-रिव्यूड जर्नल में प्रकाशित नहीं किया गया है।



