एआई एजेंट्स तैनात करने से पहले एंटरप्राइज नेताओं को जानने योग्य पाँच बातें

इंटेल ने एजेंटिक एआई वर्कलोड पर हजारों प्रयोग चलाए और पाया कि अधिकांश संगठन गलत चीजों को मापते हैं। यहाँ देखें कि चैटबॉट्स से आगे बढ़ने पर वास्तव में क्या मायने रखता है।

AI2Day Newsdesk4 min read
A modern open-plan office interior photographed at eye level in natural daylight
Share

मुख्य बिंदु

  • इंटेल ने एजेंटिक एआई वर्कलोड प्रयोगों के हजारों चलाए ताकि यह मापा जा सके कि एआई एजेंट्स केवल एआई मॉडल प्रतिक्रियाओं के बजाय पूरे एंटरप्राइज सिस्टम में कैसे प्रदर्शन करते हैं।
  • अधिकांश मौजूदा बेंचमार्किंग टूल्स केवल अंतर्निहित एआई मॉडल के प्रदर्शन को मापते हैं, जिससे व्यापक सिस्टम चित्र पूरी तरह से छूट जाता है।
  • सही क्षमता मीट्रिक प्रति वर्चुअल सीपीयू (vCPU) एजेंट्स है, एक कंप्यूटिंग यूनिट जो सर्वर की प्रोसेसिंग पावर का एक हिस्सा दर्शाती है, न कि कुल एजेंट संख्या।
  • औसत सीपीयू उपयोग की निगरानी (कंप्यूटर का प्रोसेसर औसतन कितनी मेहनत कर रहा है) गंभीर मंदी को छिपा सकती है; टास्क लेटेंसी, किसी कार्य को पूरा करने में लगने वाला वास्तविक समय, एक बेहतर चेतावनी संकेत है।
  • एक बड़ी मशीन को अपग्रेड करने के बजाय कई सर्वर्स पर वर्कलोड्स फैलाना आमतौर पर बड़े पैमाने पर एजेंट्स चलाने का सस्ता और अधिक विश्वसनीय तरीका है।

एआई एजेंट्स सॉफ्टवेयर हैं जो बहु-चरणीय कार्यों की स्वयं योजना बना सकते हैं और उन्हें निष्पादित कर सकते हैं, जैसे बैठकें बुकिंग करना, सहायता टिकटों को प्राथमिकता देना, कोड टेस्ट चलाना, बिना किसी मानव के प्रत्येक चरण पर क्लिक किए। एंटरप्राइजेस उन पर बहुत दांव लगा रहे हैं। लेकिन इंटेल की नई खोजें बताती हैं कि अधिकांश संगठन इस समस्या को गलत तरीके से सोच रहे हैं।

इंटेल ने Terminal-Bench को विस्तारित किया, एक ओपन-सोर्स टेस्टिंग फ्रेमवर्क जिसका उपयोग एआई एजेंट्स के आचरण का मूल्यांकन करने के लिए किया जाता है, प्रोफाइलिंग टूल्स और विस्तृत टेलीमेट्री (सॉफ्टवेयर कैसे वास्तव में चल रहा है इस बारे में एकत्र किए गए डेटा) जोड़कर। टीम ने डेटाबेस क्वेरीज से लेकर वीडियो ट्रांसकोडिंग तक कई कार्यों में एजेंट्स को चलाया, फिर परिणामों को रिकॉर्ड किया।

निष्कर्षों को एंटरप्राइज प्रौद्योगिकी टीमों के लिए एक व्यावहारिक गाइड के रूप में प्रकाशित किया गया था, और मूल रूप से इंटेल से प्रायोजित सामग्री के रूप में MIT Technology Review द्वारा प्रदर्शित किए गए थे।

कंपनियाँ क्या गलत कर रही हैं?

अधिकांश टीमें एआई मॉडल को ही मापती हैं: यह कितना सटीक है, यह कितनी तेजी से प्रतिक्रिया देता है? यह वास्तविक दुनिया में एजेंट को धीमा या अविश्वसनीय बनाने वाली अधिकांश चीजों को छोड़ देता है।

एक एजेंट भाषा मॉडल से बहुत अधिक करता है। यह डेटा पढ़ता है, बाहरी टूल्स को कॉल करता है, परिणामों की जाँच करता है, और जब कुछ टूट जाता है तो पुनः प्रयास करता है। इनमें से प्रत्येक चरण समय और कंप्यूट लेता है। इंटेल ने पाया कि केवल मॉडल प्रदर्शन पर ध्यान केंद्रित करने से आपको लगभग कुछ नहीं बताया जाता है कि क्या आपका एजेंट फ्लीट वास्तविक व्यावसायिक लोड के तहत खड़ा रह सकता है।

इंटेल द्वारा अनुशंसित छह मीट्रिक्स हैं: कार्य सफलता दर, प्रति कार्य लागत, प्रति कार्य समय, कार्य थ्रूपुट (सिस्टम किसी दिए गए अवधि में कितने कार्य पूरा करता है), एजेंट घनत्व (प्रति vCPU एजेंट्स), और अंत-से-अंत लेटेंसी।

टीमों को स्केलिंग के लिए कैसे योजना बनानी चाहिए?

अपनी सिस्टम को एजेंट घनत्व द्वारा आकार दें, न कि एजेंट संख्या द्वारा। एक 8-vCPU सर्वर पर चल रहे 10 एजेंट्स लगभग 16-vCPU सर्वर पर 20 एजेंट्स के समान व्यवहार करते हैं, क्योंकि घनत्व समान है। यह एकल अंतर्दृष्टि आर्किटेक्ट्स को अलग-अलग सर्वर आकारों की उचित तुलना करने देती है।

घनत्व लक्ष्य यह भी पर निर्भर करते हैं कि एजेंट्स क्या कर रहे हैं। एजेंट्स जो कर्मचारियों से सीधे बात करते हैं उन्हें तेज प्रतिक्रिया समय चाहिए, इसलिए आप घनत्व को कम रखते हैं। पृष्ठभूमि बैच कार्य, जैसे स्वचालित आईटी वर्कफ़्लो या रात्रि कोड-टेस्टिंग रन, बिना किसी को थोड़ी देरी का पता चलने के उच्च घनत्व पर चल सकते हैं।

वर्कलोड प्रकार अनुशंसित घनत्व कारण
इंटरैक्टिव कोपायलट / उपयोगकर्ता-सामने सहायक निम्न घनत्व प्रतिक्रिया समय उपयोगकर्ताओं के लिए दृश्यमान है
बैच आईटी या टेस्टिंग वर्कफ़्लो उच्च घनत्व थोड़ी देरी स्वीकार्य है
भारी समानांतर कंप्यूट कार्य स्केल अप (अधिक शक्तिशाली सिंगल सर्वर) केंद्रीकृत प्रोसेसिंग पावर की जरूरत है
अधिकांश अन्य एंटरप्राइज वर्कलोड्स स्केल आउट (अधिक सर्वर्स) सस्ता, अधिक लचीला, बढ़ाने में आसान

स्केलिंग पर: अधिक सर्वर्स जोड़ना (स्केल-आउट) लगभग हर मानक एजेंटिक वर्कलोड के लिए एक शक्तिशाली मशीन को अपग्रेड करने (स्केल-अप) को हराता है। एजेंट्स काफी हद तक एक-दूसरे से स्वतंत्र हैं, इसलिए उन्हें मशीनों में फैलाने से उपलब्धता बेहतर होती है और फ्लीट बढ़ने के साथ लागत कम रहती है।

इन सिस्टमों को चलाने वाले लोगों के लिए इसका क्या मतलब है?

P95 कार्य लेटेंसी देखें, वह समय जिसतक 95 प्रतिशत कार्य पूरे हो गए हों, औसत सीपीयू उपयोग के बजाय। औसत उपयोग ठीक दिखता है जब तक कि क्यूज़ बना न जाएँ और उपयोगकर्ता प्रतीक्षा करने न लगें। P95 लेटेंसी उस समस्या को पहले पकड़ लेती है।

असली परिणाम देखने वाली संगठनें प्रयोग नहीं चला रही हैं। वे एजेंट्स को ऐसे वर्कफ़्लो के चारों ओर लपेट रही हैं जिनके पास पहले से स्पष्ट नियम हैं: कोड समीक्षा, रिग्रेशन टेस्टिंग (स्वचालित जाँचें कि नया सॉफ्टवेयर पुरानी सुविधाओं को तोड़ नहीं गया है), टिकट ट्रिएजिंग, और सुरक्षा ऑडिट। ये वह स्थान हैं जहाँ एजेंट्स संगठन को एक बार में सब कुछ पुनर्विचार करने की आवश्यकता के बिना मापने योग्य उत्पादकता लाभ देते हैं।

सामान्य प्रश्न

क्या मुझे एआई एजेंट्स चलाने के लिए विशेष हार्डवेयर की जरूरत है?

जरूरी नहीं। इंटेल की खोजें सुझाती हैं कि अधिक मानक सर्वर्स जोड़ना (स्केल-आउट) अधिकांश एजेंट वर्कलोड के लिए एक बहुत शक्तिशाली मशीन खरीदने से बेहतर काम करता है। विशेषज्ञ हार्डवेयर तभी विचार के लायक है जब एजेंट्स को भारी समानांतर कंप्यूटेशन की जरूरत हो या वे ऐसे तरीकों से स्थिति साझा करते हों जो उन्हें सर्वर्स में विभाजित करना अव्यावहारिक बना दे।

एआई एजेंट चैटबॉट से कैसे अलग है?

एक चैटबॉट सवालों का जवाब देता है। एक एजेंट चरणों के अनुक्रम की योजना बनाता है, डेटाबेस या कोड संकलक जैसे टूल्स का उपयोग करता है, जाँचता है कि प्रत्येक चरण काम किया या नहीं, और यदि नहीं तो पुनः प्रयास करता है। यही अतिरिक्त जटिलता है कि एजेंट्स को अच्छी तरह चलाने के लिए पूरी सिस्टम के बारे में सोचने की आवश्यकता होती है, न कि केवल इसके केंद्र में एआई मॉडल के बारे में।

क्या ये निष्कर्ष पीयर-रिव्यूड शोध हैं?

नहीं। यह काम इंटेल के अपने आंतरिक प्रयोगों से आता है और विक्रेता-प्रायोजित सामग्री के रूप में प्रकाशित किया गया था। अंतर्निहित Terminal-Bench फ्रेमवर्क ओपन-सोर्स है और स्वतंत्र समीक्षा के लिए उपलब्ध है, लेकिन विशिष्ट निष्कर्षों को स्वतंत्र रूप से प्रतिकृत नहीं किया गया है या किसी पीयर-रिव्यूड जर्नल में प्रकाशित नहीं किया गया है।

© 2026 AI2Day