आपका AI चैटबॉट खराब नहीं है। आपकी डेटा पाइपलाइन है।
एंटरप्राइज AI प्रोजेक्ट लगातार विफल हो रहे हैं, और कंपनियां AI मॉडल को दोष देती रहती हैं। सीनियर डेटा इंजीनियर नवीन अयाल्ला कहते हैं कि असली समस्या एक परत गहराई में है — उन गड़बड़ी भरी पाइपलाइनों में जो शुरुआत में ही मॉडल को डेटा फीड करती हैं।

मुख्य बिंदु
- अधिकांश एंटरप्राइज AI पायलट लाइव होने से पहले ही रुक जाते हैं, और अंतर्निहित पाइपलाइन में डेटा गुणवत्ता की समस्याएं मॉडल की सीमाओं से अधिक बार समस्या का कारण होती हैं।
- एक RAG सिस्टम, जिसका अर्थ है रिट्रीवल-ऑगमेंटेड जनरेशन, और इसका मतलब एक ऐसा सॉफ्टवेयर है जो वास्तविक व्यावसायिक डेटा को AI मॉडल के उत्तरों में खींचता है, टूटे हुए या विरोधाभासी स्रोत डेटा को अपने आप ठीक नहीं कर सकता।
- बिना सत्यापित किए गए डेटा को वेक्टर डेटाबेस में फीड करना, जो एक तरह का खोजने योग्य इंडेक्स है जिसका उपयोग AI सिस्टम कुछ देखने के लिए करते हैं, वह खराब डेटा को सीधे AI के उत्तरों में ले जाता है।
- सुरक्षा नियंत्रण को डेटा बुनियादी ढांचे में ही निर्मित किया जाना चाहिए, न कि लिखित निर्देशों के माध्यम से AI मॉडल को सौंप दिया जाना चाहिए।
- डेटा इंजीनियर कहते हैं कि विश्वसनीय डेटा पाइपलाइन बनाने की अनुशासन अब किस AI मॉडल को चुनना है, इतना ही महत्वपूर्ण है।
एंटरप्राइज कंपनियों ने पिछले दो वर्षों में AI पायलटों में लाखों डॉलर डाले हैं। उन प्रोजेक्ट्स की एक विशाल संख्या वास्तविक उपयोगकर्ताओं तक कभी नहीं पहुंची। जब कुछ गलत हो जाता है, तो पहली प्रवृत्ति AI मॉडल को दोष देना होती है: यह बहुत धीमा था, यह एक बार में पर्याप्त जानकारी संभाल नहीं सकता था, यह काफी स्मार्ट नहीं था।
नवीन अयाल्ला, एक सीनियर डेटा इंजीनियर, कहते हैं कि यह प्रवृत्ति आमतौर पर गलत होती है।
VentureBeat में लिखते हुए, अयाल्ला तर्क देते हैं कि मॉडल लगभग कभी भी मूल समस्या नहीं होता। समस्या उस डेटा में है जिसे इसमें फीड किया जा रहा है। वह पैटर्न को "क्लीनअप ट्रैप" कहते हैं: यह गलत विश्वास कि आप गड़बड़ी भरे, विरोधाभासी, खराब तरीके से संगठित व्यावसायिक डेटा को AI सिस्टम में डाल सकते हैं और उम्मीद करते हैं कि AI इसे सुलझा देगा।
यह इस तरह काम नहीं करता।
AI डेटा को स्वयं ठीक क्यों नहीं कर सकता?
यह नहीं कर सकता, क्योंकि नुकसान AI द्वारा जानकारी देखने से पहले ही हो जाता है।
कई एंटरप्राइज AI सिस्टम RAG सेटअप का उपयोग करते हैं। सामान्य शब्दों में: जब आप AI से कोई सवाल पूछते हैं, तो यह पहले आपकी कंपनी के दस्तावेजों और रिकॉर्ड का एक बड़ा इंडेक्स खोजता है, प्रासंगिक भाग निकालता है, और उन्हें अपना उत्तर बनाने के लिए उपयोग करता है। उस इंडेक्स को वेक्टर डेटाबेस कहा जाता है।
समस्या यह है कि उस इंडेक्स को बनाना अपने आप में एक डेटा कार्य है। यदि मूल व्यावसायिक डेटा में डुप्लिकेट ग्राहक रिकॉर्ड, पुरानी जानकारी, या ऐसे फील्ड हैं जिनका विभिन्न सिस्टमों में अलग-अलग अर्थ है, तो ये त्रुटियां इंडेक्स में बेक हो जाती हैं। AI फिर एक टूटे हुए इंडेक्स को खोजता है और टूटे हुए उत्तर देता है।
कोई भी चतुर प्रॉम्प्ट लेखन, यानी जो निर्देश आप AI मॉडल को देते हैं, एक भ्रष्ट इंडेक्स को ठीक नहीं करता। अयाल्ला इस बारे में सीधे हैं: "कोई भी प्रॉम्प्ट इंजीनियरिंग एक टूटी हुई इनजेशन पाइपलाइन की भरपाई नहीं कर सकती।"
परिणाम अमूर्त नहीं हैं। पुरानी या विरोधाभासी ग्राहक डेटा से काम करने वाला एक AI सहायक आत्मविश्वास से गलत उत्तर देगा। यह जानकारी को उन लोगों के सामने उजागर कर सकता है जिन्हें इसे नहीं देखना चाहिए। यह ऐसे तरीकों से अप्रत्याशित होगा जो डिबग करना मुश्किल है।
अयाल्ला की सिफारिशें व्यावहारिक हैं। डेटा को रात भर की बैच जॉब में घंटों बाद नहीं, बल्कि जैसे ही यह सिस्टम में प्रवेश करे, सत्यापित करें। स्वचालित जांच चलाएं जो असामान्य पैटर्न को पकड़ते हैं, जैसे खाली फील्ड की अचानक बाढ़, इंडेक्स को भ्रष्ट करने से पहले। और कभी भी AI मॉडल को यह तय करने के लिए न कहें कि कौन डेटा देख सकता है। वह एक्सेस कंट्रोल डेटा बुनियादी ढांचे में है, उचित इंजीनियरिंग द्वारा संभाला जाता है, न कि चैट प्रॉम्प्ट में लिखे गए निर्देशों द्वारा।
यह अंतिम बिंदु उन सभी के लिए महत्वपूर्ण है जिनकी कंपनी संवेदनशील डेटा संग्रहीत करती है। व्यक्तिगत विवरण, चिकित्सा रिकॉर्ड, वित्तीय जानकारी: यदि पंक्ति-स्तरीय सुरक्षा को AI को "इस को अनधिकृत उपयोगकर्ताओं को न दिखाएं" कहकर संभाला जाता है, तो यह एक अनुपालन जोखिम है जो एक उल्लंघन बनने का इंतजार कर रहा है।
यदि आपका संगठन AI उपकरण रोल आउट कर रहा है तो इसके लिए देखें:
- पूछें कि क्या अंतर्निहित डेटा को AI तक पहुंचने के बाद नहीं, उससे पहले सत्यापित किया गया है।
- जांचें कि एक्सेस नियंत्रण डेटा परत पर लागू किए जाते हैं, न कि केवल AI मॉडल द्वारा।
- यदि AI असंगत या आत्मविश्वास से गलत उत्तर देता है, तो मॉडल को दोष देने से पहले डेटा पाइपलाइन पर संदेह करें।



