एक परफेक्ट AI कॉन्वर्सेशन फिर भी एक टूटे हुए प्रोडक्ट का संकेत दे सकती है, इंडस्ट्री लीडर्स चेतावनी देते हैं
LangChain, Conviva और CoreWeave के एक्जीक्यूटिव्स कहते हैं कि अधिकांश टीमें अपने AI एजेंटों को गलत तरीके से मापती हैं, और समाधान स्मार्ट स्कोरिंग के बजाय समय के साथ यूजर्स के ग्रुप्स की तुलना करने में है।

मुख्य बिंदु
- LangChain के CEO Harrison Chase ने VB Transform 2026 पर कहा कि कई टीमें "eval पैरालिसिस" से पीड़ित हैं और लॉन्च से पहले एक परफेक्ट टेस्ट सूट का पीछा करते हुए कभी शिप नहीं करती हैं।
- Conviva के CTO Hui Zhang ने दिखाया कि एक सिंगल AI कॉन्वर्सेशन अलग-थलग रूप में अच्छा स्कोर कर सकती है जबकि हजारों यूजर्स की तुलना बेसलाइन के साथ करने पर केवल एक कैटेगरी-वाइड समस्या दिखाई देती है।
- LangChain ने अपने स्वयं के छोटे AI मॉडल को फाइन-ट्यून किया ताकि यूजर-परसेप्शन एरर्स को Anthropic के Claude Sonnet के उपयोग की तुलना में 10 से 100 गुना कम खर्च पर पकड़ा जा सके।
- तीनों एक्जीक्यूटिव्स इस बात पर सहमत हुए कि मानवीय अनुमोदन कानूनी, वित्त और स्वास्थ्यसेवा जैसे नियंत्रित क्षेत्रों में आवश्यक रहता है, भले ही ऑटोमेटेड चेकिंग बढ़ जाती है।
एक ऐसे ग्राहक की कल्पना करें जो एक AI शॉपिंग असिस्टेंट से आधी मैराथन से पहले रनिंग शूज मांगता है। असिस्टेंट कुछ सवाल पूछता है, ग्राहक एक जोड़ी खरीदता है, और कॉन्वर्सेशन समाप्त हो जाती है। उस इंटरैक्शन को अलग-थलग रूप से स्कोर करें: यह ठीक दिखता है।
अब पूरी तस्वीर देखें। हजारों समान कॉन्वर्सेशन्स में, उस असिस्टेंट ने शू कैटेगरी के लिए सामान्य से तीन गुना अधिक स्पष्टीकरण प्रश्न पूछे। ग्राहकों ने सामान्य दर के पांच गुना अधिक चैट के बाहर अपनी खरीदारी पूरी की। कुछ स्पष्ट रूप से टूटा हुआ है। लेकिन आप इसे एक समय में एक कॉन्वर्सेशन की जांच करके कभी नहीं देखेंगे।
यह VB Transform 2026 पर का केंद्रीय तर्क था, जिसे पहले VentureBeat द्वारा रिपोर्ट किया गया था, जहां तीन AI इंफ्रास्ट्रक्चर कंपनियों के नेताओं ने वर्णन किया कि एंटरप्राइज टीमें एजेंट इवैलुएशन को कितना गलत तरीके से संभाल रही हैं।
क्या टीमें सही चीजें माप रही हैं?
अधिकांश टीमें नहीं हैं। Conviva के CTO Hui Zhang, जो एक स्ट्रीमिंग-एनालिटिक्स कंपनी है, बेहतर दृष्टिकोण को "कॉन्ट्रास्टिव एनालिसिस" कहते हैं: व्यक्तिगत चैट लॉग्स को स्कोर करने के बजाय यूजर्स के ग्रुप की तुलना ऐतिहासिक बेसलाइन के साथ करना। सिंगल स्कोर्स ठीक दिखते हैं। पॉपुलेशन पैटर्न्स वास्तविक बग को प्रकट करते हैं।
LangChain के CEO Harrison Chase ने एक दूसरा फंदा जोड़ा, वह कंपनी जो AI एजेंट्स बनाने के लिए एक लोकप्रिय फ्रेमवर्क के पीछे है (सॉफ्टवेयर जो बहु-चरणीय कार्यों को स्वतंत्र रूप से अंजाम दे सकता है)। टीमें लॉन्च से पहले व्यापक टेस्ट सूट बनाती हैं, फिर कभी शिप नहीं करती हैं।
"हम कभी-कभी ऐसी टीमें देखते हैं जिनके पास लगभग eval पैरालिसिस है," Chase ने कहा। "सर्वश्रेष्ठ टीमें लॉन्च करती हैं और फिर पुनरावृत्त करती हैं।"
उनका फ्रेमिंग: इवैलुएशन मानदंड को एक जीवंत प्रोडक्ट स्पेसिफिकेशन के रूप में मानें जो वास्तविक समस्याएं सामने आने पर अपडेट होता है, न कि एक चेकलिस्ट जिसे आप एक बार पूरा करते हैं।
CoreWeave के इंजीनियरिंग निदेशक Emmanuel Turlay ने इंजीनियरिंग के दृष्टिकोण से एक ही दीवार से टकराया। वह 100 प्रतिशत टेस्ट कवरेज का पीछा करता है और फिर भी बग्स शिप करता है। उसका समाधान: पहले व्यापक हमेशा-चालू निगरानी सेट करें, वास्तविक विफलताओं को आपको सिखाएं कि अगले कौन से टेस्ट्स लिखने हैं।
एक बार समस्या की कैटेगरी सामने आने के बाद, आपके पास एक लागत प्रश्न भी है। Turlay का नियम सबसे सक्षम AI मॉडल से शुरू करना है यह साबित करने के लिए कि कुछ हल करने योग्य है, फिर नियमित जांच के लिए सस्ते, छोटे मॉडल्स पर जाएं। LangChain ने बिल्कुल वही किया। इसने एक Qwen मॉडल (Alibaba से एक ओपन-सोर्स मॉडल फैमिली) को फाइन-ट्यून किया ताकि यह पल पकड़े जब यूजर्स को लगे कि एजेंट ने गलती की है। परिणाम Claude Sonnet की सटीकता से मेल खाता है लेकिन कीमत का एक अंश है। Chase ने नोट किया कि कुछ गार्डरेल्स को मॉडल की भी आवश्यकता नहीं है: सरल पैटर्न-मैचिंग कोड, जिसे regex कहा जाता है, लगभग-शून्य लागत पर कई जांच संभालता है।
मानवीय प्रश्न इन सभी के नीचे चलता है। Turlay ने अपने पिछले काम को एक स्व-ड्राइविंग कार कंपनी में किया: यहां तक कि टेस्टिंग साइकिल को दो हफ्तों में संपीड़ित करने के बाद, एक व्यक्ति को मॉडल को साइन ऑफ करना पड़ता था इससे पहले कि यह वाहन में जाए। मेडिकल सलाह, वित्तीय निर्णय या कानूनी दस्तावेज़ों को संभालने वाले AI एजेंट्स के लिए वही तर्क लागू होता है।
Chase और भी आगे गया, तर्क देते हुए कि मानवीय जांच केवल एक सेफ्टी नेट नहीं है। यह है कि सिस्टम कैसे सीखता है। लूप में मानवीय फीडबैक के बिना, एजेंट के पास सुधारने के लिए कुछ नहीं है।



