एक परफेक्ट AI कॉन्वर्सेशन फिर भी एक टूटे हुए प्रोडक्ट का संकेत दे सकती है, इंडस्ट्री लीडर्स चेतावनी देते हैं

LangChain, Conviva और CoreWeave के एक्जीक्यूटिव्स कहते हैं कि अधिकांश टीमें अपने AI एजेंटों को गलत तरीके से मापती हैं, और समाधान स्मार्ट स्कोरिंग के बजाय समय के साथ यूजर्स के ग्रुप्स की तुलना करने में है।

AI2Day Newsdesk· 3 min read
A wide 16:9 editorial photograph of a large modern stock trading floor seen from above, screens and monitors displaying falling red graph lines and percentage n
Share

मुख्य बिंदु

  • LangChain के CEO Harrison Chase ने VB Transform 2026 पर कहा कि कई टीमें "eval पैरालिसिस" से पीड़ित हैं और लॉन्च से पहले एक परफेक्ट टेस्ट सूट का पीछा करते हुए कभी शिप नहीं करती हैं।
  • Conviva के CTO Hui Zhang ने दिखाया कि एक सिंगल AI कॉन्वर्सेशन अलग-थलग रूप में अच्छा स्कोर कर सकती है जबकि हजारों यूजर्स की तुलना बेसलाइन के साथ करने पर केवल एक कैटेगरी-वाइड समस्या दिखाई देती है।
  • LangChain ने अपने स्वयं के छोटे AI मॉडल को फाइन-ट्यून किया ताकि यूजर-परसेप्शन एरर्स को Anthropic के Claude Sonnet के उपयोग की तुलना में 10 से 100 गुना कम खर्च पर पकड़ा जा सके।
  • तीनों एक्जीक्यूटिव्स इस बात पर सहमत हुए कि मानवीय अनुमोदन कानूनी, वित्त और स्वास्थ्यसेवा जैसे नियंत्रित क्षेत्रों में आवश्यक रहता है, भले ही ऑटोमेटेड चेकिंग बढ़ जाती है।

एक ऐसे ग्राहक की कल्पना करें जो एक AI शॉपिंग असिस्टेंट से आधी मैराथन से पहले रनिंग शूज मांगता है। असिस्टेंट कुछ सवाल पूछता है, ग्राहक एक जोड़ी खरीदता है, और कॉन्वर्सेशन समाप्त हो जाती है। उस इंटरैक्शन को अलग-थलग रूप से स्कोर करें: यह ठीक दिखता है।

अब पूरी तस्वीर देखें। हजारों समान कॉन्वर्सेशन्स में, उस असिस्टेंट ने शू कैटेगरी के लिए सामान्य से तीन गुना अधिक स्पष्टीकरण प्रश्न पूछे। ग्राहकों ने सामान्य दर के पांच गुना अधिक चैट के बाहर अपनी खरीदारी पूरी की। कुछ स्पष्ट रूप से टूटा हुआ है। लेकिन आप इसे एक समय में एक कॉन्वर्सेशन की जांच करके कभी नहीं देखेंगे।

यह VB Transform 2026 पर का केंद्रीय तर्क था, जिसे पहले VentureBeat द्वारा रिपोर्ट किया गया था, जहां तीन AI इंफ्रास्ट्रक्चर कंपनियों के नेताओं ने वर्णन किया कि एंटरप्राइज टीमें एजेंट इवैलुएशन को कितना गलत तरीके से संभाल रही हैं।

क्या टीमें सही चीजें माप रही हैं?

अधिकांश टीमें नहीं हैं। Conviva के CTO Hui Zhang, जो एक स्ट्रीमिंग-एनालिटिक्स कंपनी है, बेहतर दृष्टिकोण को "कॉन्ट्रास्टिव एनालिसिस" कहते हैं: व्यक्तिगत चैट लॉग्स को स्कोर करने के बजाय यूजर्स के ग्रुप की तुलना ऐतिहासिक बेसलाइन के साथ करना। सिंगल स्कोर्स ठीक दिखते हैं। पॉपुलेशन पैटर्न्स वास्तविक बग को प्रकट करते हैं।

LangChain के CEO Harrison Chase ने एक दूसरा फंदा जोड़ा, वह कंपनी जो AI एजेंट्स बनाने के लिए एक लोकप्रिय फ्रेमवर्क के पीछे है (सॉफ्टवेयर जो बहु-चरणीय कार्यों को स्वतंत्र रूप से अंजाम दे सकता है)। टीमें लॉन्च से पहले व्यापक टेस्ट सूट बनाती हैं, फिर कभी शिप नहीं करती हैं।

"हम कभी-कभी ऐसी टीमें देखते हैं जिनके पास लगभग eval पैरालिसिस है," Chase ने कहा। "सर्वश्रेष्ठ टीमें लॉन्च करती हैं और फिर पुनरावृत्त करती हैं।"

उनका फ्रेमिंग: इवैलुएशन मानदंड को एक जीवंत प्रोडक्ट स्पेसिफिकेशन के रूप में मानें जो वास्तविक समस्याएं सामने आने पर अपडेट होता है, न कि एक चेकलिस्ट जिसे आप एक बार पूरा करते हैं।

CoreWeave के इंजीनियरिंग निदेशक Emmanuel Turlay ने इंजीनियरिंग के दृष्टिकोण से एक ही दीवार से टकराया। वह 100 प्रतिशत टेस्ट कवरेज का पीछा करता है और फिर भी बग्स शिप करता है। उसका समाधान: पहले व्यापक हमेशा-चालू निगरानी सेट करें, वास्तविक विफलताओं को आपको सिखाएं कि अगले कौन से टेस्ट्स लिखने हैं।

एक बार समस्या की कैटेगरी सामने आने के बाद, आपके पास एक लागत प्रश्न भी है। Turlay का नियम सबसे सक्षम AI मॉडल से शुरू करना है यह साबित करने के लिए कि कुछ हल करने योग्य है, फिर नियमित जांच के लिए सस्ते, छोटे मॉडल्स पर जाएं। LangChain ने बिल्कुल वही किया। इसने एक Qwen मॉडल (Alibaba से एक ओपन-सोर्स मॉडल फैमिली) को फाइन-ट्यून किया ताकि यह पल पकड़े जब यूजर्स को लगे कि एजेंट ने गलती की है। परिणाम Claude Sonnet की सटीकता से मेल खाता है लेकिन कीमत का एक अंश है। Chase ने नोट किया कि कुछ गार्डरेल्स को मॉडल की भी आवश्यकता नहीं है: सरल पैटर्न-मैचिंग कोड, जिसे regex कहा जाता है, लगभग-शून्य लागत पर कई जांच संभालता है।

मानवीय प्रश्न इन सभी के नीचे चलता है। Turlay ने अपने पिछले काम को एक स्व-ड्राइविंग कार कंपनी में किया: यहां तक कि टेस्टिंग साइकिल को दो हफ्तों में संपीड़ित करने के बाद, एक व्यक्ति को मॉडल को साइन ऑफ करना पड़ता था इससे पहले कि यह वाहन में जाए। मेडिकल सलाह, वित्तीय निर्णय या कानूनी दस्तावेज़ों को संभालने वाले AI एजेंट्स के लिए वही तर्क लागू होता है।

Chase और भी आगे गया, तर्क देते हुए कि मानवीय जांच केवल एक सेफ्टी नेट नहीं है। यह है कि सिस्टम कैसे सीखता है। लूप में मानवीय फीडबैक के बिना, एजेंट के पास सुधारने के लिए कुछ नहीं है।

© 2026 AI2Day