एआई विजन सिस्टम अपने सामने जो कुछ है उसे क्यों नहीं देख पाते

Apple ML Research के पास एक नया टूल है जो ऑब्जेक्ट डिटेक्शन में एआई की गलतियों के पीछे छिपे हुए पैटर्न को खोजता है, और इसके निष्कर्ष उन सभी लोगों के लिए महत्वपूर्ण हैं जो एआई पर चीजों को देखने के लिए निर्भर करते हैं।

AI2Day Newsdesk3 min read
A timeline of cybersecurity evolution over 20 years, featuring AI and cloud icons
Share

मुख्य बिंदु

  • Apple ML Research ने GH-ESD नामक एक नया तरीका प्रकाशित किया है जो एआई विजन सिस्टम में व्यवस्थित रूप से अंधे धब्बे खोजता है।
  • वर्तमान एआई विजन टूल इस तरह से विफल होते हैं जिसे मौजूदा परीक्षण विश्वसनीय रूप से पकड़ नहीं सकते, विशेष रूप से ऑब्जेक्ट डिटेक्शन और इमेज सेगमेंटेशन कार्यों में।
  • GH-ESD "एरर स्लाइस" को लक्षित करता है, छवियों के विशिष्ट समूह जहां एआई लगातार खराब प्रदर्शन करता है, बजाय यादृच्छिक एकबारी गलतियों के।
  • जो विफलताएं यह पाता है वे अक्सर स्थानिक संबंधों और दृश्य संदर्भ से जुड़ी होती हैं, केवल किसी वस्तु के अलग-थलग दिखने से नहीं।

जब एक एआई विजन सिस्टम, जो तरह का सॉफ़्टवेयर तस्वीरों या वीडियो में वस्तुओं की पहचान करता है, कोई गलती करता है, तो यह शायद ही कभी एक यादृच्छिक दुर्घटना होती है। अक्सर एक ही सिस्टम एक ही तरह की छवि पर बार-बार विफल होता है, बिना किसी को पता चले। शोधकर्ता इन दोहराए जाने वाले विफलता पैटर्न को "एरर स्लाइस" कहते हैं।

Apple ML Research ने GH-ESD (Grounded Hypothesis-Driven Error Slice Discovery) नामक एक नया दृष्टिकोण प्रकाशित किया है, जिसे उन स्लाइसों को स्वचालित रूप से खोजने के लिए डिज़ाइन किया गया है।

यह सामान्य लोगों के लिए क्यों मायने रखता है?

एआई विजन सिस्टम पहले से ही वास्तविक निर्णय ले रहे हैं। वे चिकित्सा स्कैन की जांच करते हैं, कारखाने की पंक्तियों में वस्तुओं को फ्लैग करते हैं, और स्व-चालित कार कैमरों को शक्ति देते हैं। किसी भी उपकरण में व्यवस्थित अंधा धब्बा एक मामूली परेशानी नहीं है।

यदि कोई सिस्टम कम-विपरीतता प्रकाश में पैदल चलने वालों को लगातार मिस करता है, या किसी विशिष्ट पृष्ठभूमि के पास दिखाई देने वाली किसी खामी को फ्लैग करने में विफल रहता है, तो वह पैटर्न समस्या है। एक गलत उत्तर बुरी किस्मत जैसा दिखता है। एक ही स्थिति में सौ गलत उत्तर एक डिज़ाइन खामी जैसा दिखता है।

पुराने तरीकों में क्या गलत था?

एरर स्लाइस खोजने के लिए पिछले टूल सरल इमेज क्लासिफिकेशन के लिए अच्छी तरह से काम करते थे, यह तय करना कि क्या कोई तस्वीर बिल्ली या कुत्ता दिखाती है। उन्होंने विफलताओं को समान दिखने वाली छवियों के समूह के रूप में, या पूर्वनिर्धारित लेबल के संयोजन के रूप में मानते थे।

यह दृष्टिकोण कठिन कार्यों के लिए टूट जाता है: ऑब्जेक्ट डिटेक्शन, जहां सिस्टम को दृश्य में प्रत्येक वस्तु के चारों ओर एक बॉक्स खींचना चाहिए, और सेगमेंटेशन, जहां इसे हर वस्तु की सटीक रूपरेखा का पता लगाना चाहिए। उन कार्यों में, कोई चीज़ कहां एक फ्रेम में बैठती है, और इसके चारों ओर क्या है, यह तय करता है कि एआई इसे सही समझता है या नहीं। एक सरल क्लस्टर-आधारित विधि यह नहीं पकड़ सकती।

GH-ESD वास्तव में क्या करता है?

विधि विफलताओं के होने के कारणों के बारे में विशिष्ट, सादे-भाषा की परिकल्पनाएं उत्पन्न करती है, फिर प्रत्येक को वास्तविक डेटा के विरुद्ध परीक्षण करती है कि कौन से पैटर्न सही हैं। इसे एक संरचित डीबगिंग प्रक्रिया के रूप में सोचें: अनुमान लगाने के बजाय, यह प्रस्तावित करता है "यह सिस्टम संघर्ष कर सकता है जब एक छोटी वस्तु किसी अन्य वस्तु द्वारा आंशिक रूप से छिपी हो" और फिर जांचता है कि यह वास्तव में सच है या नहीं।

क्योंकि यह संपूर्ण छवियों की बजाय व्यक्तिगत उदाहरणों के स्तर पर काम करता है, यह स्थानिक संदर्भ और दृश्य में वस्तुओं के बीच संबंधों से संबंधित विफलताओं को सामने ला सकता है।

इसके बाद क्या होता है?

GH-ESD अभी के लिए एक शोध विधि है, न कि एक शिपिंग उत्पाद। इसका तत्काल दर्शक वे इंजीनियर हैं जो विजन सिस्टम बनाते और ऑडिट करते हैं। लेकिन शोधकर्ता जो उपकरण आज विकसित करते हैं वे कुछ वर्षों में तैनात किए गए उत्पादों तक पहुंचने वाली सुरक्षा जांचों को आकार देते हैं।

किसी भी ऐसे व्यक्ति के लिए जिसका काम या सुरक्षा एक एआई विजन सिस्टम पर निर्भर करती है, मुख्य निष्कर्ष सीधा है: पूछें कि किस तरह की व्यवस्थित परीक्षा की गई है। एक-बारी सटीकता स्कोर दोहराए जाने वाली विफलताओं को छिपा सकते हैं जो केवल विशिष्ट, वास्तविक-दुनिया की स्थितियों में दिखाई देती हैं।

सामान्य प्रश्न

एरर स्लाइस क्या है?

एरर स्लाइस छवियों या स्थितियों का एक विशिष्ट समूह है जहां एक एआई सिस्टम लगातार गलत उत्तर प्राप्त करता है, केवल कभी-कभी नहीं बल्कि एक पैटर्न के रूप में जो उन मामलों में साझा किसी चीज़ से जुड़ा है।

क्या यह आज मेरे द्वारा उपयोग किए जाने वाले एआई टूल को प्रभावित करता है?

अप्रत्यक्ष रूप से, हां। आज उपयोग में आने वाले अधिकांश एआई विजन टूल उन विधियों से परीक्षण किए गए थे जो इन संदर्भ-निर्भर विफलताओं को नहीं पकड़ सकते हैं। यह शोध बेहतर ऑडिटिंग मानकों की ओर धकेलता है।

क्या GH-ESD उपयोग के लिए उपलब्ध है?

यह Apple ML Research की एक प्रकाशित शोध विधि है, जिसे अन्य शोधकर्ताओं और इंजीनियरों द्वारा निर्मित किया जा सकता है, न कि एक उपभोक्ता टूल जिसे आप आज डाउनलोड कर सकते हैं।

© 2026 AI2Day