आपके AI डेटा मैप की एक छिपी हुई परत है। शोधकर्ता इसका उपयोग करना चाहते हैं।
Apple ML Research के एक अध्ययन से पता चलता है कि डेटा को व्यवस्थित करते समय AI टूल्स चुप-चाप जो संरचना बनाते हैं, वह शोधकर्ताओं द्वारा आमतौर पर देखे जाने वाले सुंदर चार्ट की तुलना में कहीं अधिक जानकारी प्रकट कर सकती है।

मुख्य बिंदु
- Apple ML Research ने एक अध्ययन प्रकाशित किया जो दर्शाता है कि एक लोकप्रिय डेटा-विज़ुअलाइज़ेशन टूल के अंदर एक छिपी हुई आंतरिक संरचना में अनुपयोगी विश्लेषणात्मक मूल्य है।
- इस संरचना को k-nearest-neighbor ग्राफ कहा जाता है, जो डेटा बिंदुओं के बीच संबंधों को उस समय से पहले कैप्चर करती है जब चार्ट बनाने के दौरान विकृति आती है।
- इस संरचना पर लागू तीन मानक ग्राफ एल्गोरिदम प्रतिनिधि उदाहरणों की पहचान कर सकते हैं, घने क्लस्टर खोज सकते हैं, और आउटलायर्स को स्पॉट कर सकते हैं।
- ये निष्कर्ष इस टूल का उपयोग करने वाले किसी भी क्षेत्र पर व्यापक रूप से लागू होते हैं, जीनोमिक्स से लेकर व्यावसायिक विश्लेषण तक।
जब डेटा वैज्ञानिक एक विशाल डेटासेट को समझना चाहते हैं, तो वे अक्सर UMAP नामक एक टूल की ओर रुख करते हैं (उच्चारण "यू-मैप"), जिसका मतलब Uniform Manifold Approximation and Projection है। UMAP को एक ऐसी मशीन के रूप में सोचें जो हजारों डेटा बिंदुओं को एक मुश्किल से समझा जाने वाली, बहु-आयामी जगह से लेकर एक 2D स्कैटर प्लॉट में दबाती है जिसे आपकी आंखें वास्तव में समझ सकती हैं।
वह चार्ट वास्तव में उपयोगी है। लेकिन नए शोध तर्क देते हैं कि हम सबसे मूल्यवान भाग को फेंक रहे हैं।
वह छिपी हुई संरचना क्या है जिसे सभी अनदेखा कर रहे हैं?
UMAP अपना चार्ट बनाने से पहले, चुप-चाप यह मानचित्र बनाता है कि कौन से डेटा बिंदु एक-दूसरे के करीब हैं। वह मानचित्र एक k-nearest-neighbor ग्राफ है, कनेक्शन का एक जाल जो दर्शाता है कि बिंदु A बिंदु B, C, और D से निकटता से संबंधित है, बिंदु B अन्य से, और इसी तरह पूरे डेटासेट में।
जो 2D चार्ट लोग वास्तव में उपयोग करते हैं वह उस जाल का एक संपीड़ित, विकृत संस्करण है। दूरियां संपीड़ित और खींची जाती हैं। कुछ संबंध पूरी तरह से गायब हो जाते हैं।
वह मूल जाल, अभी भी टूल की मेमोरी में बैठा है, उन संबंधों को विश्वास के साथ संरक्षित करता है। Apple ML Research कहता है कि लगभग कोई भी इसे नहीं देखता है।
आप वास्तव में इसके साथ क्या कर सकते हैं?
शोधकर्ताओं ने तीन प्रसिद्ध ग्राफ एल्गोरिदम, नेटवर्क विज्ञान से उधार लिए गए उपकरण, सामाजिक नेटवर्क और सड़क प्रणालियों का अध्ययन करने के लिए उपयोग की जाने वाली उसी अनुशासन पर इस छिपी हुई संरचना पर परीक्षण किया।
| एल्गोरिदम | यह क्या करता है | व्यावहारिक परिणाम |
|---|---|---|
| PageRank | प्रत्येक बिंदु को स्कोर करता है कि इसके कितने महत्वपूर्ण पड़ोसी हैं | डेटा में सबसे प्रतिनिधि उदाहरणों को सामने लाता है |
| k-core decomposition | ढीले से जुड़े बिंदुओं को परत दर परत हटाता है | सबसे घने, सबसे कसकर क्लस्टर किए गए समूहों को उजागर करता है |
| आउटलायर डिटेक्शन | ऐसे बिंदुओं को खोजता है जिनके पास असामान्य रूप से कम या कमजोर कनेक्शन हैं | दुर्लभ या विसंगत मामलों को फ्लैग करता है |
PageRank, जिन्हें शुरुआती Google याद है, उसे वेब पेजों को रैंक करने के लिए Google द्वारा उपयोग किए जाने वाले मूल सूत्र के लिए किया गया था। यहां लागू किया गया, यह डेटा बिंदुओं को खोजता है जो एक क्लस्टर का सबसे अच्छी तरह प्रतिनिधित्व करते हैं, यदि आपको किसी सहकर्मी को दिखाने या किसी अन्य मॉडल को प्रशिक्षित करने के लिए हजार में से एक उदाहरण चुनना है तो उपयोगी है।
इसके बीच k-core decomposition, केवल क्लस्टर ढूंढता नहीं है। यह उनकी आंतरिक संरचना को दर्शाता है, कौन से भाग कस्टम कोर हैं और कौन से ढीले किनारे हैं।
एक गैर-डेटा-वैज्ञानिक को इससे क्यों परवाह करनी चाहिए?
ये तकनीकें चिकित्सा रिकॉर्ड, ग्राहक व्यवहार, वित्तीय लेनदेन और वैज्ञानिक अनुसंधान की खोज के लिए उपयोग किए जाने वाले टूल्स के अंदर बैठती हैं। बेहतर क्लस्टर डिटेक्शन का मतलब स्वच्छ श्रेणियां हैं। बेहतर आउटलायर स्पॉटिंग का मतलब असामान्य मामले, एक दुर्लभ बीमारी प्रस्तुति, एक संदिग्ध लेनदेन, फ्लैग किए जाते हैं न कि दबाए जाते हैं।
उल्लेख करने योग्य पकड़: यह एक शोध पत्र है, उत्पाद अपडेट नहीं। आपकी कंपनी के विश्लेषकों और वैज्ञानिकों को इन विचारों को लागू करना होगा। उस चरण में समय और कौशल लगता है।
सावधानी का एक उचित शब्द, बहुत। पेपर प्रदर्शन डेटासेट पर क्या संभव है यह दर्शाता है। वास्तविक दुनिया के परिणाम डेटा गुणवत्ता और टूल को कितनी सावधानी से ट्यून किया जाता है, इस पर भारी निर्भर हैं।
ईमानदार निष्कर्ष: यदि आप किसी ऐसे व्यक्ति के साथ काम करते हैं जो डेटा की खोज के लिए UMAP का उपयोग करता है, तो उनसे पूछें कि क्या वे kNN ग्राफ को भी देख रहे हैं। उत्तर लगभग निश्चित रूप से नहीं है, और यह बदलने के लायक हो सकता है।



