Apple शोधकर्ताओं को एक छिपी हुई खामी मिली जो AI-जनित छवियों को चुप्पे से खराब कर सकती है

छोटे रogue डेटा बिंदु, जिन्हें outlier tokens कहा जाता है, Diffusion नामक डिज़ाइन पर बनी AI छवि निर्माण प्रणालियों को गड़बड़ा सकते हैं। नया शोध बताता है कि वे क्या हैं और उन्हें कैसे ठीक किया जाए।

AI2Day Newsdesk3 min read
A sleek, modern corporate security operations room photographed from a low angle looking toward a large curved desk with multiple dark monitors displaying abstr
Share

मुख्य बिंदु

  • Apple ML Research ने Diffusion Transformers ज्ञात डिज़ाइन पर बनी AI छवि-निर्माण प्रणालियों में outlier tokens नामक एक विशिष्ट खामी की पहचान की है।
  • ये outlier tokens सिस्टम के दोनों भागों में दिखाई देते हैं - जो छवियों को पढ़ता है और जो नई छवियां बनाता है।
  • समस्या AI मॉडल की मध्य परतों में सबसे गंभीर है, ये इनपुट और अंतिम आउटपुट के बीच की प्रक्रिया के चरण हैं।
  • अगर इसे अनियंत्रित छोड़ा जाए, तो outlier tokens मॉडल का ध्यान गलत जगहों पर खींच सकते हैं, जिससे उत्पन्न छवियों की गुणवत्ता और सटीकता कम हो जाती है।

एक कक्षा की कल्पना करें जहां एक बहुत जोर से बोलने वाला छात्र हर पाठ में बाधा डालता रहता है। भले ही वह छात्र कभी कुछ उपयोगी न कहे, बाकी की पूरी कक्षा अभी भी उसकी ओर देखती है। AI प्रणालियों के अंदर कुछ बिल्कुल ऐसा ही होता है जो पाठ संकेतों से छवियां उत्पन्न करती हैं।

Apple ML Research के शोधकर्ताओं ने इस समस्या की विस्तार से पहचान की है। परेशानी पैदा करने वाले outlier tokens कहलाते हैं। इस संदर्भ में एक token, जानकारी का एक छोटा टुकड़ा है जिसे AI प्रक्रिया करता है, जो किसी वाक्य में शब्द के समान है, लेकिन छवियों के लिए। एक outlier token वह है जो असामान्य रूप से बड़ा संख्यात्मक मान रखता है, जिससे यह वास्तव में होने से कहीं अधिक महत्वपूर्ण प्रतीत होता है।

वास्तव में क्या गलत हो जाता है?

Outlier tokens ध्यान आकर्षित करते हैं। AI उन्हें प्रसंस्करण शक्ति देता है भले ही वे निर्मित की जा रही छवि के बारे में बहुत कम वास्तविक जानकारी रखते हैं।

शोध Diffusion Transformers, या DiTs नामक मॉडल के एक वर्ग पर केंद्रित है। ये आज के कई सर्वोत्तम AI छवि जनरेटर को शक्ति प्रदान करते हैं। ये दो मुख्य चरणों में काम करते हैं। पहले, एक encoder (मॉडल के पढ़ने के चश्मे के रूप में सोचें) वास्तविक छवि को एक सुव्यवस्थित गणितीय विवरण में परिवर्तित करता है। फिर एक denoiser (रचनात्मक इंजन) उस विवरण द्वारा निर्देशित, शोर से धीरे-धीरे एक नई छवि बनाता है।

Apple टीम को पता चला कि outlier tokens दोनों चरणों में परेशानी पैदा करते हैं। पहले से प्रशिक्षित encoders denoiser को शुरू होने से पहले विकृत प्रतिनिधित्व दे सकते हैं। और denoiser स्वयं, विशेष रूप से अपनी मध्य परतों के गहरे अंदर प्रसंस्करण करते समय, अपने स्वयं के outlier tokens विकसित कर सकता है।

क्या यह उन छवियों को प्रभावित करता है जो लोग वास्तव में उपयोग करते हैं?

संभवतः हां, हालांकि यह पत्र एक शिप किए गए उत्पाद की खामी के बजाय एक शोध निष्कर्ष का वर्णन करता है।

जब मॉडल का ध्यान अर्थहीन tokens की ओर खींचा जाता है, तो अंतिम छवि उपयोगकर्ता द्वारा मांगी गई चीज़ से भटक सकती है। विवरण छोड़े जाते हैं। सुसंगतता प्रभावित होती है। जितना जटिल संकेत, उतना अधिक अवसर outlier tokens को समस्याएं पैदा करने का।

अच्छी खबर: शोधकर्ताओं ने इन outliers को दबाने के तरीकों का भी अध्ययन किया। उनका काम व्यावहारिक सुधार की ओर इशारा करता है जिन्हें भविष्य के मॉडल में शामिल किया जा सकता है।

आज AI छवि उपकरण का उपयोग करने वाले किसी के लिए, इस शोध के लिए कोई कार्रवाई की आवश्यकता नहीं है। यह आधारभूत स्तर पर है, इस तरह का निष्कर्ष जिसे इंजीनियर उपकरणों की अगली पीढ़ी बनाने के लिए उपयोग करते हैं।

आगे क्या होगा?

शोध एक प्रारंभिक, अन्वेषणात्मक चरण में है। कोई उत्पाद परिवर्तन या सार्वजनिक मॉडल अपडेट की घोषणा नहीं की गई है।

जो इस कार्य को महत्वपूर्ण बनाता है वह यह है कि यह AI मॉडल के एक पुराने वर्ग (छवि पहचान में उपयोग किए जाने वाले Vision Transformers) से एक ज्ञात समस्या को छवि निर्माण की नई दुनिया में लाता है। शोधकर्ताओं ने पहचान मॉडल में outlier tokens को पहले देखा था, लेकिन अब तक उनकी भूमिका जनरेटिव सिस्टम में काफी हद तक अनुसंधित रही है।

बीमारी का ध्यानपूर्वक अध्ययन करना इसे ठीक करने से पहले आवश्यक पहला कदम है।

सामान्य प्रश्न

क्या यह मेरे द्वारा पहले से उपयोग किए जाने वाले AI छवि उपकरणों को प्रभावित करेगा?

सीधे या तुरंत नहीं। यह आधारभूत शोध है, उत्पाद अपडेट नहीं। ये निष्कर्ष संभवतः यह प्रभावित करेंगे कि भविष्य की छवि-निर्माण प्रणालियों को कैसे डिज़ाइन और प्रशिक्षित किया जाए।

सादी भाषा में Diffusion Transformer क्या है?

यह एक प्रकार की AI संरचना, या आंतरिक संरचना है, जिसका उपयोग कई आधुनिक छवि-निर्माण उपकरणों द्वारा किया जाता है। यह यादृच्छिक शोर से शुरू करके और इसे आपके पाठ संकेत द्वारा निर्देशित, एक सुसंगत छवि में आकार देकर काम करता है।

© 2026 AI2Day