शोधकर्ताओं ने AI के 'छिपे हुए विचारों' को पढ़ने का तरीका खोजा, और यह वास्तविक सुरक्षा प्रश्न उठाता है

कंप्यूटर वैज्ञानिकों की एक टीम ने गुप्त तर्क को तोड़ा जो शीर्ष AI मॉडल को बंद रखते हैं। उन्होंने जो पाया उसमें लीक किए गए पासवर्ड और एक चीनी AI कंपनी के बारे में कुछ शर्मनाक सवाल शामिल हैं।

AI2Day Newsdesk5 min read
Full-frame edge-to-edge photoreal news-editorial image of a sleek matte-black padlock resting on a softly glowing computer keyboard, cool blue and teal rim ligh
Share

मुख्य बिंदु

  • ट्यूबिंगन विश्वविद्यालय के शोधकर्ताओं और सहयोगियों ने OpenAI, Anthropic और Google द्वारा निर्मित प्रमुख AI मॉडलों से छिपी हुई तर्क चरणों को निकालने के लिए एक विधि खोजी।
  • एक ही तकनीक ने निजी डेटा को उजागर किया, जैसे पासवर्ड और API कुंजी, जो एक मॉडल की तर्क प्रक्रिया के अंदर संग्रहीत हैं, हालांकि तीनों कंपनियों ने तब से उस विशिष्ट खामी को ठीक कर दिया है।
  • Moonshot AI द्वारा बनाया गया एक चीनी मॉडल Kimi K3, Claude Opus 4.8 और GPT 5.6 Sol से छिपे हुए आउटपुट के समान तर्क पैटर्न तैयार करता है, जिससे यह सवाल उठता है कि क्या इन मॉडलों की नकल करके इसे प्रशिक्षित किया गया था।
  • शोधकर्ता सावधानी से कहते हैं कि समानता सुझावपूर्ण है, नकल का निर्णायक प्रमाण नहीं।
  • गहरी समस्या को पूरी तरह ठीक करने के लिए इन कंपनियों के प्रोग्रामिंग इंटरफेस के तरीके में बड़े बदलाव की आवश्यकता होगी।

प्रत्येक उन्नत AI मॉडल के पास एक प्रकार की आंतरिक एकालाप है। इससे पहले कि यह आपको एक उत्तर दे, यह समस्या को चरण दर चरण हल करता है जिसे शोधकर्ता "विचार की श्रृंखला" कहते हैं, एक लिखी हुई तर्क प्रक्रिया जो मॉडल कठिन समस्याओं को हल करने के लिए उपयोग करता है। कंपनियां इस तर्क को छिपाती हैं। यह व्यावसायिक रूप से संवेदनशील है, और इसे खुले तौर पर साझा करने से प्रतिद्वंद्वियों के लिए नकल करना आसान हो जाएगा।

अब कंप्यूटर वैज्ञानिकों की एक टीम ने इन छिपे हुए विचारों को पढ़ने का तरीका खोज लिया है।

Wired AI द्वारा रिपोर्ट की गई यह तकनीक ट्यूबिंगन विश्वविद्यालय, मैक्स प्लैंक इंस्टीट्यूट, AI सुरक्षा संस्थान MATS Research और सुरक्षा कंपनी Snyk के शोधकर्ताओं से आती है। उनकी मुख्य अंतर्दृष्टि अपनी सरलता में लगभग सुरुचिपूर्ण है।

यह हमला वास्तव में कैसे काम करता है?

AI कंपनियां आम तौर पर अपने मॉडल कई आकारों में प्रदान करती हैं। एक बड़ा मॉडल शक्तिशाली है लेकिन चलाने के लिए महंगा है; एक ही मॉडल का एक छोटा संस्करण कम खर्च करता है। दोनों संस्करण एक ही अंतर्निहित संरचना साझा करते हैं, जिसका अर्थ है कि वे उनके बीच पारित एन्क्रिप्ट किए गए डेटा को डिकोड करने की समान क्षमता साझा करते हैं।

जब आप एक API (एक आवेदन प्रोग्रामिंग इंटरफेस, डिजिटल कनेक्शन जो सॉफ्टवेयर को एक दूसरे से बात करने देता है) के माध्यम से एक बड़े AI मॉडल का उपयोग करते हैं, तो मॉडल अपने तर्क की एक एन्क्रिप्ट की गई प्रति आपके कंप्यूटर को भेजता है। शोधकर्ताओं ने खोज की कि इस एन्क्रिप्ट किए गए तर्क को एक छोटे, सस्ते भाई मॉडल को खिलाने से इसे अनलॉक किया जा सकता है।

छोटा मॉडल कहां सहयोग करता है जहां बड़ा मॉडल नहीं करता? छोटे मॉडल को कम "संरेखण प्रशिक्षण" मिलता है, वह प्रक्रिया जो AI को नियमों का पालन करना और शर्मनाक अनुरोधों से इनकार करना सिखाती है। उस सुरक्षा को हटाएं, और मॉडल अपने काम को दिखाने के लिए बहुत अधिक इच्छुक है।

"कमजोर संरेखण के साथ एक कमजोर मॉडल वेरिएंट पर संदेशों को स्वैप करने का विचार, जिसके पास एक ही डिक्रिप्शन कुंजी है लेकिन कमजोर संरेखण है, बहुत अच्छा है," ETH ज्यूरिख के कंप्यूटर सुरक्षा विशेषज्ञ फ्लोरियन ट्रैमर ने कहा।

उन्होंने अंदर क्या पाया?

दो चीजें, और वे गंभीरता में काफी अलग हैं।

पहली: पासवर्ड और API कुंजी। यदि आपने कभी इनमें से किसी एक AI सेवा का उपयोग करते समय किसी संकेत में संवेदनशील क्रेडेंशियल्स पेस्ट किए हैं, तो वह जानकारी मॉडल के तर्क ट्रेस के अंदर समाप्त हो सकती है। शोधकर्ताओं ने इसे निकाला। OpenAI, Anthropic और Google को सभी को पिछले महीने सचेत किया गया था, और प्रत्येक ने इस विशिष्ट रिसाव को अवरुद्ध करने के लिए अपनी प्रणालियों को अपडेट किया है। यदि आपने पैच से पहले इनमें से किसी भी सेवा का उपयोग किया है, तो आप किसी भी API कुंजी या पासवर्ड को घुमाने के लायक हैं जिन्हें आपने संकेत में शामिल किया हो सकता है।

दूसरा: नकल का सवाल। शोधकर्ताओं ने कई AI मॉडलों को 90 सवाल दिए, फिर कुछ खुले-वजन मॉडलों (स्वतंत्र रूप से डाउनलोड करने योग्य AI मॉडल जो कोई भी चला सकता है) को बड़े मालिकाना मॉडलों से कैप्चर किए गए तर्क ट्रेस के उद्घाटन शब्द दिए। Moonshot AI द्वारा बनाया गया एक मॉडल Kimi K3 ने तर्क उत्पन्न किया जो Claude Opus 4.8 और GPT 5.6 Sol के छिपे हुए आउटपुट के समान लग रहा था। दो अन्य परीक्षण किए गए मॉडल, जिनमें चीन के DeepSeek और US-निर्मित Inkling शामिल हैं, ने एक ही पैटर्न नहीं दिखाया।

शोधकर्ता इसका अर्थ कहना सावधानी से हैं। उनके पेपर में कहा गया है कि निष्कर्ष "कारणात्मक रूप से आसवन स्थापित नहीं कर सकते", मतलब उन्होंने नकल होने साबित नहीं किया है। आसवन AI विकास में एक व्यापक रूप से उपयोग की जाने वाली तकनीक है जहां एक नया, छोटा मॉडल एक बड़े के आउटपुट का अध्ययन करके सीखता है। यह सामान्य अभ्यास है। विवाद यह है कि क्या चीनी कंपनियों ने इसे अनुमति के बिना US मॉडलों की नकल करने के लिए उपयोग किया।

क्या साधारण उपयोगकर्ताओं को अभी चिंता करनी चाहिए?

पासवर्ड-रिसाव खामी पैच की जाती है। यह सबसे तत्काल व्यावहारिक चिंता है, और यह संभाली जाती है।

व्यापक मुद्दा, कि छिपे हुए तर्क को पैच के बाद भी आंशिक रूप से निकाला जा सकता है, बना रहता है। इसे पूरी तरह ठीक करने के लिए इन कंपनियों को अपने API के काम करने के तरीके को जमीन से फिर से डिजाइन करना होगा। ट्यूबिंगन विश्वविद्यालय के शोधकर्ता Alexander Panfilov, जिन्होंने काम का नेतृत्व किया, कहते हैं कि गहरी कमजोरी बनी रहती है।

अभी के लिए, एक सरल नियम लागू होता है: किसी भी AI चैटबॉट या उपकरण में पासवर्ड, व्यक्तिगत विवरण, या संवेदनशील व्यावसायिक जानकारी को पेस्ट न करें। वह सलाह हमेशा समझदारी भरी थी। यह शोध इसे थोड़ा अधिक तत्काल महसूस कराता है।

सामान्य प्रश्न

यदि मैं ChatGPT, Claude या Gemini का उपयोग करता हूं तो क्या मेरा डेटा जोखिम में है?

विशिष्ट खामी जो पासवर्ड और API कुंजी को उजागर कर सकती है, सभी तीन कंपनियों द्वारा पैच की जाती है। आगे जाते हुए, AI संकेत में संवेदनशील जानकारी को शामिल करने से बचें, क्योंकि AI सेवाएं बाहरी सर्वर पर आपके इनपुट को प्रोसेस करती हैं।

आसवन क्या है, और क्या यह अवैध है?

आसवन एक तकनीक है जहां एक नया AI मॉडल एक मौजूदा के आउटपुट का अध्ययन करके सीखता है, अनिवार्य रूप से एक स्मार्टर मॉडल को शिक्षक के रूप में उपयोग करता है। यह व्यापक रूप से उपयोग किया जाता है और अधिकांश संदर्भों में कानूनी है, हालांकि इसे अनुमति के बिना किसी प्रतिद्वंद्वी के मालिकाना मॉडल की नकल करने के लिए उपयोग करना सेवा की शर्तों का उल्लंघन कर सकता है या बौद्धिक संपत्ति के प्रश्न उठा सकता है।

© 2026 AI2Day