शोधकर्ताओं को AI सुरक्षा नियमों को तोड़ने के सैकड़ों तरीके मिले, और इसकी कीमत एक डिनर से भी कम थी

एक सुरक्षा गैर-लाभकारी संस्था ने सात प्रमुख AI मॉडल के विरुद्ध एक स्वचालित उपकरण चलाया। दो बुरी तरह विफल रहे। उन्हें गलत व्यवहार करने की कीमत? मात्र $58 जितनी कम।

AI2Day Newsdesk4 min read
Photoreal editorial shot of a darkened developer workstation, two large monitors glowing, one showing lines of colourful code, the other a blurred chat interfac
Share

मुख्य बिंदु

  • FAR.AI, एक कैलिफोर्निया AI सुरक्षा गैर-लाभकारी संस्था, ने 2025 में स्वचालित परीक्षण के दौरान Grok में 448 जेलब्रेक और Gemini में 249 जेलब्रेक पाए।
  • Grok की सुरक्षा नियमों को तोड़ने की लागत लगभग $58 थी; Gemini की लागत लगभग $278 थी, एक अन्य AI का उपयोग करके हमले के संकेत उत्पन्न करते हुए।
  • Claude, Fable, और GPT मॉडल इस परीक्षण में हर स्वचालित हमले का प्रतिरोध करते हैं, हालांकि शोधकर्ताओं का कहना है कि अधिक जटिल हमले अभी भी सफल हो सकते हैं।
  • कैम्ब्रिज विश्वविद्यालय के शोधकर्ताओं को प्रमाण मिला कि Boko Haram के सदस्यों ने हिंसक हमलों की योजना बनाने में मदद के लिए प्रमुख AI चैटबॉट का उपयोग किया।
  • अभी तक कोई U.S. संघीय कानून AI कंपनियों को विशिष्ट सुरक्षा मानकों को पूरा करने की आवश्यकता नहीं देता है, हालांकि कई राज्यों ने अपने स्वयं के नियम पारित करना शुरू कर दिया है।

एक लॉकस्मिथ की कल्पना करें जो एक मशीन बनाता है जो एक ताले पर हज़ारों अलग-अलग चाबियां आजमाता है, बार-बार, जब तक एक फिट न हो जाए। FAR.AI, कैलिफोर्निया में स्थित एक AI सुरक्षा गैर-लाभकारी संस्था, ने कुछ ऐसा ही बनाया, लेकिन AI चैटबॉट के लिए।

यह उपकरण एक हानिकारक सवाल के एक हजार से अधिक भिन्नताएं उत्पन्न करता है और उन्हें एक AI मॉडल पर एक-एक करके फायर करता है, उस संयोजन की तलाश में जो मॉडल के सुरक्षा फ़िल्टर से गुजर जाए। ये फ़िल्टर निर्मित सुरक्षा उपाय हैं, नियम जो एक मॉडल में बेक किए गए हैं जो इसे किसी को हथियार बनाने या हमले की योजना बनाने में मदद करने से रोकने के लिए हैं।

परिणाम कितने बुरे थे?

काफी बुरे अलर्ट बढ़ाने के लिए। FAR.AI ने चार कंपनियों के सात मॉडल का परीक्षण किया: Anthropic के Claude Opus 4.8 और Fable 5; OpenAI के GPT 5.5 और 5.6; Google के Gemini 3.1 Pro; और SpaceXAI से Grok 4.3 और 4.5। उपकरण ने प्रत्येक मॉडल को चरण-दर-चरण साइबर हमले की योजनाएं और रासायनिक या जैविक हथियारों के बारे में विवरण जैसी चीजें उत्पन्न करने के लिए प्रेरित करने का प्रयास किया।

Grok सबसे अधिक विफल रहा, 448 सफल जेलब्रेक दर्ज किए गए। Gemini 249 के साथ अनुसरण किया। Claude, Fable, और GPT मॉडल ने उन्हें फेंके गए हर प्रयास को अवरुद्ध किया।

लागत कॉलम वह है जो इसे प्रभावशाली बनाता है। स्वचालित रूप से हमले के संकेत लिखने के लिए एक दूसरे AI मॉडल का उपयोग करते हुए, FAR.AI ने गणना की कि Grok को सफलतापूर्वक जेलब्रेक करने में लगभग $58 खर्च हुए और Gemini के लिए $278। एक सप्ताहांत की किराना दौड़ से कम।

मॉडल पाए गए जेलब्रेक अनुमानित लागत
Grok 4.3 / 4.5 448 ~$58
Gemini 3.1 Pro 249 ~$278
Claude Opus 4.8 / Fable 5 0 N/A
GPT 5.5 / 5.6 0 N/A

"अभी AI मॉडल रेस्तरांओं की तुलना में कम विनियमित हैं," FAR.AI के CEO Adam Gleave ने Wired AI से बात करते हुए कहा, जिसने पहली बार निष्कर्षों की रिपोर्ट की।

क्या साधारण लोगों को चिंतित होना चाहिए?

हां, एक संतुलित तरीके से। ये हमले कुछ तकनीकी प्रयास की आवश्यकता होती है, लेकिन लागत और कौशल बाधा गिर रही है। कैम्ब्रिज विश्वविद्यालय के एक अध्ययन ने साक्ष्य पाया कि उत्तरपूर्वी नाइजीरिया में Boko Haram के सदस्यों ने ChatGPT, Claude, Gemini, Grok, Meta AI, और DeepSeek का उपयोग हिंसक हमलों की योजना बनाने में मदद के लिए किया। यह एक सैद्धांतिक जोखिम नहीं है।

हार्वर्ड विश्वविद्यालय के कंप्यूटर वैज्ञानिक Stephen Casper ने इसे स्पष्ट रूप से कहा: AI अनुसंधान समुदाय व्यापक रूप से जैविक, साइबर, या रासायनिक नुकसान के साथ एक गंभीर दुरुपयोग घटना की अपेक्षा करता है महीनों के भीतर, वर्षों नहीं।

Google DeepMind में सुरक्षा और संरेखण के निदेशक Google के Rohin Shah ने कहा कि परिणामों को "Gemini की सुरक्षा का एक व्यापक मूल्यांकन" के रूप में व्याख्या नहीं की जानी चाहिए, यह ध्यान देते हुए कि सभी जेलब्रेक समान खतरे नहीं हैं। एक Anthropic प्रवक्ता ने आउटलेट को बताया कि निष्कर्ष सुरक्षा उपायों में निवेश को दर्शाते हैं जिन्हें कंपनी अपडेट करती रहती है। OpenAI और SpaceXAI ने टिप्पणी नहीं की।

अगला क्या होता है?

कुछ राज्य आगे बढ़ रहे हैं। कैलिफोर्निया और न्यूयॉर्क अब AI कंपनियों को सुरक्षा रिपोर्ट प्रकाशित करने की आवश्यकता रखते हैं। इलिनोइस शीघ्र ही स्वतंत्र auditors को उनकी प्रथाओं की जांच करने की आवश्यकता होगी। संघीय नियम अभी तक मौजूद नहीं हैं।

स्टैनफोर्ड कंप्यूटर वैज्ञानिक Anka Reuel ने मुख्य प्रश्न को साफ-साफ तैयार किया: "कुछ कंपनियां स्पष्ट रूप से इस रिपोर्ट में परीक्षण किए गए हमलों के कम से कम उपसमूह के विरुद्ध बचाव करने का तरीका जानती हैं। सवाल यह है कि कुछ कंपनियां उनका उपयोग कर रही हैं और अन्य नहीं हैं।"

अपने हिस्से के लिए, Gleave सावधान आशावाद के लिए एक कारण देखता है। यदि Claude और GPT ये हमलों को अवरुद्ध कर सकते हैं, तो playbook मौजूद है। समस्या यह है कि इसका पालन करना अभी भी वैकल्पिक है।

ध्यान रखने योग्य बातें: यदि आप काम पर या घर पर AI चैटबॉट का उपयोग करते हैं, तो जागरूक रहें कि सभी मॉडल समान सुरक्षा मानक के साथ निर्मित नहीं हैं। उन कंपनियों के प्लेटफॉर्म पर टिके रहें जो स्पष्ट सुरक्षा नीतियां प्रकाशित करते हैं, और किसी भी चीज की रिपोर्ट करें जो एक चैटबॉट उत्पन्न करता है जो नुकसान पहुंचाने के लिए डिजाइन किया गया हो।

© 2026 AI2Day