शोधकर्ताओं को AI सुरक्षा नियमों को तोड़ने के सैकड़ों तरीके मिले, और इसकी कीमत एक डिनर से भी कम थी
एक सुरक्षा गैर-लाभकारी संस्था ने सात प्रमुख AI मॉडल के विरुद्ध एक स्वचालित उपकरण चलाया। दो बुरी तरह विफल रहे। उन्हें गलत व्यवहार करने की कीमत? मात्र $58 जितनी कम।

मुख्य बिंदु
- FAR.AI, एक कैलिफोर्निया AI सुरक्षा गैर-लाभकारी संस्था, ने 2025 में स्वचालित परीक्षण के दौरान Grok में 448 जेलब्रेक और Gemini में 249 जेलब्रेक पाए।
- Grok की सुरक्षा नियमों को तोड़ने की लागत लगभग $58 थी; Gemini की लागत लगभग $278 थी, एक अन्य AI का उपयोग करके हमले के संकेत उत्पन्न करते हुए।
- Claude, Fable, और GPT मॉडल इस परीक्षण में हर स्वचालित हमले का प्रतिरोध करते हैं, हालांकि शोधकर्ताओं का कहना है कि अधिक जटिल हमले अभी भी सफल हो सकते हैं।
- कैम्ब्रिज विश्वविद्यालय के शोधकर्ताओं को प्रमाण मिला कि Boko Haram के सदस्यों ने हिंसक हमलों की योजना बनाने में मदद के लिए प्रमुख AI चैटबॉट का उपयोग किया।
- अभी तक कोई U.S. संघीय कानून AI कंपनियों को विशिष्ट सुरक्षा मानकों को पूरा करने की आवश्यकता नहीं देता है, हालांकि कई राज्यों ने अपने स्वयं के नियम पारित करना शुरू कर दिया है।
एक लॉकस्मिथ की कल्पना करें जो एक मशीन बनाता है जो एक ताले पर हज़ारों अलग-अलग चाबियां आजमाता है, बार-बार, जब तक एक फिट न हो जाए। FAR.AI, कैलिफोर्निया में स्थित एक AI सुरक्षा गैर-लाभकारी संस्था, ने कुछ ऐसा ही बनाया, लेकिन AI चैटबॉट के लिए।
यह उपकरण एक हानिकारक सवाल के एक हजार से अधिक भिन्नताएं उत्पन्न करता है और उन्हें एक AI मॉडल पर एक-एक करके फायर करता है, उस संयोजन की तलाश में जो मॉडल के सुरक्षा फ़िल्टर से गुजर जाए। ये फ़िल्टर निर्मित सुरक्षा उपाय हैं, नियम जो एक मॉडल में बेक किए गए हैं जो इसे किसी को हथियार बनाने या हमले की योजना बनाने में मदद करने से रोकने के लिए हैं।
परिणाम कितने बुरे थे?
काफी बुरे अलर्ट बढ़ाने के लिए। FAR.AI ने चार कंपनियों के सात मॉडल का परीक्षण किया: Anthropic के Claude Opus 4.8 और Fable 5; OpenAI के GPT 5.5 और 5.6; Google के Gemini 3.1 Pro; और SpaceXAI से Grok 4.3 और 4.5। उपकरण ने प्रत्येक मॉडल को चरण-दर-चरण साइबर हमले की योजनाएं और रासायनिक या जैविक हथियारों के बारे में विवरण जैसी चीजें उत्पन्न करने के लिए प्रेरित करने का प्रयास किया।
Grok सबसे अधिक विफल रहा, 448 सफल जेलब्रेक दर्ज किए गए। Gemini 249 के साथ अनुसरण किया। Claude, Fable, और GPT मॉडल ने उन्हें फेंके गए हर प्रयास को अवरुद्ध किया।
लागत कॉलम वह है जो इसे प्रभावशाली बनाता है। स्वचालित रूप से हमले के संकेत लिखने के लिए एक दूसरे AI मॉडल का उपयोग करते हुए, FAR.AI ने गणना की कि Grok को सफलतापूर्वक जेलब्रेक करने में लगभग $58 खर्च हुए और Gemini के लिए $278। एक सप्ताहांत की किराना दौड़ से कम।
| मॉडल | पाए गए जेलब्रेक | अनुमानित लागत |
|---|---|---|
| Grok 4.3 / 4.5 | 448 | ~$58 |
| Gemini 3.1 Pro | 249 | ~$278 |
| Claude Opus 4.8 / Fable 5 | 0 | N/A |
| GPT 5.5 / 5.6 | 0 | N/A |
"अभी AI मॉडल रेस्तरांओं की तुलना में कम विनियमित हैं," FAR.AI के CEO Adam Gleave ने Wired AI से बात करते हुए कहा, जिसने पहली बार निष्कर्षों की रिपोर्ट की।
क्या साधारण लोगों को चिंतित होना चाहिए?
हां, एक संतुलित तरीके से। ये हमले कुछ तकनीकी प्रयास की आवश्यकता होती है, लेकिन लागत और कौशल बाधा गिर रही है। कैम्ब्रिज विश्वविद्यालय के एक अध्ययन ने साक्ष्य पाया कि उत्तरपूर्वी नाइजीरिया में Boko Haram के सदस्यों ने ChatGPT, Claude, Gemini, Grok, Meta AI, और DeepSeek का उपयोग हिंसक हमलों की योजना बनाने में मदद के लिए किया। यह एक सैद्धांतिक जोखिम नहीं है।
हार्वर्ड विश्वविद्यालय के कंप्यूटर वैज्ञानिक Stephen Casper ने इसे स्पष्ट रूप से कहा: AI अनुसंधान समुदाय व्यापक रूप से जैविक, साइबर, या रासायनिक नुकसान के साथ एक गंभीर दुरुपयोग घटना की अपेक्षा करता है महीनों के भीतर, वर्षों नहीं।
Google DeepMind में सुरक्षा और संरेखण के निदेशक Google के Rohin Shah ने कहा कि परिणामों को "Gemini की सुरक्षा का एक व्यापक मूल्यांकन" के रूप में व्याख्या नहीं की जानी चाहिए, यह ध्यान देते हुए कि सभी जेलब्रेक समान खतरे नहीं हैं। एक Anthropic प्रवक्ता ने आउटलेट को बताया कि निष्कर्ष सुरक्षा उपायों में निवेश को दर्शाते हैं जिन्हें कंपनी अपडेट करती रहती है। OpenAI और SpaceXAI ने टिप्पणी नहीं की।
अगला क्या होता है?
कुछ राज्य आगे बढ़ रहे हैं। कैलिफोर्निया और न्यूयॉर्क अब AI कंपनियों को सुरक्षा रिपोर्ट प्रकाशित करने की आवश्यकता रखते हैं। इलिनोइस शीघ्र ही स्वतंत्र auditors को उनकी प्रथाओं की जांच करने की आवश्यकता होगी। संघीय नियम अभी तक मौजूद नहीं हैं।
स्टैनफोर्ड कंप्यूटर वैज्ञानिक Anka Reuel ने मुख्य प्रश्न को साफ-साफ तैयार किया: "कुछ कंपनियां स्पष्ट रूप से इस रिपोर्ट में परीक्षण किए गए हमलों के कम से कम उपसमूह के विरुद्ध बचाव करने का तरीका जानती हैं। सवाल यह है कि कुछ कंपनियां उनका उपयोग कर रही हैं और अन्य नहीं हैं।"
अपने हिस्से के लिए, Gleave सावधान आशावाद के लिए एक कारण देखता है। यदि Claude और GPT ये हमलों को अवरुद्ध कर सकते हैं, तो playbook मौजूद है। समस्या यह है कि इसका पालन करना अभी भी वैकल्पिक है।
ध्यान रखने योग्य बातें: यदि आप काम पर या घर पर AI चैटबॉट का उपयोग करते हैं, तो जागरूक रहें कि सभी मॉडल समान सुरक्षा मानक के साथ निर्मित नहीं हैं। उन कंपनियों के प्लेटफॉर्म पर टिके रहें जो स्पष्ट सुरक्षा नीतियां प्रकाशित करते हैं, और किसी भी चीज की रिपोर्ट करें जो एक चैटबॉट उत्पन्न करता है जो नुकसान पहुंचाने के लिए डिजाइन किया गया हो।



