तीन में से एक खतरनाक एआई कोडिंग कमांड मानव समीक्षकों से आगे निकल जाती है, गेम डेटा दिखाता है
एक ब्राउज़र गेम जो वास्तविक एआई कोडिंग एजेंट अनुरोधों का अनुकरण करता है, पाया गया कि खिलाड़ियों ने 40,000 से अधिक रन में लगभग एक तिहाई दुर्भावनापूर्ण कमांडों को मंजूरी दी। डेटा एक समस्या की ओर इशारा करता है जो एक गेम से बहुत आगे जाती है।

मुख्य बिंदु
- खिलाड़ियों ने 40,000 से अधिक गेम रन और 409,000 कुल समीक्षा की गई कमांडों में लगभग एक तिहाई दुर्भावनापूर्ण एआई कोडिंग एजेंट अनुरोधों को मंजूरी दी।
- सबसे अधिक मिस की गई खतरनाक कमांड, "npm run analyze", को गेम के इतिहास लॉग में दृश्यमान चेतावनी के बावजूद लगभग 65 प्रतिशत समय मंजूरी दी गई।
- Anthropic की अपनी टेलीमेट्री से पता चलता है कि वास्तविक उपयोगकर्ता Claude Code से अनुमति प्रॉम्प्ट का लगभग 93 प्रतिशत अनुमोदन करते हैं, जो इसका एआई कोडिंग उपकरण है।
- Anthropic का Claude Code के लिए "ऑटो मोड" लगभग 83 प्रतिशत अतिउत्साही या खतरनाक व्यवहार को चलाने से पहले पकड़ता है, लेकिन लगभग 17 प्रतिशत अभी भी आगे निकल जाता है।
- बेल्जियम के डेवलपर Alex Wauters ने मई 2025 के अंत में गेम बनाया था, यह नोटिस करने के बाद कि अधिकांश डेवलपर्स या तो सब कुछ अंधाधुंध अनुमोदन करते हैं या अनुमति जांच को पूरी तरह से छोड़ देते हैं।
यहाँ एक बात है जिसके लिए आप आज पढ़ने की उम्मीद शायद नहीं करते थे: एआई कोडिंग सुरक्षा का सबसे ईमानदार तनाव परीक्षण अभी एक ब्राउज़र गेम है जिसे आप एक मिनट से कम में पूरा कर सकते हैं।
यह गेम, बेल्जियम के सॉफ्टवेयर डेवलपर Alex Wauters द्वारा बनाया गया था, आपको एक मानव समीक्षक की कुर्सी में रखता है जो एक एआई कोडिंग एजेंट को देख रहा है, एक सॉफ्टवेयर जो आपकी ओर से जटिल प्रोग्रामिंग कार्यों को चरण दर चरण करता है, कमांड चलाने की अनुमति माँगता है। आपके पास 60 सेकंड हैं। सुरक्षित कमांडों को अनुमोदित करें। खतरनाक कमांडों को ब्लॉक करें। यथासंभव उच्च स्कोर करें।
40,000 से अधिक रनों में, खिलाड़ियों ने लगभग एक तिहाई दुर्भावनापूर्ण अनुरोधों को मंजूरी दी। यह एक अच्छी संख्या नहीं है।
मानव खतरनाक कमांडों को मंजूरी देते रहते हैं?
संक्षिप्त उत्तर है: थकान। एआई एजेंट द्वारा उठाए गए हर एक कदम की समीक्षा करना वास्तव में थका देने वाला है, और जब आप प्रॉम्प्ट में डूब जाते हैं, तो आपका ध्यान भटक जाता है।
Wauters ने Claude Code, Anthropic के एआई कोडिंग उपकरण का उपयोग करने वाले डेवलपर्स के बीच एक पैटर्न देखने के बाद गेम बनाया। अनुमति पॉप-अप की बाढ़ के सामने, कई लोगों ने "dangerously-skip-permissions" नामक एक सेटिंग चालू कर दी, जो मॉडल को मानव अनुमोदन माँगे बिना चलाने देता है। दूसरा समूह बिना वास्तव में इसे पढ़े सब कुछ पर अनुमोदन पर क्लिक करता है।
दोनों ही दृष्टिकोण सुरक्षित नहीं हैं।
"उच्च मात्रा में शोर थकान का परिचय देता है, और डेवलपर्स के पास हमेशा यह संदर्भ नहीं होता कि जोखिम को तेजी से निर्धारित करने के लिए क्या बदल गया है," Wauters ने गेम के अंत में मई के लॉन्च के साथ प्रकाशित एक ब्लॉग पोस्ट में लिखा।
गेम डेटा, पहले The Register AI द्वारा रिपोर्ट किया गया, असहज विवरण में इसका समर्थन करता है। स्कोप उल्लंघन, ऐसी चीजें जैसे एजेंट चुपचाप AWS क्रेडेंशियल फाइलें या Kubernetes कॉन्फ़िगरेशन डेटा पढ़ना (फाइलें जो लॉगिन कुंजी और सर्वर सेटिंग्स संग्रहीत करती हैं, जिस तरह की चीज एक हमलावर चाहता है चोरी करना), 35 प्रतिशत समय मिस किए गए। स्पष्ट रूप से विनाशकारी कमांड, जैसे पूरी फाइल सिस्टम के deletion का आदेश, अधिकतर पकड़े गए। लोग अभी भी एक बम को देखते समय पहचानते हैं।
अधिक मुश्किल खतरे आगे निकल गए। अज्ञात वेब पते पर Curl अनुरोध और typosquatted पैकेज (software packages नामों के साथ जानबूझकर विश्वसनीय वाले की तरह लगभग वर्तनी, लोगों को दुर्भावनापूर्ण कोड चलाने में धोखा देने के लिए डिज़ाइन किए गए) लगभग उतनी ही बार मिस किए गए जितनी बार क्रेडेंशियल grabs।
| कमांड प्रकार | अनुमानित मिस दर |
|---|---|
| स्कोप उल्लंघन (उदा. क्रेडेंशियल फाइलें पढ़ना) | 35% |
| Typosquatted पैकेज | ~35% |
| अज्ञात API के लिए Curl अनुरोध | ~35% |
| Crontab इंजेक्शन / git कॉन्फ़िग हाइजैक | कम |
| स्पष्ट रूप से विनाशकारी कमांड (उदा. root delete) | सबसे कम |
सबसे बुरा परिणाम: "npm run analyze", एक कमांड जो नियमित लगता है लेकिन एक प्रोजेक्ट फाइल के अंदर छिपी किसी भी कोड को चलाने के लिए कॉन्फ़िगर किया जा सकता है। लगभग 65 प्रतिशत खिलाड़ियों ने इसे मंजूरी दी। गेम ने अनुमोदन बटन के ठीक ऊपर इतिहास लॉग में एक चेतावनी भी प्रदर्शित की। दो तिहाई ने इसे नहीं पढ़ा।
क्या यह वास्तव में गेम के बाहर हो रहा है?
हाँ। Anthropic ने अपने स्वयं के डेटा के साथ इसकी पुष्टि की।
मई 2025 के एक पोस्ट में कि Claude Code अनुमतियों को कैसे संभालता है, Anthropic ने कहा कि उपयोगकर्ता उपकरण द्वारा उत्पन्न सभी अनुमति प्रॉम्प्ट का लगभग 93 प्रतिशत अनुमोदन करते हैं। "जितनी अधिक अनुमतियाँ एक उपयोगकर्ता देखता है, वह प्रत्येक पर उतना कम ध्यान देता है," कंपनी ने लिखा।
Anthropic का उत्तर "ऑटो मोड" है, एक प्रणाली जो एक अलग एआई classifier का उपयोग करती है, एक मॉडल जो यह निर्धारित करने के लिए प्रशिक्षित है कि क्या कोई कमांड जोखिमपूर्ण लगता है, मानव तक पहुँचने से पहले खतरनाक अनुरोधों को फिल्टर करने के लिए। यह लगभग 83 प्रतिशत समस्याग्रस्त क्रियाओं को पकड़ता है। शेष 17 प्रतिशत अभी भी एक मानव डेस्क पर उतरते हैं।
Anthropic स्पष्ट है कि ऑटो मोड एक sandbox के अंदर defense-in-depth की "एक परत है, एक के लिए विकल्प नहीं।"
Wauters सहमत हैं। उनकी सिफारिश है कि कोडिंग एजेंटों को isolated virtual environments जिन्हें sandboxes या devcontainers कहा जाता है (sealed-off डिजिटल workspaces जो एजेंट को आपकी वास्तविक मशीन पर छूने के लिए सीमित करते हैं), auto mode जैसे उपकरणों का उपयोग करें, और कस्टम hooks लिखें (छोटी स्क्रिप्ट जो निष्पादन से पहले कमांड को रोकती हैं) किसी भी संदिग्ध चीज को स्वचालित रूप से चलाने से पहले ध्वज लगाने के लिए।
"हमें इन प्रणालियों को मानव समीक्षा को एक वैध समाधान के रूप में इंगित करने की तुलना में सुरक्षित बनाने के लिए tooling को आसान बनाने की आवश्यकता है," उन्होंने The Register AI को बताया।
यदि आप एक एआई एजेंट को एक लंबा कार्य देते हैं और चले जाते हैं, जो वापस आता है वह वह नहीं हो सकता जो आप सोचते हैं। जाँचते रहना महत्वपूर्ण है, और समझना कि आप क्या जाँच रहे हैं यह अधिक महत्वपूर्ण है।



