AI ने 6,080 पैच के अध्ययन में केवल 26% बार सुरक्षा खामियों को सही ढंग से ठीक किया
1Password ने दो प्रमुख AI मॉडलों का परीक्षण वास्तविक सॉफ़्टवेयर खामियों पर किया और पाया कि अधिकांश पैच ठीक लगते थे लेकिन नहीं थे। यह आपके द्वारा हर दिन उपयोग किए जाने वाले सॉफ़्टवेयर के लिए क्या मायने रखता है।

मुख्य बिंदु
- 1Password ने 6,080 AI-जनित सुरक्षा पैचों का परीक्षण किया और पाया कि केवल 26% ने अनियोजित दुष्प्रभावों के बिना खामी को ठीक किया।
- ChatGPT-5.5 और Claude Opus 4.8 दोनों ने जब असुरक्षा जटिल थी तो 53.9% मामलों में छिपी-खामी वाले पैच तैयार किए।
- लगभग आधे पैच, 49.3%, कम से कम एक पथ खुला छोड़ते हैं जिसका हमलावर अभी भी दुरुपयोग कर सकता है।
- प्रत्येक पैच प्रयास की लागत $2.11 से $2.81 के बीच थी, लेकिन यह सत्यापित करना कि क्या सुधार सुरक्षित है, इसके शीर्ष पर विशेषज्ञ मानव समय की आवश्यकता है।
- Anthropic, Claude के पीछे की कंपनी, ने 1Password को बताया कि मानव विशेषज्ञों को वर्तमान AI क्षमता स्तरों पर अंतिम मंजूरी देने वाले के रूप में रहना चाहिए।
1Password, पासवर्ड-प्रबंधन कंपनी जिसे अधिकांश लोग अपने फोन से जानते हैं, इस सप्ताह एक निराशाजनक खोज के साथ एक अध्ययन प्रकाशित किया: AI उपकरण जो सुरक्षा खामियों को ठीक करने का दावा करते हैं उन्हें विश्वसनीय रूप से ठीक नहीं कर रहे हैं। जैसा कि ThreatVectr द्वारा पहली बार रिपोर्ट किया गया, अनुसंधान दो व्यापक रूप से उपयोग किए जाने वाले AI मॉडलों द्वारा उत्पन्न 6,080 पैचों को छह वास्तविक, हाल ही में प्रकट सॉफ़्टवेयर असुरक्षाओं के विरुद्ध चलाता है।
सुर्खी संख्या 26% है। यह पैचों का हिस्सा है जो समस्या को स्वच्छ रूप से हल करते हैं, कोई छिपी हुई क्षति नहीं।
अन्य 74% के साथ वास्तव में क्या गलत हुआ?
इनमें से अधिकांश पैच सतह पर ठीक लगते थे। वे संकलित हुए (अर्थात् कंप्यूटर ने कोड स्वीकार किया), बुनियादी परीक्षण पास किए, और कोई स्पष्ट त्रुटि नहीं दिखी। समस्या अंदर दफन थी।
शोधकर्ताओं ने इस श्रेणी के खराब आउटपुट को FLAWED नाम दिया, जो Fix-Like Artifacts With Embedded Defects का संक्षिप्त रूप है। लेबल फिट बैठता है: कोड स्वस्थ दिखता है लेकिन एक छिपी हुई कमजोरी रखता है।
शोधकर्ता Keith Hoodlet ने एक स्पष्ट उदाहरण दिया। जब दोनों AI मॉडलों ने Spring AI में एक खामी से निपटा, एक सॉफ़्टवेयर ढांचा जो डेवलपर्स AI-संचालित अनुप्रयोग बनाने के लिए उपयोग करते हैं, उन्होंने परीक्षण में उपयोग किए गए विशिष्ट हमलावर वर्णों को फ़िल्टर किया। थोड़े अलग वर्णों का उपयोग करने वाला हमलावर सीधे उसी पुराने छेद के माध्यम से जा सकता है। शुरुआत में आशाजनक पैचों का एक तिहाई से अधिक बिल्कुल इसी तरह से नाजुक था।
बाकी विफलताओं के लिए संख्याएं इस तरह टूटती हैं:
| परिणाम | पैचों का हिस्सा |
|---|---|
| स्वच्छ रूप से ठीक किया, कोई दुष्प्रभाव नहीं | 26.0% |
| कम से कम एक हमला पथ खुला छोड़ा | 49.3% |
| जटिल खामियों में छिपी खामियां | 53.9% |
| मूल खामी को ठीक किया, एक नई जोड़ी | 2.3% |
| मूल को ठीक करने में विफल और एक नई खामी जोड़ी | 2.2% |
क्या आपको आज उपयोग करने वाले ऐप्स के बारे में चिंता करनी चाहिए?
तुरंत नहीं, लेकिन आपको पता होना चाहिए कि सॉफ़्टवेयर कंपनियां सुरक्षा सुधार जल्दी जहाज करने के लिए निरंतर दबाव में हैं, और AI उपकरण तेजी से इस प्रक्रिया का हिस्सा बन रहे हैं।
यदि उन AI पैचों को सावधानीपूर्वक मानव समीक्षा को छोड़ दिया जाता है, तो सुधार जो आपके फोन या लैपटॉप पर आता है वह आपकी वास्तव में सुरक्षा नहीं कर सकता है। कोड पैच किया हुआ लगता है। यह नहीं हो सकता है।
Anthropic की स्थिति स्पष्ट है: मानव डोमेन विशेषज्ञों को अंतिम समीक्षकर्ता के रूप में रहना चाहिए। अधिकांश पेशेवर सुरक्षा विश्लेषक पहले से ही AI आउटपुट को एक पहला मसौदा मानते हैं, एक समाप्त उत्पाद नहीं। वह आदत अब और अधिक महत्वपूर्ण है।
लागत भी चित्र का एक हिस्सा है। प्रत्येक पैच चक्र ChatGPT-5.5 के साथ लगभग $2.11 और Claude Opus 4.8 के साथ $2.81 चलाता है। प्रति प्रयास सस्ता। लेकिन Hoodlet की बात यह है कि वास्तविक लागत यह सत्यापित करने के लिए आवश्यक कुशल मानव समय है कि क्या कोई दिया गया पैच वास्तव में जहाज करने के लिए सुरक्षित है। वह समय केवल इसलिए गायब नहीं होता है क्योंकि एक मशीन ने कोड लिखा है।
एक ईमानदार निष्कर्ष: यदि आप सॉफ़्टवेयर का प्रबंधन करते हैं या IT में काम करते हैं, तो प्रत्येक AI-जनित सुरक्षा पैच को उसी तरह व्यवहार करें जैसे आप एक जूनियर डेवलपर के पहले पुल अनुरोध को करेंगे। इसे पढ़ें। इसे ठीक से परीक्षण करें। मशीन तेज़ है, लेकिन तेज़ सही के समान नहीं है।



