साइबर सुरक्षा

आंतरिक सुरक्षा स्विच जो एक स्वायत्त साइबर हमले को विफल कर देता है

जानें कि कैसे ट्रेसबिट कॉन्टेक्स्ट बम और प्रतिबंधित विषयों का उपयोग दुर्भावनापूर्ण एआई हैकिंग एजेंटों को उनके अपने आंतरिक सुरक्षा गार्डरेल को ट्रिगर करके क्रैश करने के लिए करता है।
आंतरिक सुरक्षा स्विच जो एक स्वायत्त साइबर हमले को विफल कर देता है

मैंने पिछले हफ्ते एक रेड टीम अभ्यास के लॉग की समीक्षा करते हुए एक देर रात बिताई, जिसने एक मालिकाना LLM कार्यान्वयन को लक्षित किया था। हमलावर ने मानक इनपुट फिल्टर को बायपास करने के लिए प्रॉम्प्ट इंजेक्शन की एक परिष्कृत श्रृंखला का उपयोग किया। यह एक आर्किटेक्चरल विरोधाभास का एक किताबी मामला था। संगठन ने परिधि सुरक्षा (perimeter defenses) और डेटा हानि रोकथाम उपकरणों पर एक भाग्य खर्च किया था, फिर भी पूरा सिस्टम ढह गया क्योंकि मॉडल बहुत अधिक सहायक था। यह वर्तमान खतरे के परिदृश्य की वास्तविकता है। हम अपने डिजिटल साम्राज्यों की चाबियों के साथ स्वायत्त एजेंटों को तैनात कर रहे हैं, और हम पा रहे हैं कि पारंपरिक फायरवॉल अक्सर अप्रासंगिक होते हैं।

लंदन स्थित सुरक्षा फर्म ट्रेसबिट (Tracebit) का एक नया दृष्टिकोण बताता है कि एआई हमलावर के खिलाफ सबसे प्रभावी बचाव एआई ही है। यह तकनीक एक सरल अवलोकन पर निर्भर करती है। प्रत्येक प्रमुख एआई मॉडल में हार्डकोडेड नियमों का एक सेट होता है जो इसे विशिष्ट विषयों पर चर्चा करने से रोकता है। यदि आप एक एआई हैकर को एक निषिद्ध विषय पढ़ने के लिए मजबूर करते हैं, तो वह रुक जाता है। इसे 'कॉन्टेक्स्ट बम' (context bomb) कहा जाता है।

आठ मिनट का चेतावनी अंतराल

यह क्यों महत्वपूर्ण है, इसे समझने के लिए हमें यह देखना होगा कि एक स्वचालित हमला कितनी तेजी से आगे बढ़ता है। मई में, ट्रेसबिट ने दस प्रमुख एआई मॉडलों से जुड़ा एक अध्ययन प्रकाशित किया। शोधकर्ताओं ने इन मॉडलों को एक नकली कंपनी नेटवर्क दिया और उन्हें सेंध लगाने के लिए कहा। नेटवर्क में वास्तविक कमजोरियां और 'कैनरी' (canaries) के रूप में जाने जाने वाले डिकॉय क्रेडेंशियल शामिल थे। ये कैनरी सुरक्षा स्टैक में एक मानक उपकरण हैं। जब कोई हैकर कैनरी को छूता है, तो सिस्टम एक अलर्ट ट्रिगर करता है।

कैनरी ने काम किया। उन्होंने 95.9% हमले के प्रयासों में रक्षकों को चेतावनी दी। हालांकि, डेटा ने प्रतिक्रिया समय के साथ एक महत्वपूर्ण समस्या का खुलासा किया। कैनरी अलर्ट और एआई द्वारा एडमिन एक्सेस तक पहुंचने के बीच का औसत समय आठ मिनट था। मानव-नेतृत्व वाले उल्लंघनों की दुनिया में, आठ मिनट एक उपहार है। प्रकाश की गति से संचालित होने वाली मशीन के खिलाफ, आठ मिनट एक राउंडिंग एरर है। एक सुरक्षा संचालन केंद्र (SOC) विश्लेषक उस विंडो में मुश्किल से एक टिकट खोल सकता है और अलर्ट के स्रोत को सत्यापित कर सकता है। जब तक कोई मानव हस्तक्षेप करता है, एआई पहले ही डेटा निकाल चुका होता है या एक स्थायी पैर जमा चुका होता है।

हमलावर के खिलाफ प्रॉम्प्ट इंजेक्शन का उपयोग करना

प्रॉम्प्ट इंजेक्शन आमतौर पर दुर्भावनापूर्ण पक्ष के लिए एक हथियार होता है। इसमें डेटा में निर्देश छिपाना शामिल है ताकि एआई अपने मूल प्रोग्रामिंग के बजाय उन निर्देशों का पालन करे। आप एक बायोडाटा में एक कमांड छिपा सकते हैं जो एक स्वचालित भर्ती उपकरण को अन्य सभी उम्मीदवारों को अनदेखा करने के लिए कहता है। ट्रेसबिट ने रक्षा के लिए इसी तंत्र का उपयोग करने का निर्णय लिया। उन्होंने नकली रहस्यों और डेटाबेस प्रविष्टियों के अंदर टेक्स्ट के छोटे टुकड़े रखे। टेक्स्ट के ये टुकड़े एक एआई हमलावर को उस विषय की ओर धकेलने के लिए डिज़ाइन किए गए हैं जिसे उसके अपने सुरक्षा नियम प्रतिबंधित करते हैं।

यह एआई सुरक्षा में विशिष्ट शक्ति गतिशीलता का उलटफेर है। आमतौर पर, डेवलपर्स हैकर्स को एआई को बुरा बनने के लिए धोखा देने से रोकने के लिए संघर्ष करते हैं। यह तकनीक एआई को 'बहुत अच्छा' बनने के लिए धोखा देती है। जब एआई एजेंट एक डेटाबेस को स्कैन करता है और जैविक हथियारों या संवेदनशील राजनीतिक घटनाओं के बारे में टेक्स्ट की एक स्ट्रिंग का सामना करता है, तो सुरक्षा गार्डरेल सक्रिय हो जाते हैं। मॉडल प्रोसेसिंग बंद कर देता है। स्वायत्त हमला स्क्रिप्ट एक ऐसी दीवार से टकराती है जिसे वह कोड या तर्क के साथ बायपास नहीं कर सकती क्योंकि प्रतिबंध मॉडल के वेट (weights) और सुरक्षा प्रशिक्षण में रचा-बसा है।

प्रयोगशाला के परिणाम

ट्रेसबिट ने पांच प्रमुख मॉडलों के खिलाफ इस सिद्धांत का परीक्षण किया: Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro, और Kimi K2.6। परिणाम तत्काल थे। कॉन्टेक्स्ट बम जोड़ने से पहले, ये मॉडल 57% रनों में एडमिन एक्सेस तक पहुँच गए। शोधकर्ताओं द्वारा निषिद्ध विषयों को रखने के बाद, वह सफलता दर गिरकर 5% रह गई। सबसे प्रभावशाली परिणाम Opus 4.8 से आया, जो समूह में सबसे सक्षम हमलावर था। कॉन्टेक्स्ट बम के बिना, यह 93% समय एडमिन एक्सेस तक पहुँच गया। बम के साथ, यह हर एक प्रयास में विफल रहा।

यह सुरक्षा मेट्रिक्स में एक महत्वपूर्ण बदलाव है। एक पूर्ण समझौता तब होता है जब एक हमलावर एडमिन एक्सेस प्राप्त करता है और एक स्थायी पकड़ सुरक्षित करता है। यह प्रारंभिक परीक्षणों के 36% में हुआ। कॉन्टेक्स्ट बम के साथ, यह केवल 1% में हुआ। यह रक्षक को वह एक चीज प्रदान करता है जिसकी उन्हें सबसे अधिक आवश्यकता होती है: समय। हमला केवल अलार्म ट्रिगर नहीं करता है; यह शारीरिक रूप से प्रक्रिया को रोकता है। आठ मिनट की खिड़की एक अनिश्चितकालीन देरी बन जाती है क्योंकि एआई उस कार्य के साथ आगे बढ़ने से इनकार कर देता है जिसमें निषिद्ध डेटा पढ़ना आवश्यक है।

भाषाई गार्डरेल का लचीलापन

कोई यह मान सकता है कि एक हमलावर इन प्रतिबंधों को अनदेखा करने के लिए अपने मॉडल को फिर से प्रशिक्षित कर सकता है। यह ओपन-सोर्स मॉडलों के लिए संभव है, लेकिन उद्यम-ग्रेड सिस्टम के लिए यह बहुत कठिन है जिसका उपयोग अधिकांश संगठन करते हैं। क्लाउड (Claude) या जेमिनी (Gemini) जैसे मॉडलों में सुरक्षा लीवर सरल बग नहीं हैं। वे जानबूझकर किए गए डिजाइन विकल्प हैं। डेवलपर्स यह सुनिश्चित करने के लिए 'Reinforcement Learning from Human Feedback' पर लाखों डॉलर खर्च करते हैं कि ये मॉडल हानिकारक सामग्री उत्पन्न न करें। इन प्रतिबंधों को हटाने के लिए अक्सर मॉडल के पूर्ण पुनर्प्रशिक्षण की आवश्यकता होती है, जो एक बड़ी तकनीकी और वित्तीय बाधा है।

इसके अलावा, इनमें से कई प्रतिबंध नियामक कारणों से अनिवार्य हैं। एक चीनी निर्मित एआई मॉडल को स्थानीय कानूनों के अनुपालन में रहने के लिए कुछ राजनीतिक विषयों को अनदेखा करना चाहिए। एक पश्चिमी मॉडल को भारी दायित्व से बचने के लिए रासायनिक हथियारों के निर्माण में सहायता करने से इनकार करना चाहिए। ये ऐसी विशेषताएं नहीं हैं जिन्हें एक डेवलपर किसी विशिष्ट उपयोगकर्ता के लिए आसानी से अक्षम कर सके। वे मॉडल की मूल पहचान का हिस्सा हैं। इन विषयों को हमलावर के रास्ते में रखकर, हम मॉडल की अपनी कानूनी और नैतिक बाधाओं को एक भौतिक बाधा के रूप में उपयोग कर रहे हैं।

सुरक्षा रणनीति में कॉन्टेक्स्ट बम को एकीकृत करना

यह तकनीक पारंपरिक सुरक्षा की आवश्यकता को प्रतिस्थापित नहीं करती है। कॉन्टेक्स्ट बम एक प्रतिक्रियाशील उपाय है। यह केवल तभी काम करता है जब हमलावर पहले से ही नेटवर्क के अंदर हो और डेटा के लिए स्कैन कर रहा हो। यही कारण है कि 'कैनरी टोकन' के साथ एकीकरण आवश्यक है। कैनरी वह संकेत प्रदान करता है कि उल्लंघन हुआ है। कॉन्टेक्स्ट बम वह घर्षण प्रदान करता है जो उल्लंघन को आगे बढ़ने से रोकता है।

जोखिम के दृष्टिकोण से, यह 'डिफेंस-इन-डेप्थ' का एक उत्कृष्ट उदाहरण है। हम एक एकल किले की खाई के विचार से हटकर एक ऐसी प्रणाली की ओर बढ़ रहे हैं जहाँ डेटा स्वयं हमलावर के लिए विषाक्त है। यदि कोई स्वायत्त एजेंट क्रैश हुए बिना आपके डेटा को नहीं पढ़ सकता है, तो डेटा स्वाभाविक रूप से अधिक सुरक्षित है। यह दृष्टिकोण सुनिश्चित करता है कि एआई इच्छानुसार सिस्टम में हेरफेर या एक्सेस नहीं कर सकता है, जिससे सीआईए ट्रायड (CIA triad) के अखंडता और उपलब्धता घटकों का समाधान होता है।

मशीन गति युग की वास्तविकता

हम एक ऐसे युग में प्रवेश कर रहे हैं जहाँ साइबर हमले अब मानवीय बुद्धि की लड़ाई नहीं रह गए हैं। वे एल्गोरिदम की लड़ाई हैं। इस वातावरण में, मानवीय प्रतिक्रिया समय हमारी रक्षा की सबसे कमजोर कड़ी है। हम एक SOC टीम से एआई के साथ प्रतिस्पर्धा करने की उम्मीद नहीं कर सकते जो सेकंड में एक हजार कमजोरियों को स्कैन कर सकती है। हमें स्वायत्त सुरक्षा की आवश्यकता है जो खतरे की गति से मेल खा सके। कॉन्टेक्स्ट बम पहले वास्तव में मशीन-स्पीड सुरक्षा उपकरणों में से एक है। यह हमले के समान स्तर पर काम करता है और इसे बेअसर करने के लिए उसी अंतर्निहित तकनीक का उपयोग करता है।

मैंने कई सुरक्षा रुझानों को आते और जाते देखा है, लेकिन यह अलग लगता है क्योंकि यह LLMs की अंतर्निहित प्रकृति को स्वीकार करता है। वे भाषाई इंजन हैं। वे भाषा के नियमों और उनके रचनाकारों के सुरक्षा संरेखण द्वारा शासित होते हैं। उन संरेखणों को ढाल के रूप में उपयोग करना अधिक लचीले डिजिटल बुनियादी ढांचे की ओर एक सक्रिय कदम है। यह एक दुर्लभ मामला है जहाँ एक प्रणालीगत भेद्यता—एआई की अपने इनपुट से आसानी से भ्रमित होने की प्रवृत्ति—रक्षक के लिए एक प्रणालीगत लाभ बन जाती है।

सुरक्षा नेताओं के लिए व्यावहारिक सुझाव

इस रणनीति को लागू करने के लिए, संगठनों को अपने सबसे संवेदनशील डेटा रिपॉजिटरी की पहचान करके शुरुआत करनी चाहिए। ये वे स्थान हैं जहाँ एक एआई एजेंट के क्रेडेंशियल या मालिकाना जानकारी की तलाश करने की सबसे अधिक संभावना है।

  1. अनधिकृत पहुंच की प्रारंभिक चेतावनी प्राप्त करने के लिए अपने आंतरिक नेटवर्क पर कैनरी टोकन तैनात करें।
  2. अपनी संवेदनशील फाइलों और डेटाबेस के मेटाडेटा के भीतर "निषिद्ध विषय" स्ट्रिंग्स एम्बेड करें।
  3. इन स्ट्रिंग्स को उन विशिष्ट एआई मॉडलों के अनुरूप बनाएं जिनके हमले में उपयोग किए जाने की सबसे अधिक संभावना है।
  4. सुनिश्चित करें कि ये कॉन्टेक्स्ट बम इस तरह से छिपे हुए हैं कि वे वैध व्यावसायिक प्रक्रियाओं या मानव उपयोगकर्ताओं के साथ हस्तक्षेप न करें।
  5. यह सुनिश्चित करने के लिए अपने स्वयं के एआई परिनियोजन का ऑडिट करें कि आंतरिक गार्डरेल अपेक्षित रूप से कार्य कर रहे हैं।

यह एआई हैकिंग की समस्या का अंतिम समाधान नहीं है। हमलावरों और रक्षकों के बीच चूहे-बिल्ली का खेल जारी रहेगा क्योंकि नई जेलब्रेकिंग तकनीकें उभरती रहेंगी। हालांकि, फिलहाल के लिए, कॉन्टेक्स्ट बम एक शक्तिशाली उपकरण है जो खेल के मैदान को बराबर करता है। यह मशीन को रुकने और मनुष्यों के पकड़ने की प्रतीक्षा करने के लिए मजबूर करता है।

Sources: NIST AI Risk Management Framework, MITRE ATLAS (Adversarial Threat Landscape for Artificial-Intelligence Systems), Tracebit Research Blog.

Disclaimer: यह लेख केवल सूचनात्मक और शैक्षिक उद्देश्यों के लिए है और पेशेवर साइबर सुरक्षा ऑडिट या घटना प्रतिक्रिया सेवा की जगह नहीं लेता है।

bg
bg
bg

आप दूसरी तरफ देखिए।

हमारा एंड-टू-एंड एन्क्रिप्टेड ईमेल और क्लाउड स्टोरेज समाधान सुरक्षित डेटा एक्सचेंज का सबसे शक्तिशाली माध्यम प्रदान करता है, जो आपके डेटा की सुरक्षा और गोपनीयता सुनिश्चित करता है।

/ एक नि: शुल्क खाता बनाएं