साइबर सुरक्षा
एआई प्रशिक्षण डेटा को सुरक्षित करने के लिए कैसे
कृत्रिम बुद्धिमत्ता (एआई) को डेटा की आवश्यकता होती है और बहुत सारा डेटा। आवश्यक जानकारी इकट्ठा करना हमेशा एक चुनौती नहीं है, आज के वातावरण में कई सार्वजनिक डेटासेट उपलब्ध हैं और प्रतिदिन इतना सारा डेटा उत्पन्न होता है। हालांकि, इसे सुरक्षित करना एक और मामला है।
एआई प्रशिक्षण डेटासेट का विशाल आकार और एआई मॉडल का प्रभाव साइबर अपराधियों को आकर्षित करता है। जैसे ही एआई पर निर्भरता बढ़ती है, इस प्रौद्योगिकी को विकसित करने वाली टीमें सावधानी बरतनी चाहिए ताकि वे अपने प्रशिक्षण डेटा को सुरक्षित रखें।
एआई प्रशिक्षण डेटा को बेहतर सुरक्षा की आवश्यकता क्यों है
आप जिस डेटा का उपयोग एआई मॉडल को प्रशिक्षित करने के लिए करते हैं, वह वास्तविक दुनिया के लोगों, व्यवसायों या घटनाओं को प्रतिबिंबित कर सकता है। इसके परिणामस्वरूप, आप व्यक्तिगत रूप से पहचान योग्य जानकारी (पीआईआई) का एक महत्वपूर्ण राशि प्रबंधित कर सकते हैं, जो यदि उजागर हो जाए तो महत्वपूर्ण गोपनीयता उल्लंघन का कारण बन सकता है। 2023 में, माइक्रोसॉफ्ट ने एक ऐसी घटना का सामना किया, जिसमें उन्होंने अनजाने में एक एआई अनुसंधान परियोजना के दौरान 38 टेराबाइट्स की निजी जानकारी को उजागर कर दिया।
एआई प्रशिक्षण डेटासेट विषाक्तता हमलों के लिए भी अधिक हानिकारक हो सकते हैं। साइबर अपराधी यदि डेटा तक पहुंच प्राप्त कर सकते हैं, तो वे एक मशीन लर्निंग मॉडल की विश्वसनीयता को उसके प्रशिक्षण डेटा को बदलकर बदल सकते हैं। यह एक हमला प्रकार है जिसे डेटा विषाक्तता के रूप में जाना जाता है, और एआई विकासकर्ता तब तक इसके प्रभावों को नहीं देख सकते जब तक यह बहुत देर नहीं हो जाती।
शोध से पता चलता है कि केवल 0.001% डेटासेट को विषाक्त करना एक एआई मॉडल को भ्रष्ट करने के लिए पर्याप्त है। उचित सुरक्षा के बिना, इस तरह का हमला वास्तविक दुनिया में लागू होने पर गंभीर परिणामों का कारण बन सकता है। उदाहरण के लिए, एक भ्रष्ट स्व-ड्राइविंग अल्गोरिदम पैदल यात्रियों को नहीं देख पाएगा। वैकल्पिक रूप से, एक रिज्यूम-स्कैनिंग एआई टूल पक्षपातपूर्ण परिणाम उत्पन्न कर सकता है।
कम गंभीर परिस्थितियों में, हमलावर प्रशिक्षण डेटासेट से व्यावसायिक जासूसी के एक कार्य में स्वामित्व जानकारी चोरी कर सकते हैं। वे अधिकृत उपयोगकर्ताओं को डेटाबेस से बाहर रख सकते हैं और फिरौती की मांग कर सकते हैं।
जैसे ही एआई जीवन और व्यवसाय के लिए बढ़ती महत्वपूर्ण होती जा रही है, साइबर अपराधी प्रशिक्षण डेटाबेस को लक्षित करके अधिक लाभ प्राप्त कर सकते हैं। इन सभी जोखिमों के परिणामस्वरूप, यह और भी चिंताजनक हो जाता है।
एआई प्रशिक्षण डेटा को सुरक्षित करने के 5 चरण
इन खतरों के मद्देनजर, एआई मॉडल को प्रशिक्षित करते समय सुरक्षा को गंभीरता से लें। अपने एआई प्रशिक्षण डेटा को सुरक्षित करने के लिए यहां पांच चरण दिए गए हैं।
1. प्रशिक्षण डेटासेट में संवेदनशील जानकारी को कम करें
सबसे महत्वपूर्ण उपायों में से एक यह है कि अपने प्रशिक्षण डेटासेट में संवेदनशील विवरण की मात्रा को कम करें। आपके डेटाबेस में पीआईआई या अन्य मूल्यवान जानकारी जितनी कम होगी, उतनी ही कम यह हैकर्स के लिए एक लक्ष्य होगी। यदि ऐसा होता है, तो एक उल्लंघन होने पर इसका प्रभाव भी कम होगा।
एआई मॉडल अक्सर प्रशिक्षण चरण के दौरान वास्तविक दुनिया की जानकारी का उपयोग नहीं करते हैं। सिंथेटिक डेटा एक मूल्यवान विकल्प है। सिंथेटिक डेटा पर प्रशिक्षित मॉडल उतना ही सटीक या अधिक सटीक हो सकते हैं जितना कि अन्य, इसलिए आपको प्रदर्शन समस्याओं के बारे में चिंतित नहीं होना चाहिए। बस सुनिश्चित करें कि उत्पन्न डेटासेट वास्तविक दुनिया के डेटा की तरह दिखता है और कार्य करता है।
वैकल्पिक रूप से, आप मौजूदा डेटासेट से संवेदनशील विवरण जैसे लोगों के नाम, पते और वित्तीय जानकारी को मिटा सकते हैं। जब ऐसे कारक आपके मॉडल के लिए आवश्यक होते हैं, तो उन्हें स्टैंड-इन डमी डेटा से बदलने या रिकॉर्ड के बीच उन्हें स्वैप करने पर विचार करें।
2. प्रशिक्षण डेटा तक पहुंच को प्रतिबंधित करें
एक बार जब आप अपना प्रशिक्षण डेटासेट इकट्ठा कर लें, तो आपको इसके लिए पहुंच को प्रतिबंधित करना होगा। न्यूनतम विशेषाधिकार के सिद्धांत का पालन करें, जो कहता है कि किसी भी उपयोगकर्ता या कार्यक्रम को केवल इतनी ही पहुंच होनी चाहिए जो अपना काम सही ढंग से पूरा करने के लिए आवश्यक हो। प्रशिक्षण प्रक्रिया में शामिल न होने वाले किसी को भी डेटाबेस देखने या उसके साथ बातचीत करने की आवश्यकता नहीं है।
याद रखें कि विशेषाधिकार प्रतिबंध केवल तभी प्रभावी होते हैं जब आप उपयोगकर्ताओं को सत्यापित करने के लिए एक विश्वसनीय तरीका लागू करते हैं। एक उपयोगकर्ता नाम और पासवर्ड पर्याप्त नहीं है। बहु-कारक प्रमाणीकरण (एमएफए) आवश्यक है, क्योंकि यह सभी हमलों में से 80% से 90% को रोकता है, लेकिन सभी एमएफए विधियां समान नहीं हैं। टेक्स्ट-आधारित और ऐप-आधारित एमएफए आमतौर पर ईमेल-आधारित विकल्पों की तुलना में सुरक्षित होते हैं।
सॉफ्टवेयर और डिवाइसों को भी प्रतिबंधित करें, न कि केवल उपयोगकर्ताओं को। प्रशिक्षण डेटाबेस तक पहुंच वाले एकमात्र उपकरण एआई मॉडल खुद और प्रशिक्षण के दौरान इनसाइट्स को प्रबंधित करने के लिए आपके द्वारा उपयोग किए जाने वाले कार्यक्रम होने चाहिए।
3. डेटा को एन्क्रिप्ट और बैक अप करें
एन्क्रिप्शन एक और महत्वपूर्ण सुरक्षा उपाय है। जबकि सभी मशीन लर्निंग अल्गोरिदम एन्क्रिप्टेड डेटा पर सक्रिय रूप से प्रशिक्षित नहीं हो सकते हैं, आप इसे विश्लेषण के दौरान एन्क्रिप्ट और डिक्रिप्ट कर सकते हैं। फिर, जब आप समाप्त कर लें, तो आप इसे फिर से एन्क्रिप्ट कर सकते हैं। वैकल्पिक रूप से, उन मॉडल संरचनाओं की जांच करें जो एन्क्रिप्टेड होने पर जानकारी का विश्लेषण कर सकते हैं।
कुछ भी होने पर अपने प्रशिक्षण डेटा का बैकअप रखना महत्वपूर्ण है। बैकअप प्राथमिक प्रति के स्थान से अलग स्थान पर होना चाहिए। आपके डेटासेट कितना महत्वपूर्ण है, इसके आधार पर आपको एक ऑफलाइन बैकअप और एक क्लाउड में रखने की आवश्यकता हो सकती है। याद रखें कि सभी बैकअप को भी एन्क्रिप्ट करें।
जब एन्क्रिप्शन की बात आती है, तो अपनी विधि का चयन सावधानी से करें। उच्च मानक हमेशा पसंदीदा होते हैं, लेकिन आप क्वांटम प्रतिरोधी क्रिप्टोग्राफी अल्गोरिदम पर विचार करना चाह सकते हैं क्योंकि क्वांटम हमलों का खतरा बढ़ रहा है।
4. पहुंच और उपयोग की निगरानी करें
यहां तक कि अगर आप इन अन्य चरणों का पालन करते हैं, तो साइबर अपराधी आपकी रक्षा को तोड़ सकते हैं। इसके परिणामस्वरूप, आपको अपने एआई प्रशिक्षण डेटा के साथ पहुंच और उपयोग पैटर्न की निरंतर निगरानी करनी चाहिए।
यहां एक स्वचालित निगरानी समाधान आवश्यक होने की संभावना है, क्योंकि कुछ संगठनों के पास हर समय संदिग्ध गतिविधि की निगरानी के लिए कर्मचारी नहीं हैं। स्वचालन भी किसी असामान्य बात होने पर कार्रवाई करने में बहुत तेज है, जिससे औसतन $2.22 कम डेटा उल्लंघन लागत होती है जो तेजी से और अधिक प्रभावी प्रतिक्रियाओं से होती है।
हर बार जब कोई या कुछ डेटासेट तक पहुंचता है, अनुरोध करता है, इसे बदलता है या इसके साथ किसी अन्य तरीके से बातचीत करता है, तो रिकॉर्ड करें। संभावित उल्लंघनों के लिए इस गतिविधि की निगरानी करने के अलावा, नियमित रूप से बड़े रुझानों के लिए इसकी समीक्षा करें। अधिकृत उपयोगकर्ताओं का व्यवहार समय के साथ बदल सकता है, जो आपके पहुंच अनुमतियों या व्यवहार बायोमेट्रिक्स में बदलाव की आवश्यकता हो सकती है यदि आप ऐसी प्रणाली का उपयोग करते हैं।
5. जोखिमों का नियमित रूप से पुनर्मूल्यांकन करें
इसी तरह, एआई डेवेलपर्स को यह महसूस करना चाहिए कि साइबर सुरक्षा एक निरंतर प्रक्रिया है, न कि एक बार का समाधान। हमलों के तरीके तेजी से विकसित होते हैं – कुछ कमजोरियां और खतरे आपको इसके बारे में पता लगाने से पहले ही दरारें में फिट हो सकते हैं। सुरक्षित रहने का एकमात्र तरीका अपनी सुरक्षा मुद्रा का नियमित रूप से पुनर्मूल्यांकन करना है।
कम से कम एक बार साल में, अपने एआई मॉडल, इसके प्रशिक्षण डेटा और किसी भी सुरक्षा घटना की समीक्षा करें जो दोनों को प्रभावित करती है। डेटासेट और अल्गोरिदम को ऑडिट करें ताकि यह सुनिश्चित हो सके कि यह सही ढंग से काम कर रहा है और कोई जहरीला, भ्रामक या हानिकारक डेटा मौजूद नहीं है। आवश्यकतानुसार अपने सुरक्षा नियंत्रणों को किसी भी असामान्य बात पर समायोजित करें।
पेनेट्रेशन टेस्टिंग, जहां सुरक्षा विशेषज्ञ आपकी रक्षा को तोड़ने की कोशिश करते हैं, भी फायदेमंद है। 17% से कम साइबर सुरक्षा पेशेवर कम से कम सालाना पेन टेस्ट करते हैं, और जो लोग ऐसा करते हैं उनमें से 72% का मानना है कि इससे उनके संगठन में उल्लंघन रोका गया है।
साइबर सुरक्षा सुरक्षित एआई विकास की कुंजी है
नैतिक और सुरक्षित एआई विकास मशीन लर्निंग पर निर्भरता के आसपास के संभावित मुद्दों के बढ़ते प्रभाव के साथ तेजी से महत्वपूर्ण होता जा रहा है। अपने प्रशिक्षण डेटाबेस को सुरक्षित करना इस मांग को पूरा करने के लिए एक महत्वपूर्ण कदम है।
एआई प्रशिक्षण डेटा बहुत मूल्यवान और साइबर जोखिमों को नजरअंदाज करने के लिए बहुत कमजोर है। आज ही इन पांच चरणों का पालन करें ताकि आपका मॉडल और उसका डेटासेट सुरक्षित रहें।












